AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션
엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

실시간 음성-텍스트 변환 모델 Gemini 3.5 Transcribe가 출시되었다. Chirp 3 대비 전사 속도를 70% 개선하고 FLEURS 벤치마크에서 5%대 WER을 기록했다. 실시간 음성 에이전트나 분석 파이프라인 구축 개발자는 모드별 WER

토큰 단위 신호를 보존하는 멀티벡터 모델이 범용 단일 벡터 모델의 검색 성능을 상회한다. RTX 3090 1대로 14.5시간 학습한 의료 모델이 기존 dense, sparse 모델보다 높은 성능을 기록했다. 도메인 특화 모델 구축 시 완결된 체크포인트

온라인 여행사 loveholidays가 Codex를 도입해 비개발 직군의 직접 개발 및 배포 체계를 구축했다. AI 지원 코드 변경 비중이 7%에서 79%로 증가했으며, 배포 횟수는 인원 충원 없이 73% 늘었다. 엔지니어링 베스트 프랙티스를 AI 워

@dataclass 데코레이터를 통해 __init__, __repr__ 등 반복적인 상용구 코드를 자동 생성한다. slots=True 설정으로 인스턴스 __dict__ 오버헤드를 제거해 수 MB의 메모리를 절감한다. 대규모 데이터 처리 파이프라인 설계

Amazon Quick Desktop과 FSx for ONTAP을 연동해 거버넌스가 적용된 AI 보고서 자동화 워크플로우를 공개했다. S3 액세스 포인트와 IAM 권한 제어로 승인된 폴더의 데이터만 지식 베이스로 구축해 보고서 작성 시간을 시간 단위에

AI 에이전트가 분석한 결과물을 별도 브라우저 없이 IDE 채팅창에서 즉시 시각적으로 검증할 수 있다. 로컬 MCP 서버와 OpenSearch UI를 통해 텍스트 요약과 인터랙티브 위젯을 동시에 받는 듀얼 응답 패턴을 사용한다. 로컬 제어권과 비용 효

OpenAI가 첫 커스텀 추론 칩 Jalapeño를 공개하며 전력 효율과 응답 속도를 동시에 개선했다. 전력당 작업량 최대 1.9배 증가, 지연시간 최대 3.6배 감소를 달성했으며 모델 규모가 클수록 효율이 높아진다. 추론 비용 절감과 에이전트 성능

OpenAI가 첫 자체 추론 칩 Jalapeño와 통합 컴퓨팅 전략을 발표했다. InferenceX 벤치마크에서 상용 시스템 대비 전력당 처리량과 지연 시간을 개선했다. 자체 칩 도입으로 인한 추론 비용 하락과 GPT-5.6 Sol의 토큰 효율성을 확

NVIDIA가 AI 에이전트와 고성능 게이밍을 통합한 RTX Spark 플랫폼을 올가을 출시한다. EA, 유비소프트 등 주요 퍼블리셔가 참여하며 DLSS, Reflex 및 EA Javelin 안티치트 기능을 지원한다. 윈도우 PC 기반 AI 및 게이밍

구글 검색이 AI 모드와 Search Live를 포함한 5가지 AI 도구로 홈 데코의 탐색부터 설치까지의 과정을 통합했다. 공간 사진 기반 가구 배치 시뮬레이션, 실시간 비디오 DIY 가이드, 가격 이력 추적 기능을 제공한다. 시각적 컨텍스트를 입력값

ChatGPT Work와 Codex에서 워크스페이스 관리 기능을 대화형으로 처리하는 Admin 플러그인을 출시했다. 권한 부여, 사용량 분석, Slack·Teams 연동 자동화를 별도 도구 전환 없이 한 곳에서 수행한다. 워크스페이스 관리자는 설정 메

IBM이 추론 능력을 강화한 Granite 4.2 모델 3종(3B, 8B, 30B)을 공개했다. 15조 개의 토큰 학습과 다단계 강화학습(RL)을 통해 512K 컨텍스트 창과 도구 사용 능력을 확보했다. 에이전트 구현을 위해 도구 호출과 코드 실행이

IBM이 470M 파라미터 규모의 초고속 음성 인식 모델 Granite Speech 5.0 Turbo CTC를 공개했다. H200 GPU 기준 12,600 RTFx 이상의 처리 속도와 4.85~5.00%의 WER(단어 오류율)을 기록했다. 엣지 디바이

QAH(Quantization-Aware Healing)를 통해 구조적 압축과 4비트 양자화를 거친 모델이 원본 모델의 성능을 추월했다. 원본 모델에서 직접 증류하여 60B 모델이 120B 원본의 LiveCodeBench 점수를 넘겼으며, QAT 대비

OpenAI가 이스라엘 소재 가짜 연구소 IBI를 홍보한 러시아발 ChatGPT 계정들을 차단했다. 러시아어 프롬프트로 영어 게시물을 생성하고 VPN으로 접속 제한을 우회하며 '주권 지수' 등의 허위 정보를 유포했다. AI 실무자는 LLM을 이용한 정

데이터 생성 속도를 따라가지 못하는 수동 메타데이터 표준화 작업을 AI 기반 자동화 워크플로우로 전환했다. Amazon Bedrock의 LLM과 계층적 추천 구조를 통해 비용 효율적인 스키마 정렬과 필드 보정을 수행한다. 데이터 엔지니어는 비용 최적화

Gradio가 노드 기반의 워크플로우 설계 도구인 gr.Workflow를 공개했다. 드래그 앤 드롭으로 구성한 그래프가 즉시 REST API와 HF Spaces 배포 환경으로 전환된다. 복잡한 AI 파이프라인을 구축하려는 엔지니어는 출력 노드별 API

전화번호만으로 메뉴 안내부터 주문 확정까지 처리하는 AI 호스트 시스템을 구축했다. Amazon Connect Agentic Voice와 MCP 표준을 통해 전화망과 레스토랑 백엔드를 직접 연결했다. 전화망 기반의 사용자 식별 방식과 백엔드 분리 구조

AWS 서비스 기반 지식관리 시스템이 문서 업로드만으로 음성·텍스트 조회를 지원한다. Amazon Bedrock 지식 기반이 문서를 청크·임베딩해 답변을 자체 문서에 묶고, DynamoDB 캐시가 반복 질문 비용을 줄인다. 도입 전에 OpenSearc

에이전트 AI 워크로드에서 전력당 처리량을 최대 30배 높인 NVIDIA Vera Rubin NVL72를 공개했다. NVFP4 양자화와 6세대 NVLink를 통해 GB300 NVL72 대비 토큰당 비용을 최대 35배 절감했다. 전력 제한이 엄격한 AI

SageMaker HyperPod가 Ray 프레임워크 통합 기능을 출시했다. 콘솔에서 클러스터 생성부터 모니터링까지 YAML 설정 없이 수행 가능하다. 인프라 운영 공수를 줄이고 모델 학습·서빙에 집중하려는 ML 엔지니어는 도입 조건을 확인해야 한다.

AI 에이전트와 도구가 급증하며 파편화된 리소스를 통합 검색할 오픈 표준 ARD가 공개되었다. DNS처럼 서로 다른 레지스트리를 연동하는 연합 구조를 통해 중복 설정 없이 리소스를 발견한다. 멀티 클라우드나 온프레미스 환경에서 에이전트를 운영하는 엔지

NVIDIA Groq 3 LPX 정식 생산으로 에이전트 AI를 위한 초고속 토큰 생성 인프라를 공개했다. Gemma 4 31B 기준 10만 토큰 컨텍스트에서 초당 3,400토큰을 출력하며 기존 플랫폼 대비 4배 빠른 성능을 기록했다. 실시간 상호작용이

1B~13B 규모의 소형 언어 모델(SLM)을 로컬에 구축해 데이터 유출 없이 사용할 수 있다. Ollama를 통해 GGUF 포맷 모델을 배포하며, 7B 모델 기준 4비트 양자화 시 약 8GB의 메모리가 필요하다. 데이터 보안이 중요하거나 토큰 비용

Grok 4.6 기반의 터미널 에이전트 Grok Build가 데이터 생성부터 클라우드 배포까지 전 과정을 자동화했다. 4회의 프롬프트로 데이터 정제, 모델 학습(Gradient Boosting R² 0.934), FastAPI 배포를 완수했다. 터미널

EPFL MICROBS 연구팀이 소리 에너지를 추진력으로 변환하는 중공 구조 로봇을 공개했다. 헬름홀츠 공명을 이용해 모터 없이 150마이크로그램 비행체를 띄우고 13,000RPM의 회전력을 만들었다. 전원 장치 없이 무선으로 구동되는 초소형 액추에이

환경 변화 속에서도 로봇의 행동 신뢰성을 유지하는 파운데이션 월드 모델 연구 방향을 제시한다. 강화학습의 유연성과 정형 기법의 검증력을 결합해 모델의 신뢰 범위를 정량적으로 측정하고 업데이트한다. 물리 AI 실무자는 모델의 평균 예측 오차율보다 특정

RAG의 입력 토큰 비용을 줄이기 위해 소형 모델로 컨텍스트를 먼저 압축하는 패턴을 공개했다. Claude Haiku를 활용해 토큰 수를 최대 10.1배 줄였으며, 비용은 최대 36% 절감하고 환각률은 51%에서 38%로 낮췄다. 대규모 RAG 운영

AI가 단순 답변을 넘어 계획과 실행을 스스로 수행하는 에이전트 시대로 전환됐다. 물류, 개발, 고객 서비스 등 5개 분야에서 루틴한 실행 단계를 자동화해 생산성을 높였다. 실무자는 단순 실행에서 벗어나 감독과 전략적 결정 역할로 전환하는 경로를 확인

Muse Glimmer를 llama.cpp와 DFlash로 구동해 로컬 자율 코딩 환경을 구축했다. 추측 디코딩 적용 시 최대 127 tokens/sec의 속도로 FastAPI 프로젝트를 2분 만에 완성했다. RTX 3090 이상의 GPU 사용자는 데