KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 91 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. Wan 3.0 85 pt5. gemini-omni-1.1-flash 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 44 pt3. gpt-oss-120b (high) 36 pt4. GPT-5.6 Luna (max) 28 pt5. GPT-5.6 Terra (max) 21 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

Google, 전사 속도 70% 높인 Gemini 3.5 Transcribe 공개

Google, 전사 속도 70% 높인 Gemini 3.5 Transcribe 공개

실시간 음성-텍스트 변환 모델 Gemini 3.5 Transcribe가 출시되었다. Chirp 3 대비 전사 속도를 70% 개선하고 FLEURS 벤치마크에서 5%대 WER을 기록했다. 실시간 음성 에이전트나 분석 파이프라인 구축 개발자는 모드별 WER

RTX 3090 1대로 14.5시간, 의료 특화 멀티벡터 모델이 일반 모델을 앞선 이유

RTX 3090 1대로 14.5시간, 의료 특화 멀티벡터 모델이 일반 모델을 앞선 이유

토큰 단위 신호를 보존하는 멀티벡터 모델이 범용 단일 벡터 모델의 검색 성능을 상회한다. RTX 3090 1대로 14.5시간 학습한 의료 모델이 기존 dense, sparse 모델보다 높은 성능을 기록했다. 도메인 특화 모델 구축 시 완결된 체크포인트

loveholidays, Codex로 비개발자의 코드 배포 비중 79%까지 확대

loveholidays, Codex로 비개발자의 코드 배포 비중 79%까지 확대

온라인 여행사 loveholidays가 Codex를 도입해 비개발 직군의 직접 개발 및 배포 체계를 구축했다. AI 지원 코드 변경 비중이 7%에서 79%로 증가했으며, 배포 횟수는 인원 충원 없이 73% 늘었다. 엔지니어링 베스트 프랙티스를 AI 워

30줄의 상용구 코드를 단 몇 줄로, Python 데이터 클래스의 메모리 최적화와 실무 구현법

30줄의 상용구 코드를 단 몇 줄로, Python 데이터 클래스의 메모리 최적화와 실무 구현법

@dataclass 데코레이터를 통해 __init__, __repr__ 등 반복적인 상용구 코드를 자동 생성한다. slots=True 설정으로 인스턴스 __dict__ 오버헤드를 제거해 수 MB의 메모리를 절감한다. 대규모 데이터 처리 파이프라인 설계

Amazon Quick Desktop, FSx for ONTAP 연동으로 주간 보고서 작성 시간을 '시간'에서 '분'으로 단축

Amazon Quick Desktop, FSx for ONTAP 연동으로 주간 보고서 작성 시간을 '시간'에서 '분'으로 단축

Amazon Quick Desktop과 FSx for ONTAP을 연동해 거버넌스가 적용된 AI 보고서 자동화 워크플로우를 공개했다. S3 액세스 포인트와 IAM 권한 제어로 승인된 폴더의 데이터만 지식 베이스로 구축해 보고서 작성 시간을 시간 단위에

탭 전환 없는 장애 분석: Amazon OpenSearch MCP Apps가 시각화 데이터를 채팅창에 띄우는 법

탭 전환 없는 장애 분석: Amazon OpenSearch MCP Apps가 시각화 데이터를 채팅창에 띄우는 법

AI 에이전트가 분석한 결과물을 별도 브라우저 없이 IDE 채팅창에서 즉시 시각적으로 검증할 수 있다. 로컬 MCP 서버와 OpenSearch UI를 통해 텍스트 요약과 인터랙티브 위젯을 동시에 받는 듀얼 응답 패턴을 사용한다. 로컬 제어권과 비용 효

OpenAI 첫 추론 칩 Jalapeño, 전력 대비 성능 1.9배 높이고 지연시간 3.6배 줄였다

OpenAI 첫 추론 칩 Jalapeño, 전력 대비 성능 1.9배 높이고 지연시간 3.6배 줄였다

OpenAI가 첫 커스텀 추론 칩 Jalapeño를 공개하며 전력 효율과 응답 속도를 동시에 개선했다. 전력당 작업량 최대 1.9배 증가, 지연시간 최대 3.6배 감소를 달성했으며 모델 규모가 클수록 효율이 높아진다. 추론 비용 절감과 에이전트 성능

OpenAI, 자체 추론 칩 Jalapeño 공개로 연산 효율과 비용 구조 바꾼다

OpenAI, 자체 추론 칩 Jalapeño 공개로 연산 효율과 비용 구조 바꾼다

OpenAI가 첫 자체 추론 칩 Jalapeño와 통합 컴퓨팅 전략을 발표했다. InferenceX 벤치마크에서 상용 시스템 대비 전력당 처리량과 지연 시간을 개선했다. 자체 칩 도입으로 인한 추론 비용 하락과 GPT-5.6 Sol의 토큰 효율성을 확

EA·유비소프트 합류한 NVIDIA RTX Spark, 올가을 윈도우 PC 플랫폼 출시

EA·유비소프트 합류한 NVIDIA RTX Spark, 올가을 윈도우 PC 플랫폼 출시

NVIDIA가 AI 에이전트와 고성능 게이밍을 통합한 RTX Spark 플랫폼을 올가을 출시한다. EA, 유비소프트 등 주요 퍼블리셔가 참여하며 DLSS, Reflex 및 EA Javelin 안티치트 기능을 지원한다. 윈도우 PC 기반 AI 및 게이밍

사진 한 장으로 가구 배치부터 설치까지, 구글 검색의 AI 홈 데코 기능 5종

사진 한 장으로 가구 배치부터 설치까지, 구글 검색의 AI 홈 데코 기능 5종

구글 검색이 AI 모드와 Search Live를 포함한 5가지 AI 도구로 홈 데코의 탐색부터 설치까지의 과정을 통합했다. 공간 사진 기반 가구 배치 시뮬레이션, 실시간 비디오 DIY 가이드, 가격 이력 추적 기능을 제공한다. 시각적 컨텍스트를 입력값

ChatGPT Work·Codex 관리자 플러그인 공개, 대화만으로 권한과 사용량 제어

ChatGPT Work·Codex 관리자 플러그인 공개, 대화만으로 권한과 사용량 제어

ChatGPT Work와 Codex에서 워크스페이스 관리 기능을 대화형으로 처리하는 Admin 플러그인을 출시했다. 권한 부여, 사용량 분석, Slack·Teams 연동 자동화를 별도 도구 전환 없이 한 곳에서 수행한다. 워크스페이스 관리자는 설정 메

IBM Granite 4.2 공개, 15조 토큰 학습과 추론 모드로 에이전트 성능 강화

IBM Granite 4.2 공개, 15조 토큰 학습과 추론 모드로 에이전트 성능 강화

IBM이 추론 능력을 강화한 Granite 4.2 모델 3종(3B, 8B, 30B)을 공개했다. 15조 개의 토큰 학습과 다단계 강화학습(RL)을 통해 512K 컨텍스트 창과 도구 사용 능력을 확보했다. 에이전트 구현을 위해 도구 호출과 코드 실행이

1초에 3.5시간 전사, 12,600 RTFx 달성한 Granite Speech 5.0 Turbo CTC

1초에 3.5시간 전사, 12,600 RTFx 달성한 Granite Speech 5.0 Turbo CTC

IBM이 470M 파라미터 규모의 초고속 음성 인식 모델 Granite Speech 5.0 Turbo CTC를 공개했다. H200 GPU 기준 12,600 RTFx 이상의 처리 속도와 4.85~5.00%의 WER(단어 오류율)을 기록했다. 엣지 디바이

원본 모델 성능을 추월한 4비트 경량화, QAH의 직접 증류 구현

원본 모델 성능을 추월한 4비트 경량화, QAH의 직접 증류 구현

QAH(Quantization-Aware Healing)를 통해 구조적 압축과 4비트 양자화를 거친 모델이 원본 모델의 성능을 추월했다. 원본 모델에서 직접 증류하여 60B 모델이 120B 원본의 LiveCodeBench 점수를 넘겼으며, QAT 대비

VPN과 가짜 연구소로 위장한 러시아의 ChatGPT 영향력 공작 차단

VPN과 가짜 연구소로 위장한 러시아의 ChatGPT 영향력 공작 차단

OpenAI가 이스라엘 소재 가짜 연구소 IBI를 홍보한 러시아발 ChatGPT 계정들을 차단했다. 러시아어 프롬프트로 영어 게시물을 생성하고 VPN으로 접속 제한을 우회하며 '주권 지수' 등의 허위 정보를 유포했다. AI 실무자는 LLM을 이용한 정

AWS 기반 AI 메타데이터 보정 시스템, 수작업 표준화 병목을 자동화로 해결

AWS 기반 AI 메타데이터 보정 시스템, 수작업 표준화 병목을 자동화로 해결

데이터 생성 속도를 따라가지 못하는 수동 메타데이터 표준화 작업을 AI 기반 자동화 워크플로우로 전환했다. Amazon Bedrock의 LLM과 계층적 추천 구조를 통해 비용 효율적인 스키마 정렬과 필드 보정을 수행한다. 데이터 엔지니어는 비용 최적화

Gradio의 gr.Workflow, 파이프라인 설계가 곧 API와 인터페이스가 된다

Gradio의 gr.Workflow, 파이프라인 설계가 곧 API와 인터페이스가 된다

Gradio가 노드 기반의 워크플로우 설계 도구인 gr.Workflow를 공개했다. 드래그 앤 드롭으로 구성한 그래프가 즉시 REST API와 HF Spaces 배포 환경으로 전환된다. 복잡한 AI 파이프라인을 구축하려는 엔지니어는 출력 노드별 API

앱·로그인 없는 AI 전화 주문, Amazon Connect와 MCP 조합으로 구현 가능하다

앱·로그인 없는 AI 전화 주문, Amazon Connect와 MCP 조합으로 구현 가능하다

전화번호만으로 메뉴 안내부터 주문 확정까지 처리하는 AI 호스트 시스템을 구축했다. Amazon Connect Agentic Voice와 MCP 표준을 통해 전화망과 레스토랑 백엔드를 직접 연결했다. 전화망 기반의 사용자 식별 방식과 백엔드 분리 구조

DeepAWS 지식관리 가속기, 음성 아바타로 퇴직 전 노하우를 남긴다

AWS 지식관리 가속기, 음성 아바타로 퇴직 전 노하우를 남긴다

AWS 서비스 기반 지식관리 시스템이 문서 업로드만으로 음성·텍스트 조회를 지원한다. Amazon Bedrock 지식 기반이 문서를 청크·임베딩해 답변을 자체 문서에 묶고, DynamoDB 캐시가 반복 질문 비용을 줄인다. 도입 전에 OpenSearc

Deep전력당 처리량 30배 높인 NVIDIA Vera Rubin NVL72, 에이전트 AI 비용 35배 낮춘다

전력당 처리량 30배 높인 NVIDIA Vera Rubin NVL72, 에이전트 AI 비용 35배 낮춘다

에이전트 AI 워크로드에서 전력당 처리량을 최대 30배 높인 NVIDIA Vera Rubin NVL72를 공개했다. NVFP4 양자화와 6세대 NVLink를 통해 GB300 NVL72 대비 토큰당 비용을 최대 35배 절감했다. 전력 제한이 엄격한 AI

“YAML 없이 클릭으로”, SageMaker HyperPod의 Ray 통합 기능 공개

“YAML 없이 클릭으로”, SageMaker HyperPod의 Ray 통합 기능 공개

SageMaker HyperPod가 Ray 프레임워크 통합 기능을 출시했다. 콘솔에서 클러스터 생성부터 모니터링까지 YAML 설정 없이 수행 가능하다. 인프라 운영 공수를 줄이고 모델 학습·서빙에 집중하려는 ML 엔지니어는 도입 조건을 확인해야 한다.

멀티 클라우드 AI 에이전트 찾기? 답은 오픈 표준 ARD

멀티 클라우드 AI 에이전트 찾기? 답은 오픈 표준 ARD

AI 에이전트와 도구가 급증하며 파편화된 리소스를 통합 검색할 오픈 표준 ARD가 공개되었다. DNS처럼 서로 다른 레지스트리를 연동하는 연합 구조를 통해 중복 설정 없이 리소스를 발견한다. 멀티 클라우드나 온프레미스 환경에서 에이전트를 운영하는 엔지

에이전트 AI의 병목 '디코드 지연', NVIDIA Groq 3 LPX는 어떻게 해결했나?

에이전트 AI의 병목 '디코드 지연', NVIDIA Groq 3 LPX는 어떻게 해결했나?

NVIDIA Groq 3 LPX 정식 생산으로 에이전트 AI를 위한 초고속 토큰 생성 인프라를 공개했다. Gemma 4 31B 기준 10만 토큰 컨텍스트에서 초당 3,400토큰을 출력하며 기존 플랫폼 대비 4배 빠른 성능을 기록했다. 실시간 상호작용이

Deep클라우드 API 대신 로컬 SLM, 하드웨어 사양별 선택과 구축 가이드

클라우드 API 대신 로컬 SLM, 하드웨어 사양별 선택과 구축 가이드

1B~13B 규모의 소형 언어 모델(SLM)을 로컬에 구축해 데이터 유출 없이 사용할 수 있다. Ollama를 통해 GGUF 포맷 모델을 배포하며, 7B 모델 기준 4비트 양자화 시 약 8GB의 메모리가 필요하다. 데이터 보안이 중요하거나 토큰 비용

데이터 분석부터 API 배포까지 4번의 프롬프트로 끝낸 Grok Build의 실무 워크플로

데이터 분석부터 API 배포까지 4번의 프롬프트로 끝낸 Grok Build의 실무 워크플로

Grok 4.6 기반의 터미널 에이전트 Grok Build가 데이터 생성부터 클라우드 배포까지 전 과정을 자동화했다. 4회의 프롬프트로 데이터 정제, 모델 학습(Gradient Boosting R² 0.934), FastAPI 배포를 완수했다. 터미널

Deep소리 진동을 추진력으로 바꾸는 150마이크로그램 초소형 로봇 구현

소리 진동을 추진력으로 바꾸는 150마이크로그램 초소형 로봇 구현

EPFL MICROBS 연구팀이 소리 에너지를 추진력으로 변환하는 중공 구조 로봇을 공개했다. 헬름홀츠 공명을 이용해 모터 없이 150마이크로그램 비행체를 띄우고 13,000RPM의 회전력을 만들었다. 전원 장치 없이 무선으로 구동되는 초소형 액추에이

평균 정확도 대신 '신뢰 보증'을 학습하는 파운데이션 월드 모델의 구조

평균 정확도 대신 '신뢰 보증'을 학습하는 파운데이션 월드 모델의 구조

환경 변화 속에서도 로봇의 행동 신뢰성을 유지하는 파운데이션 월드 모델 연구 방향을 제시한다. 강화학습의 유연성과 정형 기법의 검증력을 결합해 모델의 신뢰 범위를 정량적으로 측정하고 업데이트한다. 물리 AI 실무자는 모델의 평균 예측 오차율보다 특정

DeepAmazon Bedrock RAG 비용 33% 절감하는 쿼리 인식 압축 구현법

Amazon Bedrock RAG 비용 33% 절감하는 쿼리 인식 압축 구현법

RAG의 입력 토큰 비용을 줄이기 위해 소형 모델로 컨텍스트를 먼저 압축하는 패턴을 공개했다. Claude Haiku를 활용해 토큰 수를 최대 10.1배 줄였으며, 비용은 최대 36% 절감하고 환각률은 51%에서 38%로 낮췄다. 대규모 RAG 운영

AI 에이전트가 바꾼 5개 산업의 '실행' 워크플로

AI 에이전트가 바꾼 5개 산업의 '실행' 워크플로

AI가 단순 답변을 넘어 계획과 실행을 스스로 수행하는 에이전트 시대로 전환됐다. 물류, 개발, 고객 서비스 등 5개 분야에서 루틴한 실행 단계를 자동화해 생산성을 높였다. 실무자는 단순 실행에서 벗어나 감독과 전략적 결정 역할로 전환하는 경로를 확인

Muse Glimmer 로컬 구동, 초당 127토큰 속도로 구현하는 자율 코딩 환경

Muse Glimmer 로컬 구동, 초당 127토큰 속도로 구현하는 자율 코딩 환경

Muse Glimmer를 llama.cpp와 DFlash로 구동해 로컬 자율 코딩 환경을 구축했다. 추측 디코딩 적용 시 최대 127 tokens/sec의 속도로 FastAPI 프로젝트를 2분 만에 완성했다. RTX 3090 이상의 GPU 사용자는 데