KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 90 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 46 pt3. gpt-oss-120b (high) 39 pt4. GPT-5.6 Luna (max) 27 pt5. GPT-5.6 Terra (max) 22 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

Amazon Bedrock에 상륙한 OpenAI GPT-5.6, 세 가지 모델로 비용과 성능 최적화

Amazon Bedrock에 상륙한 OpenAI GPT-5.6, 세 가지 모델로 비용과 성능 최적화

OpenAI GPT-5.6 Sol, Terra, Luna 모델이 Amazon Bedrock에서 정식 출시되었다. 272K 컨텍스트 윈도우와 프롬프트 캐싱을 통한 입력 토큰 90% 비용 절감을 지원한다. AWS 인프라 내에서 OpenAI 모델을 도입하려

에이전트 88%가 배포에 실패하는 이유와 이를 해결할 5가지 설계 원칙

에이전트 88%가 배포에 실패하는 이유와 이를 해결할 5가지 설계 원칙

단순 챗봇을 넘어 실행력을 갖춘 에이전트를 구현하려면 모델 성능보다 5가지 엔지니어링 개념의 이해가 필수적이다. MCP의 월 다운로드 9,700만 건 달성과 ReAct 루프 같은 구조적 설계가 에이전트의 실질적 동작을 결정한다. 실무자는 모델 교체보다

단순 점수 대신 '어디가 틀렸나' 짚어내는 LLM 환각 탐지 GraphEval

단순 점수 대신 '어디가 틀렸나' 짚어내는 LLM 환각 탐지 GraphEval

아마존 연구진이 LLM 환각의 위치를 정확히 찾아내는 GraphEval 프레임워크를 제안했다. 응답을 지식 그래프로 변환한 뒤 NLI 모델로 사실 관계를 검증하는 2단계 구조로 작동한다. RAG 시스템 구축 시 단순 정확도 점수보다 구체적인 오류 지점

0.2mm 오차 잡는 와인 코르크 크기 로봇, 치과 크라운 준비 자동화

0.2mm 오차 잡는 와인 코르크 크기 로봇, 치과 크라운 준비 자동화

바젤 대학 연구팀이 치아 크라운 준비를 자동화하는 초소형 구강 로봇 MIR을 공개했다. 43x26x28mm 크기의 본체로 센서 없이 0.2mm 미만의 위치 오차와 5N 이하의 하중을 구현했다. 의료 로봇 도입을 검토하는 실무자는 센서 통합 전후의 정밀

Deep인프라 지표가 놓치는 '침묵의 실패'를 찾는 Amazon Bedrock AgentCore 최적화

인프라 지표가 놓치는 '침묵의 실패'를 찾는 Amazon Bedrock AgentCore 최적화

시스템 지표는 정상이지만 결과가 틀린 AI 에이전트의 '침묵의 실패' 탐지 기능을 제공한다. 11가지 행동 실패 유형 분류와 실행 그래프 기반의 근본 원인 분석(RCA)으로 오류 패턴을 도출한다. 에이전트 운영자는 대시보드의 성공률 수치 대신 실제 사

"데이터 이동 없이 통합 뷰", QuickSight에 Highcharts를 심어 해결하는 다국가 시각화

"데이터 이동 없이 통합 뷰", QuickSight에 Highcharts를 심어 해결하는 다국가 시각화

Amazon QuickSight의 기본 차트로 구현하기 힘든 다국가·다구조 성능 데이터를 Highcharts 커스텀 비주얼로 통합했다. 연합 데이터셋(Federated Dataset) 구조를 통해 원본 데이터의 지역 이동 없이 집계된 지표만 결합해 G

IT 대기 없이 실시간 데이터 분석, 제프리스의 AI 트레이드 어시스턴트 도입 사례

IT 대기 없이 실시간 데이터 분석, 제프리스의 AI 트레이드 어시스턴트 도입 사례

글로벌 투자은행 제프리스가 트레이더의 데이터 분석 병목을 해결하기 위해 에이전틱 AI 어시스턴트를 도입했다. Strands Agents와 MCP를 통해 자연어를 SQL로 변환하고 인메모리 DB에서 실시간으로 결과를 도출한다. 금융 AI 도입 시 데이터

Amazon Bedrock 가드레일, 코드 생성 시 '스로틀링'과 비용 줄이는 최적화 전략

Amazon Bedrock 가드레일, 코드 생성 시 '스로틀링'과 비용 줄이는 최적화 전략

코드 생성 워크플로우에 Amazon Bedrock 가드레일을 적용할 때 발생하는 성능 저하와 비용 문제를 해결하는 최적화 방안을 공개했다. 텍스트 단위(1,000자)와 활성 가드레일 수의 곱으로 계산되는 과금 구조와 인라인 스캔의 비효율성을 분석했다.

오답률 1/8에서 1/50로 낮춘 Motorway의 AI 에이전트 평가 파이프라인

오답률 1/8에서 1/50로 낮춘 Motorway의 AI 에이전트 평가 파이프라인

Motorway가 AWS와 협력해 AI 딜러 재고 검색 에이전트의 엔드투엔드 평가 파이프라인을 구축했다. 3계층 평가 프레임워크와 pass^k 지표를 도입해 오답률을 1/8에서 1/50으로 낮추고 이슈 탐지 시간을 수 분으로 단축했다. 실무자는 단순

아마존 베드락, 복합 질문 해결하는 '에이전틱 리트리벌'로 검색 리콜 20% 높였다

아마존 베드락, 복합 질문 해결하는 '에이전틱 리트리벌'로 검색 리콜 20% 높였다

복합 질문과 비교 분석에 최적화된 Agentic Retrieval 기능을 공개했다. 계획 루프를 통해 질문을 분해하고 최대 5개 지식베이스를 라우팅하며 리콜을 20% 개선했다. 질문의 복잡도와 비용 예산에 따라 Retrieve와 AgenticRetri

646개 언어 지원하는 로컬 음성 AI OmniVoice Studio, 비용 0원으로 구축하는 법

646개 언어 지원하는 로컬 음성 AI OmniVoice Studio, 비용 0원으로 구축하는 법

ElevenLabs의 오픈소스 대안인 OmniVoice Studio가 모든 프로세스를 로컬에서 실행하는 방식으로 공개되었다. 646개 언어를 지원하며 Tauri와 FastAPI 기반 구조로 GPU 가속 및 CPU 실행 환경을 자동 감지한다. 데이터 보

RTX 5080 성능 선택으로 다운로드 없이 즐기는 최신 게임 9종 업데이트

RTX 5080 성능 선택으로 다운로드 없이 즐기는 최신 게임 9종 업데이트

GeForce NOW가 Path of Exile 신규 확장팩과 Battlefield 6 시즌 4를 포함한 게임 9종을 업데이트했다. Ultimate 멤버는 RTX 5080 기반의 고성능 스트리밍으로 설치와 패치 대기 없이 즉시 실행 가능하다. 저사양

Claude Code의 비용 부담을 줄이는 7가지 CLI 코딩 에이전트 선택지

Claude Code의 비용 부담을 줄이는 7가지 CLI 코딩 에이전트 선택지

Claude Code의 대안으로 모델 선택권과 제어력이 높은 7가지 CLI 에이전트가 확인됐다. 오픈소스 기반의 Pi와 OpenCode부터 ChatGPT 구독자를 위한 Codex CLI까지 비용과 워크플로에 따라 선택지가 갈린다. 구독 비용 절감이 우

Diffusers에 통합된 Nunchaku Lite, VRAM 50% 절감하고 속도는 30% 높였다

Diffusers에 통합된 Nunchaku Lite, VRAM 50% 절감하고 속도는 30% 높였다

Nunchaku Lite가 Diffusers에 통합되어 별도 라이브러리 없이 4비트 가중치-활성화(W4A4) 추론이 가능하다. RTX 5090 기준 VRAM 사용량을 24GB에서 12GB로 줄였으며, torch.compile 적용 시 최대 1.8배 속

Deep150만 명이 수강한 구글-캐글의 AI 에이전트 5일 완성 실무 가이드

150만 명이 수강한 구글-캐글의 AI 에이전트 5일 완성 실무 가이드

150만 명 이상이 신청하고 1.1만 건의 결과물을 낸 구글-캐글의 AI 에이전트 집중 과정이 무료로 공개됐다. Gemini와 Agent Development Kit를 통해 에이전트 설계부터 Vertex AI Agent Engine 배포까지 5단계로

 "연구 생산성 10년 내 2배", OpenAI가 미국 에너지부 Genesis 미션과 추진하는 AI 통합

"연구 생산성 10년 내 2배", OpenAI가 미국 에너지부 Genesis 미션과 추진하는 AI 통합

OpenAI가 미국 에너지부(DOE)의 Genesis 미션에 합류해 프론티어 모델을 국가 과학 전략 인프라로 통합한다. 17개 국립연구소 데이터와 Venado 슈퍼컴퓨터 등에 추론 모델을 배치해 10년 내 연구 생산성을 2배로 높이는 것이 목표다. 연

DeepNVIDIA DGX GB300, 미 해군 대학원 학교 도입으로 자체 파운데이션 모델 훈련 환경 구축

NVIDIA DGX GB300, 미 해군 대학원 학교 도입으로 자체 파운데이션 모델 훈련 환경 구축

미 해군 대학원 학교(NPS)에 NVIDIA DGX GB300 슈퍼컴퓨터가 전면 도입됐다. 자체 파운데이션 모델 훈련과 고정밀 시뮬레이션이 가능한 온프레미스 인프라를 구축했다. 대규모 AI 인프라 구축을 준비하는 실무자는 데이터 인프라와 냉각 솔루션

DeepOpenAI의 뉴스 협업, 취재 효율과 비즈니스 모델을 바꾸는 방식

OpenAI의 뉴스 협업, 취재 효율과 비즈니스 모델을 바꾸는 방식

OpenAI가 뉴스 기관과 협력해 취재 효율화와 비즈니스 지속 가능성을 지원한다. 아카이브 검색, 다국어 확장, 데이터 분석 등 뉴스룸과 비즈니스 워크플로우에 AI를 통합했다. 언론사 실무자는 OpenAI Academy의 사례를 통해 도입 범위와 인간

구글 제미나이, 갤럭시 Z 폴드8·플립8서 40개 앱 작업 자동화 구현

구글 제미나이, 갤럭시 Z 폴드8·플립8서 40개 앱 작업 자동화 구현

제미나이 인텔리전스가 갤럭시 신제품에서 40개 이상의 앱을 가로질러 일상 작업을 자동화한다. 화면 인식과 멀티모달 입력을 통해 예약, 주문 등 복잡한 단계를 스스로 처리하고 결과만 보고한다. 신규 기기 사용자는 6개월의 구글 AI 프로 체험권을 통해

구글의 4,000만 달러 투입, DOE 17개 국립연구소의 AI 과학 가속화 범위

구글의 4,000만 달러 투입, DOE 17개 국립연구소의 AI 과학 가속화 범위

구글이 미국 에너지부(DOE)의 제네시스 미션에 4,000만 달러 규모의 AI 토큰과 클라우드 크레딧을 지원한다. AlphaFold 3와 AlphaEvolve 등 과학 전용 모델과 Gemini for Government를 17개 국립연구소에 제공한다.

Anthropic, Claude에 경제 지표 커넥터 공개... AI 활용 데이터 직접 조회 가능

Anthropic, Claude에 경제 지표 커넥터 공개... AI 활용 데이터 직접 조회 가능

Claude에서 AI의 경제적 활용 데이터를 직접 조회할 수 있는 Anthropic 경제 지표 커넥터를 출시했다. 설정 메뉴에서 활성화하면 모든 모델에서 사용 가능하며, Claude 사용 패턴 기반의 데이터를 제공한다. 실무자는 자신의 산업군 내 AI

OpenAI Presence, 전화 상담 75%를 사람 없이 해결한 엔터프라이즈 에이전트 도구

OpenAI Presence, 전화 상담 75%를 사람 없이 해결한 엔터프라이즈 에이전트 도구

기업용 AI 에이전트 배포 및 관리 도구인 OpenAI Presence를 공개했다. 가드레일과 Codex 기반 개선 루프로 자체 전화 상담 이슈의 75%를 자동 해결했다. 셀프 서비스가 아니므로 도입 희망 기업은 계정 팀을 통해 자격 요건을 확인해야

DeepOpenAI, 조지아주에 3.2GW 규모 AI 인프라 '프로젝트 카멜리아' 구축

OpenAI, 조지아주에 3.2GW 규모 AI 인프라 '프로젝트 카멜리아' 구축

OpenAI가 조지아주 에핑햄 카운티에 대규모 데이터센터 프로젝트 카멜리아를 추진한다. 2028~2032년까지 3.2GW 전력을 단계적으로 확보하며 폐쇄 루프 냉각 시스템을 도입한다. 초거대 모델 학습을 위한 전력 수급 규모와 지역 사회 협의 모델을

Deep훈련 시간 5시간을 2분으로 줄이는 NVIDIA 의료 물리 시뮬레이션 프레임워크 공개

훈련 시간 5시간을 2분으로 줄이는 NVIDIA 의료 물리 시뮬레이션 프레임워크 공개

NVIDIA가 의료 로봇 개발을 위한 GPU 가속 의료 물리 시뮬레이션 프레임워크를 오픈소스로 공개했다. 8,192개의 병렬 환경을 통해 로봇 학습 시간을 5시간에서 2분 미만으로 단축하며 해부학적 상호작용을 모델링한다. 의료 로봇 개발자는 시뮬레이션

DeepRTX 4070 Ti Super에서 81tps, Qwythos-9B로 구축하는 로컬 코딩 에이전트

RTX 4070 Ti Super에서 81tps, Qwythos-9B로 구축하는 로컬 코딩 에이전트

Qwythos-9B 모델을 llama.cpp와 Pi로 연결해 API 비용 없는 로컬 코딩 환경을 구축한다. RTX 4070 Ti Super 기준 81.74 tps 속도로 브라우저 게임과 Python CLI 도구를 생성했다. 보유한 GPU VRAM 용량

물리 AI 데이터 부족, NVIDIA와 구글이 협력한 뉴턴 엔진과 시뮬레이션 도구로 해결한다

물리 AI 데이터 부족, NVIDIA와 구글이 협력한 뉴턴 엔진과 시뮬레이션 도구로 해결한다

물리 AI 학습에 필수적인 상호작용 데이터 수집의 비용과 위험을 시뮬레이션으로 대체한다. MuJoCo의 정밀 역학과 Isaac Sim의 고충실도 렌더링을 GPU 병렬화로 가속해 학습 효율을 높인다. 정밀도, 처리량, 시각적 완성도 중 우선순위에 따라

제미나이 3.6 플래시 공개, 출력 토큰 17% 줄여 에이전트 운영비 낮췄다

제미나이 3.6 플래시 공개, 출력 토큰 17% 줄여 에이전트 운영비 낮췄다

구글이 효율성과 속도를 높인 제미나이 3.6 플래시와 3.5 플래시-라이트를 공개했다. 3.6 플래시는 출력 토큰을 17% 절감했고, 3.5 플래시-라이트는 초당 350토큰의 생성 속도를 기록했다. 대규모 AI 에이전트 구축 및 고처리량 워크플로우를

DeepAmazon Nova 2의 SDR, SFT 중 추론 성능 70%에서 6%로 급락하는 문제 해결

Amazon Nova 2의 SDR, SFT 중 추론 성능 70%에서 6%로 급락하는 문제 해결

추론 데이터 없는 SFT 진행 시 모델의 기본 추론 능력이 완전히 상실되는 현상이 확인됐다. 자체 추론 흔적을 재사용하는 SDR 기법으로 타겟 성능을 높이면서 수학 성능을 70% 수준으로 보존한다. CoT 데이터 확보가 어려운 실무자는 모델 병합 대신

400만 달러 GB300 슈퍼칩 대량 생산, 위스트론 텍사스 AI 공장 가동

400만 달러 GB300 슈퍼칩 대량 생산, 위스트론 텍사스 AI 공장 가동

위스트론이 텍사스 포트워스에 7억 달러 규모의 NVIDIA AI 시스템 생산 공장을 개소했다. 디지털 트윈 기술로 최적화한 공정에서 GB300 및 Vera Rubin 슈퍼칩을 월 수만 장 규모로 생산한다. AI 인프라 도입 기업은 하드웨어 공급망의 지

OpenAI, 누뱅크·BNY CEO 영입으로 글로벌 금융 거버넌스 체계 강화

OpenAI, 누뱅크·BNY CEO 영입으로 글로벌 금융 거버넌스 체계 강화

OpenAI가 누뱅크 설립자 다비드 벨레스와 BNY CEO 로빈 빈스를 이사회에 임명했다. 1억 3,500만 고객 규모의 디지털 뱅킹 경험과 240년 전통의 금융 운영 역량을 확보했다. 글로벌 기업 대상 서비스 확장과 규제 산업 내 AI 도입을 준비하