KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 91 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. Wan 3.0 85 pt5. gemini-omni-1.1-flash 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Gemini 3.8 Flash (high) 66 pt3. Muse Spark 1.3 (max) 46 pt4. gpt-oss-120b (high) 42 pt5. GPT-5.6 Luna (max) 27 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

부품 자립 없인 100만대 보급 불가, KIRO가 추진하는 '피지컬 AI' 실증

부품 자립 없인 100만대 보급 불가, KIRO가 추진하는 '피지컬 AI' 실증

한국로봇융합연구원(KIRO)이 로봇 부품 국산화와 피지컬 AI 실증을 통해 국가 로봇 컨트롤타워 역할을 강화한다. 2030년 로봇 시장 20조 원, 100만 대 보급 목표 달성을 위해 핵심 부품의 해외 의존도를 낮추는 데 집중한다. 제조 AX와 휴머노

손재주보다 '눈치'가 중요해진 시대, 인트봇의 싱가포르 휴머노이드 배치

손재주보다 '눈치'가 중요해진 시대, 인트봇의 싱가포르 휴머노이드 배치

로봇이 공장 펜스를 넘어 호텔과 공항 같은 공공장소로 나오고 있습니다. 미국 인트봇이 싱가포르 서티스 그룹과 협력해 사회적 지능을 갖춘 휴머노이드를 실제 현장에 배치합니다. 단순 작업 수행을 넘어 인간의 의도를 읽고 자연스럽게 반응하는 '피지컬 AI'

Deep170만 건의 에이전트 행동 궤적, AgentTrove로 SFT 데이터셋 구축하기

170만 건의 에이전트 행동 궤적, AgentTrove로 SFT 데이터셋 구축하기

에이전트 학습을 위한 대규모 상호작용 궤적 데이터셋 AgentTrove가 공개됐다. 170만 건의 트레이스를 스트리밍 방식으로 분석해 도구 사용 패턴을 추출한다. 성공한 궤적만 필터링해 ShareGPT 형식의 SFT 데이터셋으로 즉시 변환한다.

텍스트 입력하면 점프하는 토종 로봇, 로보티즈가 푼 '오픈소스' 승부수

텍스트 입력하면 점프하는 토종 로봇, 로보티즈가 푼 '오픈소스' 승부수

로보티즈가 텍스트만으로 전신 동작을 생성하는 휴머노이드 'AI 사피엔스'를 공개했다. 핵심 부품을 100% 국산화하며 글로벌 기술 격차를 1년 이하로 단축하는 성과를 냈다. 중국산 데이터 의존을 끊기 위해 개발 소스를 전면 공개하는 오픈소스 전략을 추

0.19달러로 Claude Opus 4.6 성능 97% 구현한 Step 3.7 Flash

0.19달러로 Claude Opus 4.6 성능 97% 구현한 Step 3.7 Flash

StepFun이 코딩 에이전트용 멀티모달 MoE 모델 Step 3.7 Flash를 공개했다. 네이티브 비전 입력과 어드바이저 모드를 통해 추론 효율을 극대화했다. 작업당 비용을 0.19달러로 낮추면서도 최상위 모델 수준의 코딩 성능을 확보했다.

MCP 도구 오버헤드 85% 줄여 정확도 높인 Hermes Agent

MCP 도구 오버헤드 85% 줄여 정확도 높인 Hermes Agent

AI 에이전트에 연결된 도구가 많아질수록 컨텍스트 윈도우가 낭비되는 'MCP 도구 세금' 문제가 심화되고 있다. Nous Research는 필요한 스키마만 온디맨드로 호출하는 'Tool Search' 기능을 Hermes Agent에 도입했다. Anth

200시간 걸릴 로봇 테스트를 30분 만에 끝내는 Genesis World 1.0

200시간 걸릴 로봇 테스트를 30분 만에 끝내는 Genesis World 1.0

로봇 모델 성능 평가의 병목이었던 반복 속도를 획기적으로 줄였습니다. 물리 엔진, 렌더러, 컴파일러를 통합해 실제와 유사한 가상 세계를 구축했습니다. 실제 데이터로 학습하고 시뮬레이션으로 검증하는 '제로샷 리얼-투-심' 방식을 제안합니다.

구글, AI 튜터로 학습 방식 재설계하는 '퓨처스 랩' 공개

구글, AI 튜터로 학습 방식 재설계하는 '퓨처스 랩' 공개

구글이 워털루 대학과 협력해 AI 교육 프로토타입을 개발하는 퓨처스 랩을 운영한다. 8주 집중 워크숍을 통해 AI 기반 외국어 학습과 수어 튜터 등 실무 도구를 제작했다. 이론을 넘어 실제 교육과 업무 환경을 정의할 기술을 학생들이 직접 공동 창조한다

DeepGPU 사용량과 답변 품질을 한눈에, 아마존 세이지메이커의 LLM 통합 관제

GPU 사용량과 답변 품질을 한눈에, 아마존 세이지메이커의 LLM 통합 관제

LLM은 결과가 매번 달라 일반 소프트웨어처럼 모니터링하기 어렵다. 아마존 세이지메이커는 인프라 성능(양)과 답변 정확도(질)를 동시에 측정하는 체계를 구축했다. 클라우드워치와 그라파나를 연결해 GPU 비용과 모델 품질을 실시간으로 비교 분석한다.

DeepGoogle, 코딩 몰라도 앱 만드는 '바이브 코딩' 공개

Google, 코딩 몰라도 앱 만드는 '바이브 코딩' 공개

Google I/O 2026에서 Google AI Studio의 새로운 활용 방식이 발표됐다. 'Antigravity' 코딩 에이전트가 탑재되어 비개발자도 앱 구현이 가능하다. 실제 코딩 경험이 없는 에디터가 Gemini를 통해 퀴즈 앱을 제작하며 이

보스턴 어린이병원, AI 인프라 도입으로 희귀질환 40건 진단

보스턴 어린이병원, AI 인프라 도입으로 희귀질환 40건 진단

보스턴 어린이병원이 AI를 단순 도구가 아닌 병원 핵심 인프라로 통합했다. 그 결과 과거에 포기했던 희귀질환 40여 건을 새롭게 진단하는 성과를 냈다. 운영 자동화로 6만 시간의 업무 시간을 줄여 700만 달러의 비용을 절감했다.

Deep바이오 위협 방어선 구축하는 OpenAI의 추론 모델 'GPT-로잘린드'

바이오 위협 방어선 구축하는 OpenAI의 추론 모델 'GPT-로잘린드'

AI의 생물학적 역량 강화로 인한 바이오 위협 가능성이 커지고 있다. OpenAI가 생명과학 전용 추론 모델 GPT-로잘린드를 활용한 '로잘린드 바이오디펜스'를 발표했다. 검증된 개발자와 미국 정부 파트너에게 모델 접근권을 부여해 방어 도구 개발을 가

토크나이저 장벽 허물고 성능 올린 엔비디아 X-Token

토크나이저 장벽 허물고 성능 올린 엔비디아 X-Token

서로 다른 토크나이저를 사용하는 모델 간 지식 증류(KD)가 가능해졌다. 엔비디아 X-Token은 투영 행렬 W와 DP 스팬 정렬로 토큰 불일치를 해결한다. Llama-3.2-1B 기준 기존 SOTA인 GOLD 대비 평균 3.82포인트 성능이 향상됐다

백로그 대신 실시간 구현, Braintrust가 Codex로 바꾼 개발 속도

백로그 대신 실시간 구현, Braintrust가 Codex로 바꾼 개발 속도

AI 제품 품질 관리 플랫폼 Braintrust가 Codex(GPT-5.5 기반)를 도입했다. 고객 요청을 대기 명단에 쌓지 않고 몇 분 만에 실제 작동하는 코드로 구현한다. 한 달 만에 팀원 절반이 전환했으며, 테스트 기반의 샌드박스 실험 방식으로

Deep99.8%의 테스트 통과율, Anthropic의 멀티 에이전트 워크플로우 공개

99.8%의 테스트 통과율, Anthropic의 멀티 에이전트 워크플로우 공개

Anthropic이 Claude Opus 4.8과 함께 대규모 병렬 처리가 가능한 다이내믹 워크플로우를 공개했다. 최대 1,000개의 서브 에이전트를 동원해 복잡한 코딩 작업을 자동화하고, 패스트 모드를 통해 추론 비용을 3배 낮췄다. 개발자는 CLI

DeepSDK 없이 쓰는 SageMaker MLflow, AWS가 REST API 프록시 공개

SDK 없이 쓰는 SageMaker MLflow, AWS가 REST API 프록시 공개

기업 보안 정책으로 MLflow SDK 설치가 불가능한 환경이 많다. AWS가 Flask 기반의 REST API 프록시 아키텍처를 공개했다. 이제 SDK 없이 HTTPS 요청만으로 모델 실험과 관리가 가능하다.

Google의 새 엔진, 영상 편집과 에이전트 업무를 바꾸다

Google의 새 엔진, 영상 편집과 에이전트 업무를 바꾸다

Google이 멀티모달 생성 모델 Gemini Omni와 에이전트 특화 모델 Gemini 3.5 Flash를 공개했다. 영상 편집부터 복잡한 워크플로우 자동화까지 AI가 직접 실행하는 실무 능력을 대폭 강화했다. 올여름부터 검색과 워크스페이스에 통합되

엔비디아·존디어·덱스테리티, 토크AGI와 기업용 로봇 AI 협력

엔비디아·존디어·덱스테리티, 토크AGI와 기업용 로봇 AI 협력

토크AGI가 엔비디아, 존디어, 덱스테리티와 전략적 파트너십을 체결했다. 기업용 로봇에 적용할 물리적 AI의 실제 현장 배포를 앞당기는 것이 핵심이다. 칩 제조사와 하드웨어 기업이 모여 로봇의 실전 지능을 구현한다.

구글 I/O 최초 공식 초청, '창구' 졸업사 10곳의 글로벌 무대 입성

구글 I/O 최초 공식 초청, '창구' 졸업사 10곳의 글로벌 무대 입성

구글 I/O에 '창구' 프로그램 졸업사 10곳이 최초로 공식 초청됐다. 구글플레이와 중소벤처기업부, 창업진흥원이 협력해 지원했다. 핵심 임원진과의 프라이빗 밋업을 통해 글로벌 진출 경로를 모색했다.

PyTorch 프로파일러로 분석한 GPU 오버헤드와 연산 병목 지점

PyTorch 프로파일러로 분석한 GPU 오버헤드와 연산 병목 지점

LLM 추론 속도와 학습 효율을 높이려면 벤치마크 수치 너머의 프로파일링이 필수적이다. torch.profiler를 통해 CPU/GPU 실행 시간을 분리하고 연산 오버헤드를 수치화한다. 행렬 크기에 따른 오버헤드-바운드와 컴퓨트-바운드의 전환 지점을

Deep현장 투입 준비 끝 — 대구, 2족 보행 휴머노이드 제조 거점센터 공개

현장 투입 준비 끝 — 대구, 2족 보행 휴머노이드 제조 거점센터 공개

대구시가 제조 공정 디지털 전환을 위한 AI 휴머노이드 로봇 거점센터를 구축했다. 총 23억 7천만 원을 투입해 140cm 크기의 2족 보행 로봇 플랫폼과 실증 기반을 마련했다. 구인난이 심각한 지역 제조업 현장에 즉시 적용 가능한 표준 공정 모델과

RTX 50 시리즈로 구현한 007 — 클라우드 게임으로 진입장벽 허문 엔비디아

RTX 50 시리즈로 구현한 007 — 클라우드 게임으로 진입장벽 허문 엔비디아

엔비디아가 클라우드 게임 서비스 GeForce NOW에 '007 First Light'를 출시했다. RTX 50 시리즈 GPU를 통해 최대 5K HDR의 고화질 스트리밍 환경을 제공한다. 12개월 멤버십 결제 시 게임 제공 및 전용 보상을 통해 유료

Endava, Codex로 시니어 엔지니어의 '판단력'을 제품화하다

Endava, Codex로 시니어 엔지니어의 '판단력'을 제품화하다

글로벌 소프트웨어 기업 Endava가 AI 도구 Codex를 통해 조직 운영 방식을 바꿨다. 시니어의 전문성을 에이전트로 코드화해 주니어 개발자의 생산성을 시니어 수준으로 높였다. 수주 단위의 요구사항 분석 기간을 단 몇 시간의 미팅과 AI 처리로 단

Deep6GB 메모리로 26B 모델 성능 낸다, Liquid AI의 LFM2.5-8B-A1B

6GB 메모리로 26B 모델 성능 낸다, Liquid AI의 LFM2.5-8B-A1B

온디바이스 환경에서 도구 호출과 복잡한 추론을 수행하는 MoE 모델이 공개됐다. LFM2.5-8B-A1B는 8.3B 파라미터 중 1.5B만 활성화해 메모리 점유율을 6GB 미만으로 낮췄다. 128K 컨텍스트 윈도우와 강화학습을 통해 환각률을 낮추고 추

복잡한 AI 에이전트의 신뢰성을 검증하는 4가지 평가 패턴

복잡한 AI 에이전트의 신뢰성을 검증하는 4가지 평가 패턴

AI 에이전트의 비결정적 특성으로 인해 프로덕션 배포 전 검증이 어려워지고 있다. LangSmith와 AWS를 결합해 에이전트의 추론 과정을 단계별로 평가하는 체계를 구축한다. 단순 LLM 평가를 넘어 에이전트의 도구 사용과 다단계 실행을 정밀하게

Google I/O 2026: 검색을 넘어 일상을 수행하는 AI 에이전트의 시대

Google I/O 2026: 검색을 넘어 일상을 수행하는 AI 에이전트의 시대

Google이 I/O 2026에서 검색과 앱을 스스로 조작하는 에이전트 모델을 공개했다. Gemini Omni와 3.5 Flash를 통해 영상 생성부터 실시간 업무 처리가 가능해졌다. 사용자의 이메일과 일정을 관리하는 개인화된 AI 에이전트 기능이 대

Deep코드 결함 4배 줄였다, 앤스로픽의 클로드 오퍼스 4.8

코드 결함 4배 줄였다, 앤스로픽의 클로드 오퍼스 4.8

앤스로픽이 코딩과 에이전트 성능을 강화한 클로드 오퍼스 4.8을 출시했다. 코드 결함 방치 확률을 4배 낮췄으며 작업 강도 조절 기능을 도입했다. 패스트 모드 속도는 2.5배 빨라졌고 비용은 이전 모델 대비 3배 낮아졌다.

시뮬레이션에서 현실로, 로봇의 학습 한계를 넘은 NVIDIA의 8가지 기술

시뮬레이션에서 현실로, 로봇의 학습 한계를 넘은 NVIDIA의 8가지 기술

NVIDIA가 ICRA에서 로봇의 시뮬레이션-실제 환경 전이 기술을 대거 공개했다. 복잡한 조립부터 다중 로봇 협업까지, 시뮬레이션 학습만으로 실전 성공률을 75%까지 끌어올렸다. 기존의 고정된 스크립트 자동화를 넘어, 로봇이 스스로 판단하고 환경에

DeepAI 결정과 로봇 동작 사이 '시차' 없앤다... 모벤시스, 인텔 서밋서 실시간 제어 기술 공개

AI 결정과 로봇 동작 사이 '시차' 없앤다... 모벤시스, 인텔 서밋서 실시간 제어 기술 공개

AI의 판단이 실제 로봇의 움직임으로 이어지기까지의 지연 시간이 물리 AI 구현의 핵심 과제로 꼽힌다. 소프트웨어 기반 모션 제어 전문 기업 모벤시스가 인텔 엣지 솔루션 서밋 2026에 초청받아 실시간 제어 기술을 선보인다. 인텔 코어 울트라 시리즈

제미나이 3.5와 AI 안경, 구글 I/O 2026이 공개한 새로운 인터페이스

제미나이 3.5와 AI 안경, 구글 I/O 2026이 공개한 새로운 인터페이스

구글이 샌프란시스코 마운틴뷰에서 '구글 I/O 2026'을 개최했다. 제미나이 3.5를 기반으로 AI 안경과 가상 세계 생성 도구 등 4종의 신기술을 공개했다. 단순 챗봇을 넘어 웨어러블 기기와 고성능 영상 생성으로 AI의 접점을 확장했다.