KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 90 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 46 pt3. gpt-oss-120b (high) 39 pt4. GPT-5.6 Luna (max) 27 pt5. GPT-5.6 Terra (max) 22 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

AI 도입의 성패는 모델 성능이 아니라 '결정할 문제'의 정의에 달렸다

AI 도입의 성패는 모델 성능이 아니라 '결정할 문제'의 정의에 달렸다

기술 도입보다 해결해야 할 구체적인 의사결정 정의가 우선이다. 데이터 품질 개선이 복잡한 알고리즘 교체보다 더 큰 실질적 이득을 준다. 실무자는 모델의 정확도 수치보다 비즈니스 목적과의 일치 여부를 검증해야 한다.

로봇 논문 80%는 단순 개선, LLM이 구분 못 하는 '진짜 기여' 찾는 법

로봇 논문 80%는 단순 개선, LLM이 구분 못 하는 '진짜 기여' 찾는 법

2024년 IEEE에만 4만 6천 편 이상의 로봇 논문이 게재되며 연구자가 모든 동향을 파악하기 불가능한 수준에 이르렀다. LfD 분야 논문 300편 분석 결과 고가치 논문은 20%뿐이며, LLM은 논문의 과장된 주장이나 중복 해결책을 구분하지 못했다

구글 검색 AI 모드, 캘린더·캔바 연동으로 오프라인 활동 계획 자동화한다

구글 검색 AI 모드, 캘린더·캔바 연동으로 오프라인 활동 계획 자동화한다

구글이 검색 내 AI 모드를 통해 오프라인 활동 계획과 실행을 돕는 도구들을 공개했다. 캘린더·캔바 등 앱 연동과 캔버스 기능을 통해 일정 최적화, 디자인 생성, 시뮬레이션 구축이 가능하다. 개인화된 앱 연결 범위와 외부 서비스 연동을 통한 작업 자동

4,737시간 연산을 30.5시간으로, OlmoEarth의 대륙 규모 위성 추론 인프라

4,737시간 연산을 30.5시간으로, OlmoEarth의 대륙 규모 위성 추론 인프라

대륙 규모의 위성 데이터 추론을 하루 만에 처리하는 OlmoEarth 플랫폼을 공개했다. 하드웨어 프로필별 3단계 분리 구조와 자체 메타데이터 인덱싱으로 연산 시간을 155배 단축했다. 대규모 지리 공간 모델을 운영하려는 엔지니어는 데이터 파이프라인의

Deep연구자의 역할을 '구현'에서 '검증'으로 바꾸는 코딩 에이전트의 과학 소프트웨어 현대화

연구자의 역할을 '구현'에서 '검증'으로 바꾸는 코딩 에이전트의 과학 소프트웨어 현대화

코딩 에이전트가 과학 소프트웨어의 엔지니어링 비용을 낮춰 연구 속도를 가속한다. Codex와 Claude Code를 활용한 8개 프로젝트에서 구현보다 검증과 오케스트레이션 중심의 작업 흐름이 확인됐다. 실무자는 AI의 '근거 없는 자신감'을 제어할 외

DeepLLM 출력 오류를 수학적으로 차단하는 outlines 라이브러리의 제약 디코딩

LLM 출력 오류를 수학적으로 차단하는 outlines 라이브러리의 제약 디코딩

LLM이 지정된 데이터 스키마나 정규표현식을 엄격히 따르도록 강제하는 제약 디코딩 기술을 분석한다. 유한 상태 기계(FSM)를 통해 허용되지 않은 토큰의 로짓 값을 마이너스 무한대로 설정해 오답 생성을 원천 차단한다. 프롬프트만으로 JSON 형식을 제

결정론적 워크플로와 동적 추론을 결합한 LangGraph·Strands 시장 감시 시스템

결정론적 워크플로와 동적 추론을 결합한 LangGraph·Strands 시장 감시 시스템

LangGraph와 Strands를 결합해 복잡한 금융 시장 감시를 수행하는 멀티 에이전트 시스템을 구축했다. 결정론적 오케스트레이션 내에 국소적 동적 지능을 배치해 신뢰성과 유연성을 동시에 확보했다. 엔터프라이즈급 배포와 관찰 가능성이 필요한 실무자

세션 없는 HTTP 통신으로 바뀐 MCP 2026-07-28, 서버 확장성 어떻게 달라지나

세션 없는 HTTP 통신으로 바뀐 MCP 2026-07-28, 서버 확장성 어떻게 달라지나

MCP가 2026-07-28 사양을 통해 상태를 유지하지 않는(Stateless) 프로토콜로 전환했다. 세션 핸드셰이크를 제거하고 표준 HTTP 헤더와 캐싱 메타데이터를 도입해 인프라 확장성을 높였다. AgentCore Gateway 사용자는 Upda

67 TOPS 성능의 NVIDIA Jetson Orin Nano Super, 핸드백 크기로 구현하는 온디바이스 AI

67 TOPS 성능의 NVIDIA Jetson Orin Nano Super, 핸드백 크기로 구현하는 온디바이스 AI

NVIDIA가 67 TOPS 성능의 소형 AI 플랫폼 Jetson Orin Nano Super를 공개했다. 클라우드 연결 없이 로컬 GPU 가속만으로 음성·시각 어시스턴트와 자율 주행 로봇 구현이 가능하다. 엣지 AI 개발자는 하드웨어 제약과 로컬 추

Gemini API Managed Agents, 3.6 Flash 기본 적용과 샌드박스 제어 훅 도입

Gemini API Managed Agents, 3.6 Flash 기본 적용과 샌드박스 제어 훅 도입

Gemini API Managed Agents가 3.6 Flash를 기본 모델로 채택하고 샌드박스 내 도구 호출을 제어하는 환경 훅을 도입했다. 예산 제한 설정, 스케줄 트리거, 무료 티어 지원을 통해 자율 에이전트의 비용 관리와 자동화 운영 범위를

CPU에서 8k 컨텍스트 28초 만에 처리하는 LFM2.5-Encoder의 추론 효율

CPU에서 8k 컨텍스트 28초 만에 처리하는 LFM2.5-Encoder의 추론 효율

일반 목적의 텍스트 분류와 라우팅을 위한 LFM2.5-Encoder가 공개됐다. 8k 컨텍스트 CPU 추론 시 ModernBERT-base 대비 3.7배 빠른 28초를 기록했다. 고비용 GPU 없이 CPU만으로 대량의 문서 분류나 PII 탐지를 구현하

구글 검색 AI 모드로 식사 초대 준비부터 메뉴 시각화까지 자동화

구글 검색 AI 모드로 식사 초대 준비부터 메뉴 시각화까지 자동화

구글 검색이 AI 모드와 Nano Banana를 통해 식사 초대 계획 기능을 강화했다. 테이블 장식 시각화, 레시피 추천, 유튜브 뮤직 연동, 메뉴판 디자인을 제공한다. AI 기반의 시각적 계획과 앱 연동을 통해 준비 시간을 줄이려는 사용자가 확인해야

Deep보너스 47만 6천 달러의 격차, 삼성전자 파운드리 인력 유출이 HBM4에 주는 영향

보너스 47만 6천 달러의 격차, 삼성전자 파운드리 인력 유출이 HBM4에 주는 영향

SK하이닉스가 HBM 성과로 지급한 약 47만 6천 달러의 보너스가 삼성전자 인력 유출의 트리거가 됐다. 삼성전자는 사업부별 성과급 차등 지급으로 파운드리 인력의 이탈이 가속화되며 HBM4 개발 동력이 위협받고 있다. 반도체 실무자는 보상 체계의 격차

노트북에서 멈춘 AI 에이전트를 실제 서비스로, LangGraph 기반 배포 7단계

노트북에서 멈춘 AI 에이전트를 실제 서비스로, LangGraph 기반 배포 7단계

79%의 기업이 AI 에이전트를 도입했지만 실제 상용화율은 11%에 불과한 간극을 해결한다. LangGraph의 체크포인팅과 ReAct 루프를 통해 검색-읽기-요약이 가능한 리서치 에이전트를 구축한다. 실무자는 '성공 정의'와 '하드 바운더리' 설정

Azure OpenAI가 바꾼 1,300만 FPL 유저의 데이터 접근 방식

Azure OpenAI가 바꾼 1,300만 FPL 유저의 데이터 접근 방식

Copilot 기반의 FPL 컴패니언이 공식 경기 데이터와 게임 지표를 결합해 출시됐다. ChatGPT 5.4와 Azure OpenAI를 통해 초보자의 규칙 학습부터 전문가의 데이터 분석까지 지원한다. AI를 자동 제어 도구가 아닌, 데이터 근거 기반

M4 맥미니 없이 쓰는 AI 에이전트, KimiClaw의 클라우드 오케스트레이션

M4 맥미니 없이 쓰는 AI 에이전트, KimiClaw의 클라우드 오케스트레이션

Moonshot AI가 OpenClaw의 인프라 부담을 제거한 클라우드 플랫폼 KimiClaw를 공개했다. 하트비트 데몬과 마크다운 메모리 기반의 자율 워크플로우를 서버리스 환경에서 제공한다. 데이터 프라이버시와 로컬 앱 제어 권한 중 우선순위에 따라

의료 문서 오류 46% 줄인 Guardoc의 Amazon Nova 멀티모달 파이프라인

의료 문서 오류 46% 줄인 Guardoc의 Amazon Nova 멀티모달 파이프라인

Guardoc Health가 Amazon Nova 모델을 도입해 의료 문서 처리 자동화를 구현했다. 비용 계층화 RAG 구조로 문서 오류 46% 감소와 시설당 연간 40만 달러 이상의 ROI를 기록했다. 비정형 PDF와 필기체가 혼재된 의료 데이터 추

앤스로픽, 오픈 웨이트 모델 금지 반대하며 3가지 안전 제어책 제시

앤스로픽, 오픈 웨이트 모델 금지 반대하며 3가지 안전 제어책 제시

앤스로픽이 오픈 웨이트 모델의 전면 금지를 반대한다는 공식 입장을 밝혔다. 단순 금지 대신 칩 통제, 대규모 증류 방지, 강제 안전 테스트라는 3가지 대안을 제시했다. 오픈 모델 도입 시 안전 테스트 기준과 증류 관련 법적 프레임워크 변화를 확인해야

Deepgram, AWS IAM 임시 위임으로 SageMaker AI 지원 시간 '며칠'에서 '분' 단위로 단축

Deepgram, AWS IAM 임시 위임으로 SageMaker AI 지원 시간 '며칠'에서 '분' 단위로 단축

Deepgram이 AWS IAM 임시 위임 기능을 통합해 SageMaker AI 기반 자가 호스팅 모델의 기술 지원 방식을 변경했다. 기존의 교차 계정 역할 설정 없이 고객 승인 기반의 12시간 제한 단기 자격 증명을 통해 조사 시간을 며칠에서 몇 분

RAG의 한계를 넘는 TAKC, 토큰 64배 압축으로 복잡한 분석 구현

RAG의 한계를 넘는 TAKC, 토큰 64배 압축으로 복잡한 분석 구현

문서 간 연결 고리를 놓치는 RAG의 한계를 해결하는 작업 인식 지식 압축(TAKC) 기술을 공개했다. 작업별 맞춤 프롬프트로 토큰을 8~64배 압축하고 쿼리 복잡도에 따라 4단계 티어로 라우팅한다. 대규모 문서 분석이 필요한 엔터프라이즈 AI 실무자

엔터프라이즈 AI 코딩의 기준, Cognizant가 Claude를 플랫폼에 내재화한 방식

엔터프라이즈 AI 코딩의 기준, Cognizant가 Claude를 플랫폼에 내재화한 방식

Anthropic과 Cognizant가 파트너십을 확대해 기업용 엔지니어링 플랫폼에 Claude를 내재화한다. 3만 명 이상의 인력이 교육을 마쳤으며, Flowsource 플랫폼 내에서 명세 기반 개발(Spec-Driven Development)을 수

직무 경계 허무는 AI, 특화 업무 43.5%가 타 직종 영역에서 발생

직무 경계 허무는 AI, 특화 업무 43.5%가 타 직종 영역에서 발생

OpenAI가 ChatGPT 사용자 80만 건의 메시지를 분석해 AI가 직무 경계를 허무는 '태스크 크로스오버' 현상을 확인했다. 직무 특화 메시지의 43.5%가 본인 직무 외의 업무이며, 특히 디자인과 마케팅 분야에서 역할 확장이 두드러졌다. 실무자

폐쇄형 AI가 분석을 막을 때, Open Secure AI Alliance는 무엇을 제공하는가

폐쇄형 AI가 분석을 막을 때, Open Secure AI Alliance는 무엇을 제공하는가

글로벌 AI 리더들이 모여 AI 에이전트와 소프트웨어를 보호하는 오픈 기술 연합을 결성했다. 모델 가중치를 넘어 신원 확인, 가드레일, 스캐닝 등 '전체 에이전트 스택'의 오픈화를 추진한다. 실무자는 보안 대응 속도와 인프라 통제권이 필요한 영역에 어

NVIDIA Cosmos-H-Dreams, 수술 로봇 시뮬레이션을 실시간 160fps로 구현

NVIDIA Cosmos-H-Dreams, 수술 로봇 시뮬레이션을 실시간 160fps로 구현

수술 로봇의 동작을 실시간으로 예측해 시뮬레이션하는 Cosmos-H-Dreams를 공개했다. 교사-학생 모델 증류와 FlashDreams 라이브러리를 통해 RTX PRO 6000 1대에서 160fps를 달성했다. 자체 로봇 데이터를 보유한 실무자는 제

Vera CPU 도입으로 칩 설계 성능 1.5배 높인 NVIDIA의 EDA 최적화

Vera CPU 도입으로 칩 설계 성능 1.5배 높인 NVIDIA의 EDA 최적화

NVIDIA가 자체 Vera CPU를 차세대 칩 설계용 EDA 워크로드에 전면 배치했다. Cadence Jasper와 Synopsys VCS 등 주요 검증 도구에서 최대 1.5배의 성능 향상을 확인했다. 칩 설계 실무자는 CPU 아키텍처가 검증 처리량

클라우드 에이전트에서 로컬 추론 모델까지, AI 에이전트 구현의 4가지 핵심

클라우드 에이전트에서 로컬 추론 모델까지, AI 에이전트 구현의 4가지 핵심

MCP 표준과 루프 엔지니어링을 통해 AI 에이전트를 단순 챗봇에서 자율 실행 시스템으로 전환한다. 전용 서버 통합과 지식 그래프 기반의 GraphEval로 에이전트의 도구 활용 능력과 환각 여부를 정밀하게 검증한다. 실무자는 클라우드 기반의 Clau

DeepClaude Opus 5 AWS 출시: Fable 5급 지능을 Opus 가격으로 사용한다

Claude Opus 5 AWS 출시: Fable 5급 지능을 Opus 가격으로 사용한다

5세대 첫 모델인 Claude Opus 5가 Amazon Bedrock과 Claude Platform on AWS에서 출시되었다. Fable 5 수준의 지능을 Opus 가격으로 제공하며, 에이전트 코딩과 장기 작업 능력이 강화되었다. AWS 환경의 데

추론 단계 쪼개기의 함정, LEAD는 어떻게 복구 불가능한 병목을 해결했나

추론 단계 쪼개기의 함정, LEAD는 어떻게 복구 불가능한 병목을 해결했나

LLM의 장기 추론 시 과도한 단계 분할이 오히려 복구 불가능한 오류를 만드는 병목 현상을 확인했다. 미래 검증과 중첩 롤아웃을 결합한 LEAD 기법으로 o4-mini의 문제 해결 능력을 n=11에서 n=13으로 높였다. 복잡한 추론 파이프라인를 설계

SHAP 없이 설명 가능한 은행 상품 추천: AWS 멀티타워 구조로 구현하기

SHAP 없이 설명 가능한 은행 상품 추천: AWS 멀티타워 구조로 구현하기

은행 고객의 다음 필요 상품을 예측하는 설명 가능한 NBP(Next-Best-Product) 추천 시스템을 AWS 상에 구축한다. 4개의 특화 타워 구조와 학습된 어텐션 메커니즘을 통해 데이터 타입별 최적 처리와 고객별 추천 근거를 제공한다. 규제 대

Fable 5급 지능을 절반 가격으로 구현한 Claude Opus 5 공개

Fable 5급 지능을 절반 가격으로 구현한 Claude Opus 5 공개

Claude Opus 5가 Fable 5에 근접한 성능을 유지하며 비용은 절반으로 낮춰 출시됐다. 코딩 및 지식 작업 벤치마크에서 SOTA를 달성했으며, 노력 설정으로 속도와 비용을 최적화한다. 고성능 에이전트 구축 시 비용 효율성과 보안 제약 수준을