KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 91 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Gemini 3.8 Flash (high) 80 pt3. Muse Spark 1.3 (max) 44 pt4. gpt-oss-120b (high) 40 pt5. GPT-5.6 Luna (max) 27 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

OpenAI Codex 보안 체계 공개, 기업용 AI 에이전트 통제권 확보

OpenAI Codex 보안 체계 공개, 기업용 AI 에이전트 통제권 확보

OpenAI가 Codex의 안전한 운영을 위한 내부 통제 체계를 공개했다. 샌드박스와 자동 승인 모드로 개발 생산성과 보안의 균형을 맞췄다. AI 보안 트리아지 에이전트를 통해 에이전트의 행동 의도까지 분석한다.

AMD ROCm으로 구현한 MedQA, CUDA 없이 의료 AI 학습 성공

AMD ROCm으로 구현한 MedQA, CUDA 없이 의료 AI 학습 성공

AMD Instinct MI300X 하드웨어에서 MedQA 모델을 미세 조정했다. CUDA 의존성 없이 HuggingFace 생태계만으로 학습 파이프라인을 구축했다. LoRA 기법을 활용해 1.7B 모델을 5분 만에 학습하는 효율을 보였다.

Halliburton, Amazon Bedrock으로 지진파 분석 워크플로우 95% 가속

Halliburton, Amazon Bedrock으로 지진파 분석 워크플로우 95% 가속

Halliburton이 지진파 분석 도구에 생성형 AI를 도입했다. 자연어 대화로 82개 이상의 복잡한 분석 도구를 자동 구성한다. 기존 대비 워크플로우 생성 시간을 최대 95% 단축했다.

OpenAI, 실시간 음성 모델 3종 공개 및 API 가격 정책 발표

OpenAI, 실시간 음성 모델 3종 공개 및 API 가격 정책 발표

OpenAI가 실시간 음성 처리를 위한 모델 3종을 새롭게 공개했다. GPT-Realtime-2는 이전 모델 대비 오디오 지능 성능이 최대 15.2% 향상됐다. 각 모델은 분당 또는 토큰당 과금 체계로 API를 통해 즉시 이용 가능하다.

OpenAI, 실시간 음성 모델 3종 출시 및 API 정식 서비스 전환

OpenAI, 실시간 음성 모델 3종 출시 및 API 정식 서비스 전환

OpenAI가 실시간 음성 처리를 위한 모델 3종을 공개했다. Realtime API가 베타를 종료하고 정식 서비스로 전환되었다. 음성 에이전트의 추론 능력과 응답 품질이 대폭 개선되었다.

Anthropic, 모델 내부 활성화 값을 자연어로 변환하는 NLA 공개

Anthropic, 모델 내부 활성화 값을 자연어로 변환하는 NLA 공개

Anthropic이 모델의 내부 활성화 값을 자연어로 해석하는 NLA 기술을 발표했다. 이 기술은 모델의 사고 과정을 직접 텍스트로 변환하여 내부 의도를 파악한다. 실제 테스트에서 모델의 숨겨진 부정행위와 평가 인지 여부를 확인하는 데 성공했다.

Qwen2.5-0.5B와 GRPO로 구현하는 검증 가능 보상 강화학습

Qwen2.5-0.5B와 GRPO로 구현하는 검증 가능 보상 강화학습

Amazon SageMaker AI에서 GRPO 알고리즘을 활용한 강화학습 구현 방법을 공개했다. RLVR 방식을 통해 정답이 명확한 수학 및 코드 작업의 보상 신뢰도를 높였다. Qwen2.5-0.5B 모델과 GSM8K 데이터셋을 사용해 추론 성능을

Google의 AI 에이전트 AlphaEvolve, 유전체 분석 오류 30% 줄였다

Google의 AI 에이전트 AlphaEvolve, 유전체 분석 오류 30% 줄였다

Google이 Gemini 기반의 코딩 에이전트 AlphaEvolve를 공개했다. AlphaEvolve는 유전체 분석 모델인 DeepConsensus의 성능을 개선했다. 해당 기술을 통해 유전체 변이 탐지 오류를 30% 감소시켰다.

미 에너지부와 NVIDIA의 제네시스 미션, 10만 개 GPU로 과학 난제 푼다

미 에너지부와 NVIDIA의 제네시스 미션, 10만 개 GPU로 과학 난제 푼다

미 에너지부와 NVIDIA가 AI를 활용한 과학 연구 프로젝트 제네시스 미션을 발표했다. 아르곤 국립연구소에 10만 개의 GPU를 탑재한 슈퍼컴퓨터를 구축해 과학 연구를 가속화한다. 에너지 효율을 25배 높인 차세대 칩을 통해 전력망 병목 현상을 해결

구글 데미스 하사비스가 주목한 한국의 AI 제조 인프라와 제미나이 결합

구글 데미스 하사비스가 주목한 한국의 AI 제조 인프라와 제미나이 결합

데미스 하사비스가 한국을 글로벌 AI 혁신의 핵심 거점으로 지목했다. 구글은 제미나이와 보스턴 다이내믹스의 로봇 개 스팟을 결합한 사례를 선보였다. 구글은 AI 올림과 구글 AI 캠퍼스를 통해 한국 내 AI 생태계 육성을 지원한다.

vLLM V1 전환기: 강화학습 엔진의 수치적 일관성 확보하기

vLLM V1 전환기: 강화학습 엔진의 수치적 일관성 확보하기

vLLM V1 엔진으로 전환하는 과정에서 강화학습 결과값이 달라지는 문제가 발생했다. 연구팀은 로그 확률 처리와 가중치 업데이트 등 4가지 기술적 요소를 수정하여 V0 버전과 동일한 성능을 구현했다. 강화학습 모델을 개선하기 전, 추론 엔진의 동작 일

KAIST 연구팀, AI로 지하 불확실성을 예측하다

KAIST 연구팀, AI로 지하 불확실성을 예측하다

KAIST 조계춘 교수가 구글 기초과학 지원 프로그램에 선정됐다. 물리 기반 모델과 AI를 결합해 지열 에너지 리스크를 예측한다. 지하 환경의 불확실성을 관리 가능한 위험으로 전환하는 게 목표다.

AMD로 훈련한 7.6억 파라미터 모델, 수학에서 1190억 모델 추월

AMD로 훈련한 7.6억 파라미터 모델, 수학에서 1190억 모델 추월

Zyphra가 8.4B 총 파라미터 중 760M만 활성화하는 MoE 모델 ZAYA1-8B를 공개했다. 수학 벤치마크에서 119B 파라미터의 Mistral-Small-4를 능가하며 Claude 4.5 Sonnet과 경쟁했다. 새로운 추론 방식 Marko

Uber, OpenAI 모델 도입해 드라이버 수익 최적화 및 음성 예약 구현

Uber, OpenAI 모델 도입해 드라이버 수익 최적화 및 음성 예약 구현

Uber가 OpenAI 모델을 활용해 드라이버용 AI 어시스턴트와 음성 예약 기능을 출시했다. 복잡한 시장 데이터를 요약해 드라이버의 수익 의사결정을 돕고 운영 효율을 높인다. 다중 에이전트 아키텍처를 적용해 작업별로 최적화된 모델을 선택적으로 사용한

Parloa, 기업용 AI 상담 에이전트 관리 플랫폼 AMP 공개

Parloa, 기업용 AI 상담 에이전트 관리 플랫폼 AMP 공개

Parloa가 OpenAI 모델을 활용한 기업용 AI 에이전트 관리 플랫폼 AMP를 출시했다. 자연어 기반의 에이전트 설계와 시뮬레이션으로 개발자 없이도 상담 시스템 구축이 가능하다. 실제 고객 시나리오를 통한 평가와 모듈형 구조로 대규모 상담 환경에

OpenAI, AI 슈퍼컴퓨터 네트워크 병목 해결할 MRC 프로토콜 공개

OpenAI, AI 슈퍼컴퓨터 네트워크 병목 해결할 MRC 프로토콜 공개

OpenAI가 대규모 AI 학습을 위한 네트워크 프로토콜 MRC를 공개했다. 기존 RoCEv2 방식과 달리 패킷을 여러 경로로 분산해 대역폭 효율을 높인다. 이미 NVIDIA와 Broadcom 하드웨어 기반 슈퍼컴퓨터에서 실전 운용 중이다.

Meta AI, 94개 데이터셋 통합한 뇌파 분석 벤치마크 NeuralBench 공개

Meta AI, 94개 데이터셋 통합한 뇌파 분석 벤치마크 NeuralBench 공개

Meta AI가 뇌파 데이터 분석을 표준화하는 NeuralBench를 공개했다. 36개 작업과 94개 데이터셋을 포함해 모델 성능을 객관적으로 비교한다. 기존 모델들의 성능 격차가 크지 않다는 사실이 이번 연구로 확인됐다.

OpenAI B2B Signals 공개, 선도 기업 AI 지능 활용도 3.5배 높다

OpenAI B2B Signals 공개, 선도 기업 AI 지능 활용도 3.5배 높다

OpenAI가 기업의 AI 활용 패턴을 분석한 B2B Signals를 공개했다. 선도 기업은 일반 기업보다 인당 AI 지능 활용도가 3.5배 높게 나타났다. 단순 질의응답을 넘어 복잡한 업무를 위임하는 에이전트 활용이 핵심이다.

Anthropic, SpaceX와 손잡고 Claude API 사용 한도 2배 확대

Anthropic, SpaceX와 손잡고 Claude API 사용 한도 2배 확대

Anthropic이 SpaceX와 데이터센터 협약을 체결했다. Claude Code와 API 사용 한도가 대폭 상향 조정되었다. 글로벌 인프라 확장을 통해 서비스 안정성을 강화한다.

NVIDIA Spectrum-X, MRC 프로토콜로 기가스케일 AI 네트워크 표준화

NVIDIA Spectrum-X, MRC 프로토콜로 기가스케일 AI 네트워크 표준화

NVIDIA가 MRC 프로토콜을 적용한 Spectrum-X 이더넷 인프라를 공개했다. OpenAI와 Microsoft 등 주요 기업이 이를 통해 GPU 효율을 극대화하고 있다. 해당 기술은 오픈 컴퓨트 프로젝트를 통해 개방형 표준으로 전환되었다.

Open ASR 리더보드, 벤치마크 오염 방지용 비공개 데이터셋 도입

Open ASR 리더보드, 벤치마크 오염 방지용 비공개 데이터셋 도입

Open ASR 리더보드가 벤치마크 점수 조작을 막기 위해 비공개 데이터셋을 도입했다. 기본 평균 WER 산출에는 공개 데이터셋만 사용하며 비공개 데이터는 선택적으로 포함한다. Appen과 DataoceanAI가 제공한 고품질 음성 데이터를 통해 실제

OpenAI, 13만 개 GPU 연결하는 MRC 프로토콜 공개

OpenAI, 13만 개 GPU 연결하는 MRC 프로토콜 공개

OpenAI가 대규모 AI 학습을 위한 MRC 네트워크 프로토콜을 공개했다. MRC는 800Gb/s 인터페이스를 다중 경로로 분할해 네트워크 장애를 방지한다. 해당 기술은 OCP를 통해 표준화되어 업계 전반에 공유될 예정이다.

Google Gemma 4에 도입된 MTP, 추론 속도 3배 높인다

Google Gemma 4에 도입된 MTP, 추론 속도 3배 높인다

Google이 Gemma 4 모델을 위한 MTP 드래프터를 공개했다. 이 기술은 추론 속도를 최대 3배까지 가속화하는 효과를 낸다. 모델의 출력 품질 저하 없이 효율적인 연산이 가능하다.

OpenAI, ChatGPT 광고 관리 도구 출시 및 CPC 입찰 도입

OpenAI, ChatGPT 광고 관리 도구 출시 및 CPC 입찰 도입

OpenAI가 미국 내 기업을 대상으로 광고 관리자 베타 서비스를 시작했다. 기존 CPM 방식에 더해 클릭당 비용을 지불하는 CPC 입찰 모델을 도입했다. 광고주는 대화 내용에 접근하지 않고도 성과 측정 도구를 활용할 수 있다.

NVIDIA와 ServiceNow, 기업용 자율 AI 에이전트 프로젝트 아크 공개

NVIDIA와 ServiceNow, 기업용 자율 AI 에이전트 프로젝트 아크 공개

NVIDIA와 ServiceNow가 기업용 자율 AI 에이전트 협력을 발표했다. 프로젝트 아크는 데스크톱에서 복잡한 업무를 수행하는 자율 에이전트다. NVIDIA의 Blackwell 플랫폼을 통해 기업 AI 운영 비용을 대폭 절감한다.

PORTool, 보상 트리 구조로 도구 호출 단계 줄이고 정답률 높였다

PORTool, 보상 트리 구조로 도구 호출 단계 줄이고 정답률 높였다

PORTool이라는 중요도 인식 정책 최적화 알고리즘이 공개되었다. 보상 트리 구조를 통해 도구 호출의 단계별 중요도를 정밀하게 측정한다. 불필요한 도구 호출을 줄이면서 최종 정답률을 높이는 성과를 냈다.

Anthropic, 금융 특화 에이전트 10종 및 MS 365 연동 공개

Anthropic, 금융 특화 에이전트 10종 및 MS 365 연동 공개

Anthropic이 금융 업무 자동화를 위한 에이전트 템플릿 10종을 출시했다. Claude가 Microsoft 365 앱과 연동되어 데이터 맥락을 유지하며 작업한다. Claude Opus 4.7 모델은 금융 에이전트 벤치마크에서 64.37%를 기록했

Google, Gemini API에 이벤트 기반 웹훅 도입해 폴링 제거

Google, Gemini API에 이벤트 기반 웹훅 도입해 폴링 제거

Google이 Gemini API에 이벤트 기반 웹훅 기능을 추가했다. 개발자는 작업 완료를 확인하기 위해 반복적으로 요청을 보낼 필요가 없다. 정적 및 동적 웹훅을 지원하며 보안을 위해 서명 검증 방식을 채택했다.

Amazon Quick, S3 Tables 직접 연결로 데이터 분석 지연 시간 제거

Amazon Quick, S3 Tables 직접 연결로 데이터 분석 지연 시간 제거

Amazon Quick이 S3 Tables를 데이터 소스로 직접 지원한다. Apache Iceberg 형식을 활용해 중간 계층 없이 실시간 분석이 가능하다. 데이터 이동 비용을 줄이고 데이터 레이크를 단일 진실 공급원으로 활용한다.

OpenAI와 PwC, 재무 업무 자동화 위한 AI 에이전트 공동 개발

OpenAI와 PwC, 재무 업무 자동화 위한 AI 에이전트 공동 개발

OpenAI와 PwC가 기업 재무 부서의 업무 자동화를 위한 AI 에이전트를 개발한다. OpenAI는 자사 재무 조직에서 검증된 에이전트 기술을 외부 기업에 적용한다. 양사는 재무 계획부터 계약 검토까지 전 과정을 자동화하고 거버넌스를 강화한다.