KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 91 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Gemini 3.8 Flash (high) 80 pt3. Muse Spark 1.3 (max) 44 pt4. gpt-oss-120b (high) 40 pt5. GPT-5.6 Luna (max) 27 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

Gemini API, 웹훅 도입으로 작업 완료 알림 실시간 전환

Gemini API, 웹훅 도입으로 작업 완료 알림 실시간 전환

Google이 Gemini API에 이벤트 기반 웹훅 기능을 추가했다. 개발자는 폴링 방식 대신 서버로 직접 전송되는 알림을 받을 수 있다. 표준 웹훅 규격을 준수하며 최대 24시간 자동 재시도 기능을 제공한다.

Google, 8세대 TPU와 Gemma 4로 에이전트 시대 가속화

Google, 8세대 TPU와 Gemma 4로 에이전트 시대 가속화

Google이 8세대 TPU와 Gemma 4 모델을 공개하며 에이전트 중심의 AI 생태계를 구축했다. Gemini Enterprise Agent Platform을 통해 기업은 복잡한 다단계 업무를 자동화할 수 있다. Google Vids와 Colab

Amazon SageMaker AI, 인스턴스 풀로 GPU 부족 문제 해결

Amazon SageMaker AI, 인스턴스 풀로 GPU 부족 문제 해결

Amazon SageMaker AI가 인스턴스 풀 기능을 도입했다. 개발자는 우선순위 목록을 설정해 GPU 자원 부족 시 자동으로 대체 인스턴스를 확보할 수 있다. 이제 엔드포인트 생성과 확장 과정에서 수동 개입 없이 서비스 운영이 가능하다.

Amazon QuickSight, 자연어 질의로 데이터셋 직접 탐색하는 Dataset Q&A 출시

Amazon QuickSight, 자연어 질의로 데이터셋 직접 탐색하는 Dataset Q&A 출시

Amazon QuickSight가 자연어 질의로 데이터셋을 직접 분석하는 기능을 도입했다. 사용자는 SQL 작성 없이 질문만으로 데이터셋 전체를 즉시 조회할 수 있다. 보안 정책과 데이터 거버넌스가 자동으로 적용되어 기업 환경에 최적화되었다.

Anthropic, 금융·투자사와 손잡고 중견기업용 AI 서비스 기업 설립

Anthropic, 금융·투자사와 손잡고 중견기업용 AI 서비스 기업 설립

Anthropic이 Blackstone 등 주요 투자사와 AI 서비스 기업을 공동 설립한다. 이 회사는 중견기업의 핵심 업무에 Claude 모델을 맞춤형으로 적용하는 역할을 수행한다. 기존 Claude 파트너 네트워크와 협력하여 기업용 AI 도입을 가

Claude Code 비용을 줄이는 7가지 실전 최적화 전략

Claude Code 비용을 줄이는 7가지 실전 최적화 전략

Claude Code 사용 시 토큰 비용이 발생하는 원인을 분석했다. 모델 선택과 컨텍스트 관리로 불필요한 지출을 방지한다. 명령어와 도구를 활용해 작업 효율을 높이는 방법을 제시한다.

Mistral AI, 원격 에이전트 Vibe와 128B 모델 Medium 3.5 공개

Mistral AI, 원격 에이전트 Vibe와 128B 모델 Medium 3.5 공개

Mistral AI가 클라우드 기반 원격 코딩 에이전트 Vibe를 출시했다. 신규 모델 Mistral Medium 3.5는 SWE-Bench Verified 77.6%를 기록했다. 사용자는 로컬 세션을 클라우드로 이전해 장기 작업을 자동화할 수 있다.

Sakana AI, 실시간 음성 대화의 지연 시간과 지능을 동시에 잡은 KAME 공개

Sakana AI, 실시간 음성 대화의 지연 시간과 지능을 동시에 잡은 KAME 공개

Sakana AI가 실시간 음성 대화 모델인 KAME를 발표했다. KAME는 즉각적인 응답 속도와 고성능 LLM의 지식을 결합했다. 기존 방식 대비 지연 시간 없이 더 정확한 답변을 생성한다.

NVIDIA NeMo RL, 추론 가속 기술로 롤아웃 속도 1.8배 향상

NVIDIA NeMo RL, 추론 가속 기술로 롤아웃 속도 1.8배 향상

NVIDIA가 NeMo RL v0.6.0에 추론 가속 기술을 통합했다. 이 기술은 모델의 출력 분포를 유지하며 롤아웃 생성 속도를 높인다. 실험 결과 8B 모델 기준 1.8배의 생성 속도 향상을 확인했다.

Meta의 Autodata, AI 에이전트를 데이터 과학자로 활용해 학습 데이터 품질 개선

Meta의 Autodata, AI 에이전트를 데이터 과학자로 활용해 학습 데이터 품질 개선

Meta가 AI 에이전트가 스스로 학습 데이터를 생성하고 검증하는 Autodata 프레임워크를 공개했다. 이 방식은 기존의 단일 패스 생성 방식과 달리 반복적인 피드백 루프를 통해 데이터 품질을 높인다. 실험 결과 에이전트가 생성한 데이터로 학습한 모

AWS Transform, Power BI와 Tableau 이전 기간 수개월에서 수일로 단축

AWS Transform, Power BI와 Tableau 이전 기간 수개월에서 수일로 단축

AWS Transform이 BI 마이그레이션 자동화 기능을 출시했다. Power BI와 Tableau의 대시보드 이전 기간을 수개월에서 수일로 줄인다. Amazon Bedrock 기반의 AI 에이전트가 메타데이터 분석과 자산 변환을 수행한다.

Apple, ICASSP 2026 및 ICLR 2026 학회 참여로 AI 연구 보폭 확대

Apple, ICASSP 2026 및 ICLR 2026 학회 참여로 AI 연구 보폭 확대

Apple이 2026년 5월 스페인에서 열리는 ICASSP 학회에 참여한다. 연구진이 세션 의장과 워크숍 조직위원으로 활동하며 기술을 공유한다. 브라질에서 개최되는 ICLR 2026에서도 딥러닝 연구 성과를 발표한다.

GitHub 1위 등극 OpenClaw, 자율형 AI 에이전트의 시대

GitHub 1위 등극 OpenClaw, 자율형 AI 에이전트의 시대

OpenClaw가 60일 만에 깃허브 최다 스타 프로젝트가 되었다. 장기 실행 에이전트는 기존 AI보다 추론 수요를 1,000배 높인다. NVIDIA는 보안을 강화한 NemoClaw 참조 구현을 공개했다.

Reinforced Agent, 도구 호출 오류를 실시간으로 교정하는 검토자 모델 도입

Reinforced Agent, 도구 호출 오류를 실시간으로 교정하는 검토자 모델 도입

Reinforced Agent는 도구 호출 과정에 실시간 검토자를 배치한다. 검토자 모델로 o3-mini를 사용할 때 가장 높은 효율을 보인다. 기존 모델 재학습 없이 프롬프트 최적화만으로 성능을 개선한다.

DSO, 모델 편향성 제어 위한 직접 활성화 최적화 기법 공개

DSO, 모델 편향성 제어 위한 직접 활성화 최적화 기법 공개

연구팀이 모델 편향을 완화하는 DSO 기법을 발표했다. 강화학습을 통해 모델 활성화 값을 선형 변환하여 편향을 제어한다. 성능 저하를 최소화하며 공정성과 모델 능력을 동시에 확보한다.

Qwen-Scope 공개, LLM 내부 특징을 개발 도구로 전환

Qwen-Scope 공개, LLM 내부 특징을 개발 도구로 전환

Qwen 팀이 Qwen3 및 Qwen3.5 모델군을 위한 희소 오토인코더 모음을 공개했다. 모델 내부의 복잡한 활성화 값을 사람이 이해할 수 있는 개념으로 분해한다. 가중치 수정 없이 모델의 출력을 제어하거나 벤치마크 중복을 분석할 수 있다.

Amazon Bedrock AgentCore Gateway로 내부망 자원 보안 연결 구현하기

Amazon Bedrock AgentCore Gateway로 내부망 자원 보안 연결 구현하기

Amazon Bedrock AgentCore Gateway가 내부망 자원 연결 기능을 제공한다. 관리형과 자가 관리형 두 가지 모드로 네트워크 접근 방식을 선택할 수 있다. 공인 인터넷 노출 없이 내부 API와 데이터베이스에 안전하게 접근 가능하다.

STARFlow-V, 노멀라이징 플로우로 비디오 생성 일관성 확보했다

STARFlow-V, 노멀라이징 플로우로 비디오 생성 일관성 확보했다

STARFlow-V가 노멀라이징 플로우 기반의 비디오 생성 모델로 공개됐다. 글로벌-로컬 구조를 통해 비디오 생성의 시간적 일관성을 높였다. 텍스트와 이미지 기반 비디오 생성 및 비디오 변환 기능을 모두 지원한다.

LLM 교체 비용 최소화하는 AWS의 모델 마이그레이션 프레임워크

LLM 교체 비용 최소화하는 AWS의 모델 마이그레이션 프레임워크

AWS가 생성형 AI 모델 전환을 위한 체계적인 마이그레이션 프레임워크를 공개했다. Amazon Bedrock을 통해 모델 간 프롬프트 최적화와 성능 평가를 자동화한다. 데이터 기반의 정량적 분석으로 특정 모델에 종속되는 현상을 방지한다.

OpenAI, 패스키 필수 적용하는 고급 계정 보안 도입

OpenAI, 패스키 필수 적용하는 고급 계정 보안 도입

OpenAI가 고위험 사용자를 위한 고급 계정 보안 설정을 도입했다. 패스키와 물리 보안 키를 필수화하고 이메일 및 SMS 복구를 차단한다. 해당 설정 활성화 시 대화 내용이 모델 학습에서 자동으로 제외된다.

수어 데이터 자동 주석 파이프라인으로 학습 비용 절감

수어 데이터 자동 주석 파이프라인으로 학습 비용 절감

수어 영상의 주석 작업을 자동화하는 의사 주석 파이프라인이 개발되었다. 지문자 인식과 고립 수어 인식 모델을 결합해 주석 효율을 높였다. 연구팀은 300시간 분량의 의사 주석 데이터와 벤치마크를 공개했다.

Google, 의료 현장 보조하는 AI 코-클리니션 아키텍처 공개

Google, 의료 현장 보조하는 AI 코-클리니션 아키텍처 공개

Google이 의료진을 보조하는 AI 코-클리니션 모델을 발표했다. 이 모델은 이중 에이전트 구조로 안전한 임상 대화를 유도한다. 미국과 인도 등 글로벌 의료 기관과 협력하여 평가를 진행 중이다.

NVIDIA GeForce NOW, RTX 5080 성능 확대 및 신작 16종 추가

NVIDIA GeForce NOW, RTX 5080 성능 확대 및 신작 16종 추가

NVIDIA가 GeForce NOW의 Ultimate 멤버십에 RTX 5080급 성능을 확대 적용했다. Forza Horizon 6를 포함한 신작 게임 16종이 5월 중 클라우드에 추가된다. DLSS 4와 5K 120fps 지원으로 하드웨어 제약 없는

PwC AIDA, AWS 기반 계약서 분석 시간 90% 단축

PwC AIDA, AWS 기반 계약서 분석 시간 90% 단축

PwC가 AWS 기반의 계약서 분석 솔루션 AIDA를 공개했다. LLM을 활용해 비정형 계약서에서 구조화된 데이터를 추출한다. 실제 도입 결과 계약서 검토 시간을 최대 90% 줄였다.

Qwen 팀, NVIDIA Hopper GPU용 FlashQLA 공개로 연산 속도 3배 향상

Qwen 팀, NVIDIA Hopper GPU용 FlashQLA 공개로 연산 속도 3배 향상

Qwen 팀이 Gated Delta Network 전용 커널 라이브러리인 FlashQLA를 공개했다. NVIDIA Hopper 아키텍처에 최적화하여 기존 대비 최대 3배의 속도 향상을 달성했다. TileLang 컴파일러를 활용해 데이터 이동과 연산을

AI 평가 비용의 역설: 모델 성능 측정에 드는 막대한 컴퓨팅 자원

AI 평가 비용의 역설: 모델 성능 측정에 드는 막대한 컴퓨팅 자원

AI 에이전트 평가 비용이 모델 학습 비용을 위협할 정도로 급증했다. 단순한 정적 벤치마크와 달리 에이전트 평가는 수천 배의 비용이 든다. 평가 효율화를 위한 압축 기술이 에이전트 환경에서는 한계를 보인다.

DeepInfra가 Hugging Face 인퍼런스 프로바이더로 합류해 100개 모델 제공

DeepInfra가 Hugging Face 인퍼런스 프로바이더로 합류해 100개 모델 제공

DeepInfra가 Hugging Face Hub의 공식 추론 제공자로 합류했다. 100개 이상의 모델을 SDK를 통해 서버리스로 즉시 사용할 수 있다. PRO 사용자는 매월 2달러의 추론 크레딧을 제공받는다.

IBM, 15조 토큰 학습한 Granite 4.1 모델군 공개

IBM, 15조 토큰 학습한 Granite 4.1 모델군 공개

IBM이 3B, 8B, 30B 크기의 Granite 4.1 거대언어모델을 공개했다. 5단계 학습 파이프라인을 거쳐 512K 토큰의 문맥 길이를 지원한다. 모든 모델은 아파치 2.0 라이선스로 배포되어 상용 활용이 가능하다.

Sonata, LLM 추론 비용 최대 80% 절감하는 적응형 사고 할당 기술

Sonata, LLM 추론 비용 최대 80% 절감하는 적응형 사고 할당 기술

연구팀이 LLM의 추론 필요성을 판단해 사고 과정을 조절하는 Sonata를 개발했다. 이 기술은 자기 일관성을 활용해 질문 난이도에 따라 사고 토큰을 유연하게 배분한다. 실험 결과 기존 대비 사고 토큰을 최대 80%까지 줄이면서 정확도를 유지했다.

OpenAI의 안전 정책 강화, 폭력적 의도 감지 및 대응 체계 공개

OpenAI의 안전 정책 강화, 폭력적 의도 감지 및 대응 체계 공개

OpenAI가 폭력 예방을 위한 모델 안전 가이드라인을 강화했다. 자동화된 시스템과 전문가 검토를 통해 위험한 대화를 식별한다. 정책 위반 시 서비스 접근 차단 등 강력한 제재를 시행한다.