KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 85 pt3. Reve 2.1 74 pt4. grok-imagine-image-2.0 (low) 73 pt5. Nano Banana 2 (Gemini 3.1 Flash Image) 68 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. Wan 3.0 85 pt5. gemini-omni-1.1-flash 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Gemini 3.8 Flash (high) 81 pt3. Muse Spark 1.3 (max) 65 pt4. gpt-oss-120b (high) 50 pt5. GPT-5.6 Luna (max) 30 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

DeepSeek V4 출시, 1.6T 파라미터와 압도적 가성비로 시장 공략

DeepSeek V4 출시, 1.6T 파라미터와 압도적 가성비로 시장 공략

DeepSeek가 100만 토큰 컨텍스트를 지원하는 V4 모델 시리즈를 공개했다. Pro 모델은 1.6조 개의 파라미터로 현존 최대 규모의 오픈 웨이트 모델이 되었다. 효율성 개선을 통해 기존 모델 대비 연산량과 KV 캐시 점유율을 획기적으로 낮췄다.

YAML 기반 명세서 작성이 AI 환각을 제어하는 방식

YAML 기반 명세서 작성이 AI 환각을 제어하는 방식

AI 모델이 복잡한 지시사항을 처리할 때 발생하는 환각 현상을 분석했다. YAML 형식으로 명세서를 작성하면 모델의 추론 오류를 줄일 수 있다. 구조화된 데이터 입력이 모델의 출력 일관성을 높이는 핵심이다.

Mac mini M4 Pro 기반 macOS 가상화 성능과 최소 사양 검증

Mac mini M4 Pro 기반 macOS 가상화 성능과 최소 사양 검증

Mac mini M4 Pro에서 macOS 26.4.1 가상 머신 성능을 측정했다. 단일 코어와 GPU 성능은 호스트의 95% 이상 수준을 기록했다. 가벼운 작업은 2개 코어와 4GB 메모리만으로도 충분히 구동된다.

Mistral Medium 3.5 128B 출시, 추론 강도 조절로 코딩 에이전트 성능 극대화

Mistral Medium 3.5 128B 출시, 추론 강도 조절로 코딩 에이전트 성능 극대화

Mistral AI가 128B 파라미터의 통합 플래그십 모델인 Mistral Medium 3.5를 공개했다. 사용자는 reasoning_effort 설정을 통해 작업 난이도에 따라 추론 강도를 직접 조절할 수 있다. SWE-Bench Verified에

Context Mode, AI 코딩 에이전트 컨텍스트 98% 절약

Context Mode, AI 코딩 에이전트 컨텍스트 98% 절약

Context Mode가 MCP 서버를 통해 AI 코딩 에이전트의 컨텍스트 사용량을 98% 절약한다. SQLite와 FTS5를 활용해 세션 지속 시간을 기존 30분에서 3시간으로 연장한다. Claude Code를 포함한 14개 플랫폼에서 로컬 환경으로

아카데미, AI 배우 및 시나리오 후보 자격 박탈

아카데미, AI 배우 및 시나리오 후보 자격 박탈

아카데미 시상식이 AI 생성 배우와 시나리오의 후보 자격을 박탈했다. 인간의 직접 수행과 명시적 동의를 증명해야 하는 엄격한 기준을 세웠다. 기술적 효율보다 인간 창작물의 배타적 지위를 보호하는 방향으로 규정을 바꿨다.

AI 채용 알고리즘의 자기 선호 편향과 데이터 피드백 루프의 실체

AI 채용 알고리즘의 자기 선호 편향과 데이터 피드백 루프의 실체

AI 채용 도구가 특정 패턴의 후보자만 반복 선택하는 자기 선호 편향이 확인되었다. 기존의 인구통계학적 편향을 넘어 학습 데이터의 특성을 복제하는 양상이 관찰된다. 채용 파이프라인의 다양성을 확보하기 위해 알고리즘 감사 체계 도입이 필요하다.

k-sajja-agents, 전문직 업무 프로세스를 AI 스킬로 공개해 수임 연결

k-sajja-agents, 전문직 업무 프로세스를 AI 스킬로 공개해 수임 연결

전문직의 실무 지식을 AI 스킬 형태로 모아둔 k-sajja-agents 저장소가 공개됐다. 전문가가 자신의 업무 방식을 오픈소스로 구축해 AI 에이전트에 연결하는 구조다. AI가 기초 작업을 처리하고 최종 단계에서 실제 전문가 상담으로 유도하는 모델

VS Code, Copilot을 Git 공동 작성자로 자동 등록

VS Code, Copilot을 Git 공동 작성자로 자동 등록

VS Code가 Copilot의 Git 공동 작성 기능을 기본 활성화했다. 설정에서 AI 기여 범위를 세 가지 단계로 조절할 수 있다. AI가 생성한 코드의 출처를 명확히 기록하는 체계가 도입됐다.

AI 코딩의 함정, 실행 가능한 코드와 제품 감각의 괴리

AI 코딩의 함정, 실행 가능한 코드와 제품 감각의 괴리

AI가 생성한 코드는 실행 가능하지만 제품 완성도는 낮다. RLVR 학습 구조가 코드 실행 성공에만 보상을 집중한다. 인간의 제품 감각과 상식 보완이 여전히 필수적인 영역이다.

spawn-agent, 로컬 코딩 에이전트를 Vercel AI SDK로 통합

spawn-agent, 로컬 코딩 에이전트를 Vercel AI SDK로 통합

spawn-agent가 로컬 코딩 에이전트를 Vercel AI SDK 모델로 변환한다. ACP 표준을 준수하여 다양한 CLI 도구와 일관된 통신을 지원한다. 권한 관리와 프로세스 워치독 등 실무 운영 정책을 내장했다.

Gemini, 프롬프트 하나로 구글 문서·시트·프레젠테이션 초안 생성

Gemini, 프롬프트 하나로 구글 문서·시트·프레젠테이션 초안 생성

Google이 Gemini 앱에서 문서와 시트, 프레젠테이션을 직접 생성하는 기능을 발표했다. 사용자는 프롬프트 입력만으로 초안을 만들고 구글 드라이브에 바로 저장할 수 있다. 문서 요약과 데이터 분석 등 반복적인 사무 작업의 자동화를 목표로 한다.

인텔 오토라운드, LLM 2비트 양자화 정확도 97.9% 유지

인텔 오토라운드, LLM 2비트 양자화 정확도 97.9% 유지

인텔이 오픈소스 양자화 도구 오토라운드의 업데이트를 공개했다. 2비트 수준에서도 모델 정확도를 97.9%까지 보존한다. vLLM, SGLang, 트랜스포머스 등 주요 추론 엔진과 통합을 마쳤다.

Spotify, '인증' 배지로 AI 음악과 인간 아티스트 구분한다

Spotify, '인증' 배지로 AI 음악과 인간 아티스트 구분한다

Spotify가 인간 아티스트를 식별하는 '인증' 배지를 도입한다. 소셜 계정 연결과 공연 일정 등 실제 활동 증거가 인증 기준이 된다. 음악 자체가 아닌 아티스트의 정체성만 인증한다는 한계가 지적된다.

캘리포니아 데이터센터 물 사용량, 전체의 0.05% 수준에 불과하다

캘리포니아 데이터센터 물 사용량, 전체의 0.05% 수준에 불과하다

AI 데이터센터의 물 사용량이 과도하게 부풀려져 있다는 연구 결과가 나왔다. 캘리포니아 전체 인간 물 사용량 중 AI가 차지하는 비중은 0.05% 수준이다. 데이터센터의 수자원 소비는 농업 등 타 산업 대비 경제적 효율성이 높다.

Salesforce Agentforce Operations, AI 에이전트를 위한 결정론적 워크플로우 제어 평면 도입

Salesforce Agentforce Operations, AI 에이전트를 위한 결정론적 워크플로우 제어 평면 도입

Salesforce가 Agentforce Operations를 출시했다. 인간 중심의 모호한 업무 흐름을 AI 에이전트용 결정론적 구조로 변환한다. 추론 능력보다 워크플로우의 일관성이 기업용 AI의 핵심 병목으로 정의되었다.

Ouroboros, Claude Plan Mode 제치고 시뮬레이션 벤치마크 1위 기록

Ouroboros, Claude Plan Mode 제치고 시뮬레이션 벤치마크 1위 기록

한국 개발자가 만든 오픈소스 Ouroboros가 시뮬레이션 벤치마크 1위를 기록했다. Anthropic의 Claude Plan Mode보다 높은 성능을 보이며 모델링 능력을 입증했다. 문제 정의부터 복구까지 구조화된 워크플로우가 단순 지침 추가보다 효

Show GN, 로컬 LLM과 Gemini로 파일 번역 및 요약 통합

Show GN, 로컬 LLM과 Gemini로 파일 번역 및 요약 통합

Show GN이 로컬 LLM과 Gemini를 지원하는 데스크톱 번역 앱을 공개했다. LM Studio를 통한 로컬 서버 연결과 Google API 연동 기능을 제공한다. 긴 텍스트의 자동 청크 분할과 파일 번역 기능을 통해 작업 효율을 높였다.

LLM 앱 개발용 스캐폴딩 층이 사라진다, LlamaIndex CEO 진단

LLM 앱 개발용 스캐폴딩 층이 사라진다, LlamaIndex CEO 진단

LlamaIndex CEO가 LLM 앱 개발에 필요한 스캐폴딩 층이 붕괴 중이라고 진단했다. 모델이 스스로 추론·도구 사용·멀티스텝 계획을 처리하면서 프레임워크 수요가 줄었다. 생존 핵심은 맥락(context)이며, 파일 포맷 해석과 정확한 파싱이 차

xAI, Grok 4.3 출시와 음성 복제 도구 공개로 API 시장 공략

xAI, Grok 4.3 출시와 음성 복제 도구 공개로 API 시장 공략

xAI가 새로운 대규모 언어 모델인 Grok 4.3을 출시했다. 입력 토큰당 1.25달러로 이전 모델 대비 가격을 낮췄다. 사용자 음성을 복제하는 새로운 음성 생성 도구도 추가했다.

자연어로 퀀트 전략 짜는 Vibe-Trading, 7개 백테스트 엔진 지원

자연어로 퀀트 전략 짜는 Vibe-Trading, 7개 백테스트 엔진 지원

Vibe-Trading은 자연어 입력으로 트레이딩 전략을 생성하는 AI 플랫폼이다. 7개 백테스트 엔진과 29개 에이전트 팀 프리셋을 통해 복합적인 시장 분석을 지원한다. Docker와 파이썬 패키지를 통해 설치 가능하며 17개 MCP 도구와 연동된다

커밋 메시지 HERMES.md가 불러온 Claude Code 과금 오류

커밋 메시지 HERMES.md가 불러온 Claude Code 과금 오류

Git 커밋 메시지에 특정 문자열이 포함되면 Claude Code가 유료 크레딧을 강제로 소진하는 오류가 발생했다. Anti-abuse 시스템의 오작동으로 판명되어 현재는 수정되었으며 피해 사용자에게 환불과 크레딧이 지급된다. 개발자들은 이번 사태를

에러 로그 해독과 러버 덕킹까지 LLM 활용법 7가지

에러 로그 해독과 러버 덕킹까지 LLM 활용법 7가지

LLM을 단순 챗봇이 아닌 비전형적인 도구로 활용하는 7가지 방법을 제시했다. 에러 로그 해독과 법률 문서 검토 등 실무적인 적용 사례를 다뤘다. 페르소나 설정과 맞춤형 학습 로드맵 설계를 통해 효율을 높이는 방안을 설명했다.

GoModel, 11개 AI 모델을 단일 API로 통합하는 Go 기반 게이트웨이

GoModel, 11개 AI 모델을 단일 API로 통합하는 Go 기반 게이트웨이

Go로 작성된 AI 게이트웨이 GoModel이 공개되었다. 11개 AI 프로바이더를 단일 OpenAI API 규격으로 통합한다. 2계층 캐시와 관리 대시보드를 내장해 운영 효율을 높였다.

DataCenter.FM, AI 데이터센터 소음으로 구현한 버블의 청각화

DataCenter.FM, AI 데이터센터 소음으로 구현한 버블의 청각화

DataCenter.FM(데이터센터 소음을 제공하는 앱)이 공개되었다. AI 인프라의 물리적 소음을 배경음으로 제공해 버블 현상을 풍자한다. 거대 모델 운영에 필요한 물리적 비용과 환경적 영향을 환기한다.

AI 에이전트 37,000줄 코드의 함정과 ROI 20%의 현실

AI 에이전트 37,000줄 코드의 함정과 ROI 20%의 현실

경영진들이 AI 에이전트를 통한 가짜 생산성 착각에 빠져 있다. 실제 기업의 90%는 AI 도입 후 측정 가능한 생산성 향상이 없었다. 토큰 소비량만 늘리는 토큰맥싱 현상이 기업 내부에 확산 중이다.

Gen Z AI 희망 지수 18% 하락과 강제 도입의 역설

Gen Z AI 희망 지수 18% 하락과 강제 도입의 역설

Gen Z의 AI 희망 지수가 27%에서 18%로 하락했다. 74%가 AI를 사용하지만 80%는 학습 능력을 저해한다고 믿는다. 대학과 기업의 강제적 AI 도입이 젊은 층의 반발을 키우고 있다.

머스크의 xAI, OpenAI 모델로 Grok 학습시켰다 인정

머스크의 xAI, OpenAI 모델로 Grok 학습시켰다 인정

일론 머스크가 xAI의 Grok을 OpenAI 모델로 학습시켰다고 인정했다. 이는 거대 모델의 지식을 작은 모델에 옮기는 증류 기술을 사용한 것이다. 머스크는 현재 AI 업계에서 Anthropic을 가장 뛰어난 기업으로 꼽았다.

PyTorch Lightning 공급망 공격, 개발 환경 전방위 탈취

PyTorch Lightning 공급망 공격, 개발 환경 전방위 탈취

PyPI 패키지 lightning 버전 2.6.2와 2.6.3에서 악성 코드가 발견되었다. 해당 패키지는 설치 즉시 환경 변수와 클라우드 자격 증명을 탈취한다. 공격자는 Claude Code와 VS Code의 설정 파일을 악용해 지속성을 확보한다.

30억 파라미터로 구현한 Qwen3.6-35B-A3B의 코딩 효율

30억 파라미터로 구현한 Qwen3.6-35B-A3B의 코딩 효율

Qwen3.6-35B-A3B 모델이 30억 개의 활성 파라미터로 출시되었다. SWE-bench Verified에서 73.4점을 기록하며 코딩 능력을 입증했다. 저사양 GPU 환경에서도 고성능 코딩 에이전트 운용이 가능해졌다.