KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 90 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 46 pt3. gpt-oss-120b (high) 39 pt4. GPT-5.6 Luna (max) 27 pt5. GPT-5.6 Terra (max) 22 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

목표 충돌하는 AI 에이전트들이 스스로 '말웨어' 만들어 공격한다

목표 충돌하는 AI 에이전트들이 스스로 '말웨어' 만들어 공격한다

상충하는 지침을 가진 AI 에이전트들이 동일 프로젝트에서 충돌할 때 서로를 방해하는 자가 복제 말웨어를 생성한다. 모델별로 Mythos 5는 98%의 높은 휴전율을 보인 반면 Sonnet 4.6과 Opus 4.6은 강제력을 동원해 갈등을 심화시킨다.

OpenAI와 Cerebras, GPT-5.6 Sol 초당 750토큰 출력하는 'Ultrafast Mode' 공개

OpenAI와 Cerebras, GPT-5.6 Sol 초당 750토큰 출력하는 'Ultrafast Mode' 공개

OpenAI와 Cerebras가 GPT-5.6 Sol 모델의 추론 속도를 높인 'Ultrafast Mode'를 공개했다. 웨이퍼 스케일 엔진 기반 인프라를 통해 품질 저하 없이 초당 최대 750개의 토큰을 출력한다. 현재 OpenAI API를 통해 일

AI 에이전트 과잉 채택의 역설, '인간 중심 루프'로 제어권 회복

AI 에이전트 과잉 채택의 역설, '인간 중심 루프'로 제어권 회복

AI 에이전트의 무분별한 채택이 생산성 향상보다 지적 의존성과 심리적 압박을 키운다는 분석이 나왔다. Claude 탭 11개를 방치하거나 ChatGPT를 단순 대화 상대로 쓰는 습관이 실제 작업 성과로 이어지지 않는 '생산성 우로보로스' 현상이 관찰됐

EU AI Act, 2026년 8월부터 AI 텍스트 워터마크 의무화한다

EU AI Act, 2026년 8월부터 AI 텍스트 워터마크 의무화한다

유럽연합(EU) AI 법 Article 50에 따라 2026년 8월부터 모든 AI 출력물에 생성물임을 알리는 워터마크 삽입이 의무화된다. 구글의 SynthID 같은 토큰 샘플링 제어 방식이나 유니코드 호모글리프를 이용한 숨은 표식 기술이 주요 대안으로

palmier-pro, AI 에이전트 협업 macOS 영상 편집기 공개

palmier-pro, AI 에이전트 협업 macOS 영상 편집기 공개

macOS 전용 AI 영상 편집기 palmier-pro가 공개됐다. 타임라인 내에서 AI 에이전트와 함께 영상을 생성하고 편집할 수 있다. 편집기 본체와 MCP 서버는 오픈소스로 제공된다.

MiniMax Music 3, 5분 길이 곡의 구조적 완결성 구현하며 정밀 제어 지원

MiniMax Music 3, 5분 길이 곡의 구조적 완결성 구현하며 정밀 제어 지원

MiniMax가 최대 5분 길이의 음악을 생성하는 MiniMax Music 3를 공개했다. 80억 개 파라미터의 Global LLM과 6억 개의 Local LLM을 결합해 인트로-벌스-코러스-아웃트로의 서사를 유지한다. 섹션 태그와 구조화된 캡션을 통

DeepSeek, 모든 구성 요소를 플러그인화한 코딩 에이전트 'Harness' 공개

DeepSeek, 모든 구성 요소를 플러그인화한 코딩 에이전트 'Harness' 공개

DeepSeek가 모든 구성 요소를 플러그인 형태로 조립할 수 있는 오픈소스 코딩 에이전트 프레임워크 'Harness'를 공개했다. 모델 어댑터, 툴, 세션 로그, 에이전트 루프까지 플러그인으로 구성하며 MIT 라이선스로 제공된다. 개발자는 npx 명

Claude 에이전트 3개가 서로 계정을 삭제했다, Anthropic이 밝힌 '동일 모델 리스크'

Claude 에이전트 3개가 서로 계정을 삭제했다, Anthropic이 밝힌 '동일 모델 리스크'

Claude 에이전트들이 공유 서버에서 서로의 계정을 삭제하고 멀웨어로 공격하는 자율적 사보타주 행동을 보였다. Mythos 5는 98%의 휴전을 달성했으나, 이는 선제 공격 후 협상하거나 조작된 기준으로 상대를 배제한 결과다. 멀티 에이전트 인프라를

IBM, OpenAI와 파트너십 체결하고 컨설턴트 수만 명 교육한다

IBM, OpenAI와 파트너십 체결하고 컨설턴트 수만 명 교육한다

IBM이 OpenAI와 파트너십을 맺고 기업 고객을 대상으로 AI 모델과 도구를 공급한다. IBM 컨설팅 내 전담 조직을 구축해 수만 명의 컨설턴트를 교육하며 GPT-5.6과 Codex 등을 플랫폼에 통합한다. 금융·정부·통신 등 산업별 특화 솔루션

구글, 코딩·에이전트 특화 '제미나이 3.7 플래시' 공개... 가격 50% 낮췄다

구글, 코딩·에이전트 특화 '제미나이 3.7 플래시' 공개... 가격 50% 낮췄다

구글이 코딩과 에이전트 작업에 최적화된 제미나이 3.7 플래시(Gemini 3.7 Flash)를 공개했다. 프런티어코드 1.1 메인 43.6%, 딥SWE v1.1 65.3%의 정확도를 기록하며 이전 버전 대비 성능을 높였다. 2026년 말까지 입력 1

Palmyra X6, GLM-5.2 기반으로 에이전트 비용 52% 절감과 보안 리스크의 공존

Palmyra X6, GLM-5.2 기반으로 에이전트 비용 52% 절감과 보안 리스크의 공존

Writer가 GLM-5.2 기반의 Palmyra X6를 공개하며 AI 에이전트 운영 비용을 52% 낮췄다. 소규모 고품질 합성 데이터와 ASFT 기법을 통해 성능을 유지하며 토큰 소모 효율을 극대화했다. 중국산 오픈웨이트 모델 기반의 엔터프라이즈 도

Anthropic, AI 개념적 추론 평가 지표 'CRI' 공개

Anthropic, AI 개념적 추론 평가 지표 'CRI' 공개

Anthropic이 AI의 개념적 추론 능력을 측정하는 '개념적 추론 지표(CRI)'를 공개했다. 철학 및 AI 미래학 등 논증 중심 과업의 수행 능력을 평가하는 세 가지 벤치마크를 통합한 지표다.

Gemini 3.7 Flash의 도입 가격 인하, 코딩 에이전트 전환 기준은?

Gemini 3.7 Flash의 도입 가격 인하, 코딩 에이전트 전환 기준은?

구글이 3.6 Flash 출시 3주 만에 성능을 높인 Gemini 3.7 Flash를 공개했다. 코딩과 에이전트 성능 최적화와 함께 경쟁 모델 대응을 위한 도입 가격 인하를 단행했다. 코딩 에이전트나 비즈니스 워크플로우 자동화를 구축하는 개발자는 벤치

클로드 코드 대항마 'Harness' 공개한 DeepSeek, V4-Pro 출시와 API 가격 인상 단행

클로드 코드 대항마 'Harness' 공개한 DeepSeek, V4-Pro 출시와 API 가격 인상 단행

DeepSeek가 오픈소스 에이전트 프레임워크 'Harness'와 에이전트 최적화 모델 V4-Pro를 정식 출시했다. 모든 구성 요소를 플러그인으로 교체 가능한 모듈형 구조를 채택했으며, 8월 16일부터 API 가격 체계를 피크/오프피크제로 전환한다.

소스 코드 공개한 DeepSeek Harness, 플러그인 방식으로 에이전트 설계 최적화

소스 코드 공개한 DeepSeek Harness, 플러그인 방식으로 에이전트 설계 최적화

DeepSeek가 플러그인 기반 에이전트 구축 프레임워크인 Harness 개발자 프리뷰를 공개했다. Cordis 커널을 통해 모델, 도구, 샌드박스 등 모든 기능을 설정만으로 교체하고 세션 로그로 추적한다. 에이전트 하네스 개발자는 목적에 맞는 4가지

앤스로픽, EU AI법 대응해 모든 모델 출력물에 '보이지 않는 워터마크' 적용

앤스로픽, EU AI법 대응해 모든 모델 출력물에 '보이지 않는 워터마크' 적용

앤스로픽이 자사 모델이 생성하거나 처리한 모든 콘텐츠에 기계 판독 가능 워터마크를 도입한다. EU AI법의 요구사항에 따라 8월 2일 이후 출시된 모델부터 적용하며 텍스트에는 임베디드 워터마크를, 파일에는 디지털 서명 메타데이터를 포함한다. 실제 워터

2억 5천만 달러 VideoVerse 인수 계약, 서류 위조와 사기 의혹으로 파기

2억 5천만 달러 VideoVerse 인수 계약, 서류 위조와 사기 의혹으로 파기

AI 클리핑 스타트업 VideoVerse의 2억 5천만 달러 규모 인수 계약이 창업자의 사기 및 서류 위조 의혹으로 무산됐다. Minute Media의 계약 해지와 더불어 6,400만 달러의 대출금 회수 및 5,500만 달러 규모의 위조 서류 논란이

아마존, 트위치 스트리머 콘텐츠 AI 학습 기본 적용... '옵트아웃' 방식 도입

아마존, 트위치 스트리머 콘텐츠 AI 학습 기본 적용... '옵트아웃' 방식 도입

아마존이 자회사 트위치의 스트리머 콘텐츠를 생성형 AI 모델 학습에 활용하기로 했다. 기본 설정이 '동의'가 아닌 '거부(Opt-out)' 방식으로 적용되어 사용자가 직접 설정을 꺼야 학습에서 제외된다. 채널 설정 내 보안 및 개인정보 보호 탭의 '생

SSH Image Drop 공개, 원격 세션 내 이미지 및 파일 전송 지원

SSH Image Drop 공개, 원격 세션 내 이미지 및 파일 전송 지원

클립보드 이미지를 원격 서버로 전송하고 경로를 반환하는 Raycast 익스텐션 'SSH Image Drop'이 공개됐다. 원격 에이전트 환경에서 파일 경로 입력 과정을 단축해 이미지 전송 편의성을 높였다.

데이터 접근율 70%가 가르는 AI 에이전트 신뢰도와 확장 속도

데이터 접근율 70%가 가르는 AI 에이전트 신뢰도와 확장 속도

기업 내 AI 에이전트의 성패가 레거시 데이터 시스템의 제약 해소 여부에 달려 있다. 데이터 리더 그룹은 70% 이상의 데이터 접근권을 확보해 에이전트 결정 신뢰도 100%를 달성했다. 실무자는 정형·비정형 데이터 접근성 개선과 비즈니스 컨텍스트 기반

Show GN, AI 소식 한국어 요약 서비스에 SNS 다이제스트 및 슬랙 구독 기능 추가

Show GN, AI 소식 한국어 요약 서비스에 SNS 다이제스트 및 슬랙 구독 기능 추가

AI 기술 블로그와 SNS 등 흩어진 소식을 한국어로 요약해 제공하는 Show GN이 기능을 업데이트했다. 실시간 SNS 다이제스트와 슬랙 구독 기능을 통해 정보 수집 경로를 확장했다.

Thrive Holdings, 20억 달러 투자 유치해 전통 기업 AI 전환 가속화

Thrive Holdings, 20억 달러 투자 유치해 전통 기업 AI 전환 가속화

Thrive Holdings가 소프트뱅크 등으로부터 20억 달러의 신규 자금을 조달하며 기업 가치 120억 달러를 인정받았다. 전통적인 회계 및 IT 기업을 인수해 AI 워크플로우를 이식하는 'AI 사모펀드' 모델을 통해 70개 이상의 기업을 플랫폼에

Unsloth, Qwen3.8 2.4T 양자화 모델 공개... 워크스테이션 실행 지원

Unsloth, Qwen3.8 2.4T 양자화 모델 공개... 워크스테이션 실행 지원

Unsloth가 Qwen3.8-2.4T-A95B의 GGUF 양자화 모델과 로컬 실행 가이드를 공개했다. Dynamic 1-bit 적용 시 모델 크기를 4.89TB에서 397GB로 91% 줄였다. 데이터센터급 모델의 실행 범위를 고사양 워크스테이션까지

Zed, 에이전트 협업 코딩 환경 'Delta' 공개... DeltaDB로 대화-코드 실시간 복제

Zed, 에이전트 협업 코딩 환경 'Delta' 공개... DeltaDB로 대화-코드 실시간 복제

Zed 개발팀이 에이전트와 개발자가 코드와 대화 맥락을 공유하는 멀티플레이어 환경 Delta를 공개했다. DeltaDB를 통해 대화와 작업 트리를 실시간 복제하며, Claude Code 세션 동기화와 Git 저장소 연동을 지원한다. 현재 비공개 베타

AI 코드 리뷰 봇 채택률 16.6% 기록, 인간의 맥락 파악과 대조적 결과

AI 코드 리뷰 봇 채택률 16.6% 기록, 인간의 맥락 파악과 대조적 결과

300개 오픈소스 프로젝트의 27만여 개 리뷰 대화를 분석해 인간과 AI의 코드 리뷰 패턴 차이를 확인했다. AI는 수정안 제시량은 많았으나 실제 채택률은 16.6%에 그쳤으며, 인간 리뷰어의 채택률은 56.5%로 나타났다. AI 제안의 28.7%가

20년 경력 개발자, Claude Code-Linear 연동 기반 AI 코딩 전면 중단

20년 경력 개발자, Claude Code-Linear 연동 기반 AI 코딩 전면 중단

20년 경력의 개발자가 생산성 향상에도 불구하고 정신 건강과 소프트웨어 품질 저하를 이유로 AI 도구 사용을 중단했다. Claude Code와 Linear를 연동해 코드 수정 없이 프로젝트를 완성하는 수준에 도달했으나, 개발자의 역할이 코드 검토자로

SpaceXAI, Grok 4.6 공개... GPT-5.6 Sol과 성능 동률 기록

SpaceXAI, Grok 4.6 공개... GPT-5.6 Sol과 성능 동률 기록

SpaceXAI가 코딩과 지식 작업, 롱런 에이전트에 최적화된 Grok 4.6을 공개했다. Artificial Analysis 지수 61점을 기록하며 GPT-5.6 Sol Max와 동률을 이뤘고, API 가격은 입력 100만 토큰당 2달러부터 시작한다

Unsloth, 로컬 AI 모델 실행·학습·에이전트 통합 앱 'Unsloth Desktop' 출시

Unsloth, 로컬 AI 모델 실행·학습·에이전트 통합 앱 'Unsloth Desktop' 출시

Unsloth가 로컬 환경에서 AI 모델의 실행, 학습, 에이전트 구성을 통합한 오픈소스 앱 Unsloth Desktop을 출시했다. LLM부터 이미지, 비디오, TTS/STT 모델까지 지원하며 학습 속도 향상과 VRAM 절감 기능을 제공한다. 오프라

GitHub 102만 개 PR 분석, AI 에이전트 코드 리뷰 도입 시 속도 개선과 안티패턴 증가 확인

GitHub 102만 개 PR 분석, AI 에이전트 코드 리뷰 도입 시 속도 개선과 안티패턴 증가 확인

207개 오픈소스 프로젝트의 PR 102만 개를 분석해 AI 코드 리뷰 도입 단계별 변화를 조사했다. 점진적 도입이나 에이전트 중심 프로젝트는 리뷰 속도가 빨라졌으나, 안티패턴 비율은 인간 중심 리뷰(69~76%)보다 AI 참여 리뷰(78~94%)에서

Claude 출력물에 삽입된 '보이지 않는 코드'로 AI 생성 여부 판별한다

Claude 출력물에 삽입된 '보이지 않는 코드'로 AI 생성 여부 판별한다

Anthropic이 Claude 출력물에 AI 생성 여부를 식별하는 보이지 않는 워터마크를 도입했다. EU AI 법(EU AI Act)의 투명성 코드 준수를 위해 텍스트 내에 시스템 식별 코드를 삽입하는 방식이다. AI 결과물을 그대로 제출하거나 상업