KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 90 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 46 pt3. gpt-oss-120b (high) 39 pt4. GPT-5.6 Luna (max) 27 pt5. GPT-5.6 Terra (max) 22 pt

AI 뉴스

글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

GLM-5.3 API 출시, 토큰 단가는 동결했지만 작업 비용은 올랐다

GLM-5.3 API 출시, 토큰 단가는 동결했지만 작업 비용은 올랐다

z.ai가 코딩 및 에이전트 성능을 강화한 GLM-5.3을 API로 공개했다. 입력 140만 원/출력 440만 원(백만 토큰당)으로 전작과 가격을 동결했다. 토큰 단가는 같으나 답변이 길어져 실제 작업당 비용이 상승했음을 주의해야 한다.

모델·프레임워크 제약 없앤 Block의 Berd, Apache 2.0로 에이전트 워크스페이스 공개

모델·프레임워크 제약 없앤 Block의 Berd, Apache 2.0로 에이전트 워크스페이스 공개

Block이 다양한 AI 모델과 에이전트 도구를 통합 관리하는 데스크톱 앱 Berd를 Apache 2.0 라이선스로 공개했다. Tauri 2와 React 19 기반으로 구축되었으며, ACP를 통해 Goose 프레임워크와 연동해 로컬 파일 및 도구에 직

GitHub의 연간 257회 장애 틈새, Cursor가 호스팅 플랫폼 'Origin'으로 진입

GitHub의 연간 257회 장애 틈새, Cursor가 호스팅 플랫폼 'Origin'으로 진입

AI 에디터 Cursor가 GitHub의 기능을 대체하는 코드 호스팅 플랫폼 'Origin'을 출시했다. GitHub의 잦은 장애와 성능 저하를 배경으로 하며, 기존 GitHub 저장소와의 상호운용성을 지원한다. 실무자는 '에이전트 네이티브' 기능의

애플, 시리 AI 연동 카메라 탑재 에어팟 준비

애플, 시리 AI 연동 카메라 탑재 에어팟 준비

애플이 시각 지능(Visual Intelligence) 기능을 위해 카메라를 탑재한 에어팟을 준비 중이다. 저해상도 카메라와 클라우드 전송 알림 LED, 머리카락 가림 감지 오류 코드가 macOS 26.7 RC 버전에서 확인됐다. 사용자는 저해상도 제

OpenAI, 30분 내 이상 탐지 및 네트워크 격리 강화로 보안 체계 재편

OpenAI, 30분 내 이상 탐지 및 네트워크 격리 강화로 보안 체계 재편

OpenAI가 모델 테스트 중 사고 확산을 막기 위한 네트워크 격리와 실시간 모니터링 정책을 도입했다. 이상 행위 탐지 시 30분 내 알림을 목표로 하며, 이에 따른 연산 비용은 약 20%로 추산된다. AI 보안 설계자는 보안 오버헤드(20%)와 탐지

Perplexity, 인도 Airtel과 Pro 무료 제공 후 매출 60% 증가

Perplexity, 인도 Airtel과 Pro 무료 제공 후 매출 60% 증가

Perplexity가 인도 통신사 Airtel 고객에게 Pro 구독권을 12개월간 무료로 제공하는 성장 실험을 진행했다. 7개월간 5600만 건의 다운로드를 기록했으며, 무료 혜택 종료 시점과 맞물려 인도 내 인앱 결제 매출이 약 60% 증가했다. 자

“정답 대신 가이드 준다”, OpenAI가 공개한 청소년 전용 'ChatGPT for Teens'

“정답 대신 가이드 준다”, OpenAI가 공개한 청소년 전용 'ChatGPT for Teens'

OpenAI가 학습 보조와 안전 장치를 강화한 'ChatGPT for Teens'를 출시했다. 정답 대신 단계별 가이드를 제공하는 스터디 모드와 보호자 제어 기능을 탑재했다. 에듀테크 개발자는 모델 스펙의 '18세 미만 원칙'을 통해 연령별 가드레일

AI 에이전트의 개방형 연구 수행 능력 한계와 강화학습 제약 확인

AI 에이전트의 개방형 연구 수행 능력 한계와 강화학습 제약 확인

AI 에이전트가 스스로 가설을 세우고 연구를 수행하는 개방형 연구 능력을 평가한 실험 결과가 공개됐다. 에이전트는 합성 데이터셋 기반의 부적절한 실험을 수행하고 피드백 반영 및 자원 관리에 실패하며 학술적 기여도를 내지 못했다. 연구자는 강화학습(RL

구글, AI 학습용 데이터 확보 위해 스피릿 항공 데이터 1,000만 달러에 낙찰

구글, AI 학습용 데이터 확보 위해 스피릿 항공 데이터 1,000만 달러에 낙찰

구글이 파산 절차를 밟고 있는 미국 스피릿 항공의 비식별 데이터를 낙찰받았다. 1,000만 달러에 확보한 데이터에는 이메일 1억 건, 고객 서비스 통화 녹음 3,000만 건 등이 포함됐다. 범용 LLM의 한계를 넘어 특정 산업 도메인 지식을 갖춘 모델

코딩은 Claude, 숙제는 ChatGPT... 실제 AI 사용 패턴 분석 결과

코딩은 Claude, 숙제는 ChatGPT... 실제 AI 사용 패턴 분석 결과

AI Observatory가 52개 모델의 대화 2.4만 건을 분석해 모델별 특화 사용 패턴을 확인했다. Grok은 뉴스·정치, Anthropic은 코딩, ChatGPT는 과제 수행에 주로 활용되는 것으로 나타났다. 기업의 대규모 데이터 보고서가 포착

179회 차량 조회 등 Flock 오남용 사례가 불러온 계약 해지 리스크

179회 차량 조회 등 Flock 오남용 사례가 불러온 계약 해지 리스크

Flock의 번호판 인식 시스템이 스토킹 등 경찰의 오남용 사례로 인해 계약 해지 및 법적 규제에 직면했다. 사건 번호 입력 의무화 등의 방어책을 도입했으나 허위 번호 입력이라는 루프홀이 여전히 존재한다. AI 감시 도구 도입 시 단순 성능보다 데이터

아마존, AI 모델 학습 위해 희귀 도서 수집 및 스캔 진행

아마존, AI 모델 학습 위해 희귀 도서 수집 및 스캔 진행

아마존이 LLM 학습 데이터 확보를 위해 희귀 도서를 구매해 스캔하고 있다. 2022년 이전의 인간 작성 데이터를 확보해 모델 붕괴를 방지하려는 목적이다.

구글 크롬, AI 자동화 스타트업 릴레이(Relay) CEO 및 핵심 인력 영입

구글 크롬, AI 자동화 스타트업 릴레이(Relay) CEO 및 핵심 인력 영입

AI 워크플로우 자동화 스타트업 릴레이가 서비스를 종료하고 창업자를 포함한 주요 인력이 구글 크롬 팀에 합류한다. 제이콥 뱅크 CEO는 구글 크롬의 제품 담당 부사장(VP of Product)으로 부임해 제품 및 개발자 관계 팀을 총괄한다. 릴레이 유

GitHub 미러링과 완전 이전을 가르는 Cursor Origin의 에이전트 네이티브 전략

GitHub 미러링과 완전 이전을 가르는 Cursor Origin의 에이전트 네이티브 전략

Cursor가 AI 에이전트와 코드가 한 공간에서 작동하는 코드 호스팅 플랫폼 'Origin'을 출시했다. GitHub 미러링과 기존 GitHub Actions 워크플로우 호환성을 통해 마이그레이션 리스크를 제거했다. CTO는 전체 PR 중 에이전트

MIT·하버드 연구진, 복합 AI 시스템의 '역할 이탈' 방지하는 Role Anchor 공개

MIT·하버드 연구진, 복합 AI 시스템의 '역할 이탈' 방지하는 Role Anchor 공개

MIT와 하버드 연구진이 복합 AI 시스템의 모듈이 지정된 역할을 벗어나는 '역할 이탈(Role Drift)' 현상을 해결하는 Role Anchor 기술을 공개했다. 최종 정답률만 높이는 강화학습 과정에서 발생하는 모듈 간 역할 붕괴를 막기 위해 역할

AI;DR 등장, '빌려온 역량'이 만든 가짜 확신에 대한 거부감 확산

AI;DR 등장, '빌려온 역량'이 만든 가짜 확신에 대한 거부감 확산

AI 생성 콘텐츠를 그대로 복사해 붙여넣는 행위에 반대하는 'AI;DR(AI; Didn't Read)' 개념이 등장했다. 정교한 결과물과 작성자의 실제 이해도 사이의 간극인 '빌려온 역량'과 이로 인한 소통 저하가 핵심 배경이다. 실무자는 AI가 모호

Heidi가 증명한 의료 AI 글로벌 확장 조건: 지역별 데이터 격리와 통합 벡터 검색

Heidi가 증명한 의료 AI 글로벌 확장 조건: 지역별 데이터 격리와 통합 벡터 검색

Heidi Scribe가 190개국에서 주당 270만 건의 환자 상호작용을 처리하며 글로벌 규모의 의료 AI 운영 모델을 입증했다. 지역별 논리적 격리 배포와 MongoDB Atlas의 통합 벡터 검색을 통해 규제 준수와 API 지연 시간 33% 감소

내 PC와 폰에서 AI 강제 주입 끄는 법: OS부터 브라우저까지 설정 가이드

내 PC와 폰에서 AI 강제 주입 끄는 법: OS부터 브라우저까지 설정 가이드

OS와 브라우저, 업무 앱 곳곳에 기본 탑재된 AI 기능을 수동으로 끌 수 있는 설정법을 정리했다. Windows 11의 Copilot 삭제부터 크롬의 숨겨진 플래그 설정, 애플 인텔리전스 비활성화까지 구체적인 경로를 제공한다. AI의 자동 제안이나

Groq, 3억 5천만 달러 투자 유치하며 'AI 칩 제조'에서 '네오클라우드'로 전환

Groq, 3억 5천만 달러 투자 유치하며 'AI 칩 제조'에서 '네오클라우드'로 전환

AI 칩 스타트업 Groq가 3억 5천만 달러의 신규 자금을 조달하며 네오클라우드 기업으로의 사업 전환을 가속화한다. 디스럽티브(Disruptive)가 주도하고 엔비디아가 참여한 이번 투자로 기업 가치는 35억 달러로 책정됐다. 2027년까지 인프라

앤스로픽의 '안전' 프레임, 경쟁 모델 개발 시 성능을 은밀히 낮춘다

앤스로픽의 '안전' 프레임, 경쟁 모델 개발 시 성능을 은밀히 낮춘다

앤스로픽이 'AI 안전'을 명분으로 경쟁 모델 개발을 방해하는 접근 제어 체계를 구축했다. 'Fable' 사례에서 확인됐듯 특정 작업 분류 시 모델 답변의 질을 사용자 몰래 낮추는 방식이 사용됐다. 폐쇄형 API에 의존하는 실무자는 ToS의 '경쟁 시

Copilot이 만든 보안 구멍, AI 에이전트가 5일 만에 뚫었다

Copilot이 만든 보안 구멍, AI 에이전트가 5일 만에 뚫었다

GitHub Copilot Autofix가 Snowflake 저장소에 스크립트 주입 취약점을 생성했다. AI 보안 도구 Red Agent가 이를 발견해 Jira 인증 정보까지 탈취하는 데 성공했다. AI가 제안한 코드 수정이 기존 보안 패턴을 삭제하고

Tithon, .py 파일 기반 노트북 도구 공개... 커널 연결 끊김 시 출력 복구 지원

Tithon, .py 파일 기반 노트북 도구 공개... 커널 연결 끊김 시 출력 복구 지원

JupyterLab의 연결 끊김 시 출력 손실 문제를 해결하는 .py 기반 노트북 도구 'Tithon'이 공개됐다. VS Code 확장 프로그램과 백그라운드 데몬 구조를 통해 커널 상태를 유지하며, 실행 기록을 SQLite 데이터베이스에 저장한다. P

xpander, 모델·프레임워크 독립적 AI 에이전트 제어 플랫폼 공개

xpander, 모델·프레임워크 독립적 AI 에이전트 제어 플랫폼 공개

xpander가 모델과 프레임워크에 구애받지 않는 기업용 AI 에이전트 제어 플랫폼을 정식 출시했다. '유니버설 하네스(Universal Harness)'를 통해 AWS, GCP, Azure 및 에어갭 환경에서 에이전트 실행과 거버넌스를 통합 관리한다

OpenAI, GPT-5.6 솔·테라·루나 공개... 객체 탐지 46.2 mAP 기록

OpenAI, GPT-5.6 솔·테라·루나 공개... 객체 탐지 46.2 mAP 기록

OpenAI가 시각 이해 능력을 강화한 GPT-5.6 라인업인 Sol, Terra, Luna 모델을 공개했다. 최상위 모델 Sol은 객체 탐지 벤치마크에서 46.2 mAP@50를 기록하며 이전 세대(13.8 mAP) 대비 성능을 크게 높였다. 2,00

Qwen 3.8 27B, 17GB 파일 하나로 코딩부터 시각 분석까지 끝낸다

Qwen 3.8 27B, 17GB 파일 하나로 코딩부터 시각 분석까지 끝낸다

알리바바가 17GB 용량의 오픈 웨이트 모델 Qwen 3.8 27B를 공개했다. 추론 강도 조절 기능과 MTP 가속을 통해 로컬 환경에서도 코딩 에이전트와 시각 분석이 가능하다. 실무자는 기본 설정된 '과잉 추론'을 끄고 MTP 옵션을 적용해 속도를

AI 구현 비용 하락, 프로덕트 매니저의 '문제 발견' 역량 가치 높인다

AI 구현 비용 하락, 프로덕트 매니저의 '문제 발견' 역량 가치 높인다

AI 도구의 확산으로 소프트웨어 구현 장벽이 낮아졌으나 프로덕트 매니저(PM)의 역할은 여전히 필수적이다. 베네딕트 에반스는 PM의 핵심 역량을 문제 발견(Problem Discovery), 고객 가치(Value), 사업 성립 가능성(Viability

Stripe, AI 에이전트 병렬 운용 기반의 Staff 엔지니어 업무 체계 공개

Stripe, AI 에이전트 병렬 운용 기반의 Staff 엔지니어 업무 체계 공개

Stripe가 AI 에이전트를 활용해 업무 영향력을 확장하는 Staff 엔지니어의 새로운 역할 모델을 제시했다. Anthropic과 OpenAI의 최신 모델을 며칠 내 도입하는 파이프라인과 비용 추적용 Mac 앱 등 내부 개발 생산성 인프라를 운용한다

앤스로픽, EU AI법 준수를 위해 클로드 전 모델에 텍스트 워터마킹 도입

앤스로픽, EU AI법 준수를 위해 클로드 전 모델에 텍스트 워터마킹 도입

앤스로픽이 EU AI법 준수를 위해 모든 클로드(Claude) 모델의 생성 텍스트에 워터마크를 삽입한다. 추론 시 토큰 선택 확률을 조정하는 스테가노그래피 방식을 사용하며 200토큰 이상의 텍스트에 적용된다. 비밀 키를 보유한 제공자만 탐지 가능하며,

개인용 AI 에이전트 비전의 Meta, 하드웨어 제약과 신뢰 결핍이 변수

개인용 AI 에이전트 비전의 Meta, 하드웨어 제약과 신뢰 결핍이 변수

마크 저커버그가 모두를 위한 개인용 AI 에이전트 미래를 선언했다. 오프라인 작동 Glimmer와 고성능 Muse Spark로 모델 라인업을 이원화했다. 실무자는 모델 성능보다 전용 하드웨어 요구사항과 실제 배포 가능성을 확인해야 한다.

RAG 분류 시스템, '캐스케이드 아키텍처' 도입 시 추론 비용 6배 절감

RAG 분류 시스템, '캐스케이드 아키텍처' 도입 시 추론 비용 6배 절감

고위험 분류 작업을 위한 RAG 시스템의 추론 비용을 낮추고 감사 가능성을 높이는 캐스케이드 아키텍처가 제안됐다. 결정론적 규칙과 검색 레이어를 거쳐 모호한 사례 10~15%만 LLM에 전달함으로써 추론 비용을 약 6배 절감했다. 규제 산업의 개발자는