AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션
글로벌 AI 기업과 스타트업의 투자·제품·정책·핵심 동향을 매일 정리합니다.

AI가 짠 코드를 사람이 일일이 검토하고 수정하는 단계에 머물러 있다. 클로드 코드 개발자 보리스 체르니는 AI 에이전트가 다른 에이전트를 지시해 코드를 무한 개선하는 '루프' 체계를 제시했다. 정답이 나올 때까지 연산량을 쏟아붓는 방식으로 품질을 높

AI 에이전트를 도입해도 실무자의 해결 노하우는 여전히 채팅창과 개인의 기억 속에 흩어져 있다. 모델을 매번 다시 학습시키지 않고 운영 경험을 지식화해 에이전트에게 전달하는 학습 시스템이 핵심이다. 데이터 패브릭과 관찰 가능성 도구를 통해 개별 에이전

Claude 기반 AI를 활용해 구글 API의 접근 제어 취약점을 자동 탐색한 보안 연구 사례가 공개됐다. 6만 개 이상의 APK에서 수집한 API 키와 discovery document를 결합해 1,500개 이상의 API를 테스트했으며, 총 50만

빅테크 기업들이 역대급 매출을 기록하면서도 동시에 대규모 해고를 단행하고 있다. 오라클이 1년간 2.1만 명을 감원하는 등 AI 도입을 인력 감축의 핵심 근거로 제시했다. 단순 비용 절감을 넘어 조직 계층을 없애고 AI 에이전트로 직무를 대체하는 구조

대부분의 AI 실무자는 GPT나 Claude 같은 독점 API의 성능과 편의성에 의존한다. 최근 오픈 모델이 선두 모델과 몇 달 차이까지 격차를 좁히며 독점 모델 의존도를 낮출 여지가 커졌다. Claude의 ID 인증 도입 같은 정책 변화는 실무자가

Slack 엔지니어링 팀이 기존 결정론적 E2E 테스트를 보완하기 위한 에이전트 기반 테스팅 실험 결과를 공개했다. Playwright MCP 방식은 복잡한 워크플로에서 실패율 12%를 기록하며 CLI 방식(20%)이나 코드 생성 방식(48%)보다 높

전 세계 소프트웨어의 기반인 오픈소스는 보안 취약점에 늘 노출되어 있습니다. OpenAI가 보안 기업 Trail of Bits와 협력해 오픈소스 버그를 고치는 'Patch the Planet'을 시작합니다. AI 보안 도구인 Codex Security

엔비디아가 유망 스타트업의 인재와 기술만 흡수하는 '노트-어콰이어-하이어' 전략을 구사하고 있다. 핵심 경영진을 엔비디아에 뺏긴 Groq가 최근 6억 5,000만 달러의 신규 투자를 유치했다. 하드웨어 IP를 공유하게 된 Groq는 이제 LPU 기반의

AI 에이전트가 문제를 풀 때 거치는 사고 과정을 기록해 검토하는 기능이 주목받고 있다. Claude Code의 '확장 사고' 로그는 실제 추론 과정이 아닌 요약된 결과물임이 밝혀졌다. 원본 데이터 손실이 발생하는 구조여서 정밀한 감사 추적용으로는 부

AI 모델을 돌리는 데이터센터는 엄청난 양의 전력과 냉각수를 소비합니다. 엔비디아가 센터 내부 물 사용량을 거의 0으로 만드는 온수 냉각 기술을 공개했습니다. 하지만 전력 생산 과정의 물 소비까지 포함하면 전체 문제의 3분의 1만 해결한 셈입니다.

OpenAI의 소라처럼 화려한 AI 영상 모델들이 비용과 저작권 문제로 잇따라 중단되고 있습니다. 알리바바가 공개한 '해피호스 1.1'은 글로벌 랭킹 2위를 기록하며 기업용 시장의 대안으로 부상했습니다. 단일 모델로 영상과 음성을 동시에 처리하며 캐릭

스마트 스피커의 대명사 알렉사가 생성형 AI를 입고 진화하고 있다. 아마존이 6억 명 이상의 사용자를 보유한 인도 힌디어 시장에서 '알렉사+' 베타 테스트를 시작했다. 프라임 회원은 무료, 일반 유저는 월 구독료를 내는 수익 모델을 적용해 글로벌 확장

AI 모델 개발에는 막대한 양의 컴퓨팅 자원과 고성능 칩이 필수적입니다. 오픈소스 AI 스타트업 리플렉션 AI가 SpaceX와 최대 63억 달러 규모의 컴퓨팅 계약을 체결했습니다. 2026년 7월부터 월 1억 5천만 달러를 지불하며 엔비디아 GB300

특정 AI 기업의 모델 독점과 갑작스러운 접근 제한은 기업의 운영 리스크가 된다. Sakana AI가 여러 모델을 동적으로 조율하는 멀티에이전트 시스템 'Fugu'를 출시했다. Fugu Ultra는 코딩 및 추론 벤치마크에서 Claude Fable 5

MCP 서버와 훅 설정을 여러 에이전트 CLI에 한 번에 배포하는 도구인 agent-connector가 공개됐다. 42개 에이전트 CLI를 지원하며, 특정 사례에서 배포 코드를 20,322줄에서 76줄로 줄이는 수치를 기록했다. 개발자는 각 호스트의

상하이 AI 연구소가 LLM 에이전트가 자신의 운영 규칙을 스스로 최적화하는 'Self-Harness' 프레임워크를 공개했다. Terminal-Bench-2.0 테스트 결과 MiniMax M2.5, Qwen3.5, GLM-5 모델의 성능이 상대적으로

AI 에이전트에게 작업을 맡기면 정작 어디서 토큰이 낭비되는지 알기 어렵다. Agent-Blackbox는 Claude Code와 OpenCode의 실행 과정을 로컬에서 기록하고 세션 맵으로 보여준다. 반복된 파일 읽기와 낮은 캐시 활용도를 분석해 토큰

Claude Code의 세션 기억 상실 문제를 해결하는 로컬 메모리 도구 Recall이 공개됐다. TF-IDF와 TextRank 알고리즘을 통해 외부 API 호출 없이 로컬에서 세션 요약을 생성하며 numpy를 선택적 가속기로 사용한다. 개발자는 추가

초소형 LLM인 Qwen 3:0.6B를 활용해 RAG 검색 효율을 높이는 질문 분류기 구현 사례가 공개됐다. Unsloth와 QLora로 파인튜닝하고 카테고리를 불투명 ID로 매핑해 분류 정확도를 10%에서 92%로 높였다. 초소형 모델의 분류 성능을

에이전트 웹 리서치 툴 ax-grep이 공개됐다. 브라우저 없이 접근성 트리를 재현해 토큰 사용량을 3배 개선하고 메모리 사용량을 15배 줄였다. Codex, Claude Code, Antigravity를 지원한다.

AI가 코드 작성을 자동화하며 개발자의 역할이 직접 구현에서 설계와 검증 중심으로 이동하고 있다. 비결정적 AI 출력을 제어하기 위해 TDD 기반 산출물 분리와 결정적 검증 도구인 '하네스' 구축이 핵심으로 부상했다. 개발자는 프롬프트 작성을 넘어 A

AI 모델이 고도화되며 단순 기능 구현 서비스들이 '얇은 래퍼'로 전락해 흡수되는 추세다. 코딩 에이전트의 벤치마크 해결률이 13%에서 80%대로 급증하며 측정 가능한 지능은 공용재가 됐다. 결국 생존의 핵심은 모델이 훈련할 수 없는 사적 정답과 책임

AI 검색 엔진이 레딧이나 위키피디아 같은 사용자 생성 콘텐츠를 주요 정보원으로 활용한다. 단 11~15단어의 짧은 문구만으로도 AI의 추천 결과와 인용 자료를 특정 브랜드로 조작할 수 있다. LLM이 정확성보다 질의와의 어휘적 유사성을 우선시하는 구

클로드 코드를 기본 LLM으로 사용하는 IDE myDoo가 공개됐다. RAG 기반의 기억 공유와 웹 문서 게시, 반복 업무 자동화 기능을 제공한다. 개인 사용자는 무료로 이용 가능하다.

AI 코딩 에이전트가 불필요한 코드를 쓰지 않고 최소한의 코드만 남기게 하는 도구 ponytail이 공개됐다. 6단계 점검을 통해 과잉 설계를 막으며, 코드량 감소와 비용 절감 효과를 제공한다. Claude Code, Cursor 등 14개 에이전트와

스위스 AI 이니셔티브가 가중치와 데이터를 모두 공개한 파운데이션 모델 Apertus를 발표했다. 1,000개 이상의 언어를 지원하며 EU AI 법(EU AI Act) 기준을 준수한다.

앤스로픽이 클로드 사용자들을 대상으로 신원 확인(Identity Verification) 절차를 도입한다. 신원 확인 파트너사인 Persona를 통해 정부 발행 신분증과 셀카 사진을 제출받아 계정의 무결성을 검증한다. AI 서비스 이용 시 익명성 기반

엔비디아가 해시코프 볼트(HashiCorp Vault)의 오픈소스 포크 버전인 OpenBao를 공식 도입했다. 엔비디아는 서버리스 GPU 제어 평면인 NVCF의 쿠버네티스 포드에 비밀 정보를 주입하는 용도로 이를 사용한다. 기업은 벤더 종속성 탈피와

트럼프 행정부가 국가 안보 우려를 이유로 앤스로픽의 최신 AI 모델 두 종에 대해 서비스 중단을 명령했다. 수출 통제 명령에 따라 앤스로픽은 일반 공개 모델인 Fable 5와 기존 사용자용 Mythos 5를 오프라인으로 전환했다. AI 모델의 가드레일

애플이 iOS 27에서 시리(Siri) 외에 앱 전반에 걸쳐 작동하는 애플 인텔리전스 기능을 공개했다. 비용 분할, 에이전트 기반 비밀번호 업데이트, 온디바이스 기반 통화 컨텍스트 등 실무 중심 기능이 포함됐다. 사용자는 챗봇과의 대화가 아닌 기존 앱