AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션
엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

Grok Bot을 활용한 구매 전담 에이전트 Haggle Bot이 기업 지출 최적화를 자동화했다. SaaS 미사용 계정 정리와 경쟁 견적 비교를 통해 10만 달러 이상의 직접 비용을 절감했다. 기업 내부 툴 권한을 가진 자율 에이전트 도입을 검토하는

컴퓨터 제어와 전문 작업에 최적화된 GPT-6 Astra가 공개되었다. OSWorld 2.0 작업 시간을 47% 단축하고 ExploitBench에서 100% 점수를 기록했다. 실무자는 Codex의 컨텍스트 보존 설정과 보안 취약점 탐지 능력을 확인해야

SageMaker HyperPod 운영을 자동화하는 오픈소스 제어 평면 InstantStart가 공개됐다. Web UI와 MCP 기반 AI 에이전트가 REST API를 통해 인프라 구축과 노드 복구를 단계별로 수행한다. 대규모 모델 학습 인프라를 구축

Gemini Omni 1.1 Flash가 출시되어 영상 생성의 제어권과 해상도가 대폭 향상되었다. 10초의 이전 맥락을 분석해 영상을 40초까지 확장하며, 360p 초안 생성 시 비용을 1/3로 낮췄다. 고품질 영상 워크플로우를 구축하려는 개발자는 G

Grok 4.6가 LatchBio의 벤치마크에서 생물학적 위험 작업 거부와 일상 연구 수행 능력을 동시에 입증했다. 위험 작업 거부율 59.2%, 루틴 작업 완료율 64.8%를 기록하며 두 지표 모두 50%를 상회한 유일한 모델로 확인됐다. 생물학 연

Gemini 3.7/3.6 Flash 및 3.5 Flash-Lite에 에이전틱 비디오 분석 기능을 도입했다. 고정 프레임 방식 대신 동적 스캔 방식을 사용하여 토큰 사용량은 최대 88%, 비용은 최대 66% 줄였다. 긴 영상 분석 비용이 부담되는 개발

MrBeast가 구글과 다년 파트너십을 맺고 Gemini와 Google Health를 영상 제작에 도입한다. 9월 5일 공개될 영상에서 Gemini를 활용해 정글, 사막, 북극의 극한 환경 생존 전략을 실행한다. AI가 복잡한 물류 계획과 극한 상황의

일회성 채팅 세션 대신 정체성과 전용 컴퓨터를 가진 '봇' 단위의 지속형 인터페이스를 도입했다. 아바타 모션을 통한 상태 표시와 3단계 컴퓨터 제어 권한으로 에이전트의 자율성과 가시성을 동시에 확보했다. 다수의 전문 봇을 관리하는 '비서장(Chief

Grok Bot이 전용 클라우드 PC를 통해 웹과 앱에서 자율적으로 업무를 수행하는 기능을 출시했다. 사용자의 작업 방식을 학습해 템플릿으로 공유하며, 영업·재무·엔지니어링 등 직군별 특화 작업을 24시간 수행한다. Grok 및 Cursor 엔터프라이

OpenAI Codex와 Amazon Bedrock 사이에 LiteLLM 게이트웨이를 배치해 중앙 제어 구조를 구축했다. Amazon ECS 기반으로 배포하며 모델 라우팅, 예산 설정, 사용량 텔레메트리를 통합 관리한다. 단순 IAM 권한 관리를 넘어

별도의 비전 타워 없이 텍스트와 이미지를 동시에 처리하는 멀티모달 인코더 NeoMME가 공개되었다. 260M 모델이 초당 51페이지를 인코딩하며, 압축 기술로 페이지당 저장 용량을 1.5MB에서 6kB로 낮췄다. OCR 전처리 비용을 제거하고 대규모

구글이 실시간 위성 데이터를 직접 학습해 매시간 예보를 업데이트하는 웨더넥스트 3를 공개했다. 이전 모델 대비 해상도를 5배 높였으며, 강수 예측 정확도를 최대 60%까지 끌어올렸다. 재생에너지 발전량 예측이 필요한 사업자와 고해상도 기상 데이터가 필

NBA 2K27을 포함한 26종의 신규 게임이 GeForce NOW에 추가된다. DLSS 5 3D-Guided Neural Rendering 기술을 통해 RTX 5080 기반 클라우드 환경에서 고정밀 조명과 질감을 구현한다. Ultimate 멤버십 사

NVIDIA가 1페타플롭 성능의 RTX Spark 하드웨어와 로컬 AI 에이전트 최적화 도구를 공개했다. llama.cpp와 vLLM 최적화로 추론 성능을 최대 1.9배 높이고, PAIR로 유휴 PC 자원을 통합한다. 24GB VRAM 이상의 RTX

Playco가 GPT-6 Astra를 도입해 게임 프로토타이핑 과정의 수동 수정 작업을 50% 줄였다. AI IDE인 Playbot을 통해 Unity와 Godot 엔진을 직접 제어하며 공간 추론과 UI 구현 능력을 높였다. 게임 개발 실무자는 AI가

OpenAI가 필수 서비스 보호를 위해 10억 달러 규모의 Daybreak 지원책을 발표했다. 모델 접근권과 '디펜스 팩토리'라는 에이전트 중심의 취약점 수정 아키텍처를 제공한다. 기반시설 운영자와 오픈소스 유지관리자는 지원 대상 여부와 적용 가능한

Amazon Quick이 Microsoft Outlook 연동을 통해 이메일 요약, 답장 초안 작성, 워크플로우 자동화 기능을 제공한다. Microsoft Graph API와 OAuth 2.0 인증을 기반으로 연결하며, 채팅 에이전트와 자동화 플로우로

Amazon Bedrock AgentCore를 통해 개발 생명주기 전반에 AI를 결합한 AI-DLC 구현 사례를 공개했다. SQL 스키마 기반 ER 다이어그램 자동 생성과 멀티 에이전트 기반 코드 보안 분석 시스템을 레퍼런스로 제공한다. AI 에이전트

Google이 실시간 위성 데이터를 학습해 1시간 단위로 업데이트하는 기상 AI 모델 WeatherNext 3를 공개했다. 기존 25km 해상도를 5km까지 정밀화해 5배 더 세밀해졌으며, 강수 예측 정확도를 최대 60% 높였다. Google Clou

코딩 에이전트가 남긴 세션 로그를 인덱싱해 재사용 가능한 메모리로 전환하는 funes가 공개됐다. 로컬 Lance 데이터셋과 Hugging Face 허브를 연동해 벡터 및 BM25 검색 기반의 리콜 기능을 제공한다. 에이전트 간 컨텍스트 공유가 필요하

350M 소형 모델의 구조화된 출력 능력을 GRPO 학습으로 개선했다. 500개 샘플과 100단계 학습만으로 IFStruct 점수를 22.6%에서 29.7%로 올렸다. 소형 모델을 다운스트림 시스템에 연결하려는 실무자는 태스크 특화 보상 신호 설정을

TRL과 OpenEnv를 활용해 JS 코드로 수채화를 그리는 소형 모델 학습 파이프라인이 공개되었다. HPSv3와 Qwen3-VL-30B-A3B-Instruct를 조합한 보상 모델로 개인의 미적 취향을 학습시킨다. 소형 모델에 특정 도메인의 '취향'을

Amazon Bedrock AgentCore가 코드베이스를 분석해 아키텍처 다이어그램을 자동 생성하고 유지하는 파이프라인을 공개했다. 반복적 정제와 자가 수정 과정을 통해 단일 API 호출 대비 생성 신뢰도를 65%에서 95%로 끌어올렸다. CI/CD

Amazon Bedrock이 호주 리전에서 OpenAI GPT-5.6 Sol, Terra, Luna 모델 접근을 지원한다. 글로벌 교차 리전 추론과 100만 토큰 컨텍스트 창, 프롬프트 캐싱으로 성능과 비용을 최적화한다. 워크로드 성격에 맞는 모델 선

인프라 모니터링이 잡지 못하는 '침묵의 실패'를 잡는 대시보드 자동 검증 솔루션을 구축했다. Amazon Bedrock의 Claude 모델과 Rekognition을 활용해 탐지 시간을 72시간에서 1시간 미만으로 단축했다. BI 엔지니어는 LLM의 의

파편화된 운영 지식을 생성형 AI로 통합해 인력 증원 없이 지원 규모를 확장한다. 교육 영상의 SOP 자동화, RAG 기반 티켓 가이드, ML 리스크 예측을 2계층 구조로 구현한다. 운영 리더는 단순 티켓 수치보다 워크플로 가시성과 지식 추출 자동화

추론과 코딩 성능을 강화한 Gemini 3.8 Flash와 보안 특화 모델인 3.8 Flash Cyber가 공개됐다. 3.7 Flash의 비용과 속도를 유지하며 DeepSWE v1.1 등 주요 벤치마크에서 대형 모델 성능에 근접했다. 복잡한 작업 시

IBM이 Confluent와 협력해 실시간 시계열 파운데이션 모델(TSFM) 4종을 공개했다. Flink SQL 함수 호출만으로 별도 ML 스택 없이 실시간 예측과 이상 탐지를 구현한다. GPU 없이 CPU만으로 대규모 지표를 처리하려는 실무자는 모델

구글이 워크스페이스 앱 내에서 AI 이미지 생성과 편집이 가능한 Google Pics를 출시했다. Nano Banana 모델을 기반으로 Docs, Slides, Drive에 통합되어 탭 전환 없는 편집 환경을 제공한다. Google AI Pro 및 U

Gemini 3.7 Flash, 3.5 Transcribe, Omni 1.1 Flash 및 Tensor G6 기반 픽셀 11 시리즈를 출시했다. 3.7 Flash는 3.6 Flash 대비 토큰당 비용을 50% 절감하며 코딩 및 에이전트 성능을 강화했다