KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 91 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. Wan 3.0 85 pt5. gemini-omni-1.1-flash 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 44 pt3. gpt-oss-120b (high) 36 pt4. GPT-5.6 Luna (max) 28 pt5. GPT-5.6 Terra (max) 21 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

14,629달러 주문을 6,143달러로 낮춘 Grok Bot의 구매 자동화

14,629달러 주문을 6,143달러로 낮춘 Grok Bot의 구매 자동화

Grok Bot을 활용한 구매 전담 에이전트 Haggle Bot이 기업 지출 최적화를 자동화했다. SaaS 미사용 계정 정리와 경쟁 견적 비교를 통해 10만 달러 이상의 직접 비용을 절감했다. 기업 내부 툴 권한을 가진 자율 에이전트 도입을 검토하는

Deep작업 시간 47% 줄이고 제로데이 취약점까지 찾아내는 GPT-6 Astra가 나왔다

작업 시간 47% 줄이고 제로데이 취약점까지 찾아내는 GPT-6 Astra가 나왔다

컴퓨터 제어와 전문 작업에 최적화된 GPT-6 Astra가 공개되었다. OSWorld 2.0 작업 시간을 47% 단축하고 ExploitBench에서 100% 점수를 기록했다. 실무자는 Codex의 컨텍스트 보존 설정과 보안 취약점 탐지 능력을 확인해야

클러스터 구축부터 복구까지 한 문장으로 끝내는 HyperPod InstantStart 오픈소스 공개

클러스터 구축부터 복구까지 한 문장으로 끝내는 HyperPod InstantStart 오픈소스 공개

SageMaker HyperPod 운영을 자동화하는 오픈소스 제어 평면 InstantStart가 공개됐다. Web UI와 MCP 기반 AI 에이전트가 REST API를 통해 인프라 구축과 노드 복구를 단계별로 수행한다. 대규모 모델 학습 인프라를 구축

Deep영상 제작 개발자라면 40초 확장과 4K 출력이 가능한 Gemini Omni 1.1 Flash를 확인하라

영상 제작 개발자라면 40초 확장과 4K 출력이 가능한 Gemini Omni 1.1 Flash를 확인하라

Gemini Omni 1.1 Flash가 출시되어 영상 생성의 제어권과 해상도가 대폭 향상되었다. 10초의 이전 맥락을 분석해 영상을 40초까지 확장하며, 360p 초안 생성 시 비용을 1/3로 낮췄다. 고품질 영상 워크플로우를 구축하려는 개발자는 G

위험 작업 거부와 루틴 연구 수행 모두 50% 넘긴 Grok 4.6의 생물 보안 성능

위험 작업 거부와 루틴 연구 수행 모두 50% 넘긴 Grok 4.6의 생물 보안 성능

Grok 4.6가 LatchBio의 벤치마크에서 생물학적 위험 작업 거부와 일상 연구 수행 능력을 동시에 입증했다. 위험 작업 거부율 59.2%, 루틴 작업 완료율 64.8%를 기록하며 두 지표 모두 50%를 상회한 유일한 모델로 확인됐다. 생물학 연

Deep토큰 88% 줄이고 정확도 높인 Gemini 3.7 Flash의 에이전틱 비디오 분석

토큰 88% 줄이고 정확도 높인 Gemini 3.7 Flash의 에이전틱 비디오 분석

Gemini 3.7/3.6 Flash 및 3.5 Flash-Lite에 에이전틱 비디오 분석 기능을 도입했다. 고정 프레임 방식 대신 동적 스캔 방식을 사용하여 토큰 사용량은 최대 88%, 비용은 최대 66% 줄였다. 긴 영상 분석 비용이 부담되는 개발

정글·사막·북극 생존법을 Gemini로 짠다, MrBeast의 구글 파트너십

정글·사막·북극 생존법을 Gemini로 짠다, MrBeast의 구글 파트너십

MrBeast가 구글과 다년 파트너십을 맺고 Gemini와 Google Health를 영상 제작에 도입한다. 9월 5일 공개될 영상에서 Gemini를 활용해 정글, 사막, 북극의 극한 환경 생존 전략을 실행한다. AI가 복잡한 물류 계획과 극한 상황의

채팅창을 닫아도 작업이 계속되는 '봇' 중심 인터페이스, Grok Bot의 설계 방식

채팅창을 닫아도 작업이 계속되는 '봇' 중심 인터페이스, Grok Bot의 설계 방식

일회성 채팅 세션 대신 정체성과 전용 컴퓨터를 가진 '봇' 단위의 지속형 인터페이스를 도입했다. 아바타 모션을 통한 상태 표시와 3단계 컴퓨터 제어 권한으로 에이전트의 자율성과 가시성을 동시에 확보했다. 다수의 전문 봇을 관리하는 '비서장(Chief

전용 클라우드 PC에서 웹과 앱을 직접 다루는 자율 작업자 Grok Bot 출시

전용 클라우드 PC에서 웹과 앱을 직접 다루는 자율 작업자 Grok Bot 출시

Grok Bot이 전용 클라우드 PC를 통해 웹과 앱에서 자율적으로 업무를 수행하는 기능을 출시했다. 사용자의 작업 방식을 학습해 템플릿으로 공유하며, 영업·재무·엔지니어링 등 직군별 특화 작업을 24시간 수행한다. Grok 및 Cursor 엔터프라이

모델 예산과 권한을 중앙 제어하는 LiteLLM 기반 Codex-Bedrock 연결 구조

모델 예산과 권한을 중앙 제어하는 LiteLLM 기반 Codex-Bedrock 연결 구조

OpenAI Codex와 Amazon Bedrock 사이에 LiteLLM 게이트웨이를 배치해 중앙 제어 구조를 구축했다. Amazon ECS 기반으로 배포하며 모델 라우팅, 예산 설정, 사용량 텔레메트리를 통합 관리한다. 단순 IAM 권한 관리를 넘어

인덱스 용량 255배 줄이고 260M 모델로 ColQwen2.5급 성능 낸 NeoMME

인덱스 용량 255배 줄이고 260M 모델로 ColQwen2.5급 성능 낸 NeoMME

별도의 비전 타워 없이 텍스트와 이미지를 동시에 처리하는 멀티모달 인코더 NeoMME가 공개되었다. 260M 모델이 초당 51페이지를 인코딩하며, 압축 기술로 페이지당 저장 용량을 1.5MB에서 6kB로 낮췄다. OCR 전처리 비용을 제거하고 대규모

Deep6시간 지연 없애고 5km 해상도로 매시간 예보하는 웨더넥스트 3

6시간 지연 없애고 5km 해상도로 매시간 예보하는 웨더넥스트 3

구글이 실시간 위성 데이터를 직접 학습해 매시간 예보를 업데이트하는 웨더넥스트 3를 공개했다. 이전 모델 대비 해상도를 5배 높였으며, 강수 예측 정확도를 최대 60%까지 끌어올렸다. 재생에너지 발전량 예측이 필요한 사업자와 고해상도 기상 데이터가 필

RTX 5080 클라우드 릭으로 구현하는 DLSS 5 기반 NBA 2K27

RTX 5080 클라우드 릭으로 구현하는 DLSS 5 기반 NBA 2K27

NBA 2K27을 포함한 26종의 신규 게임이 GeForce NOW에 추가된다. DLSS 5 3D-Guided Neural Rendering 기술을 통해 RTX 5080 기반 클라우드 환경에서 고정밀 조명과 질감을 구현한다. Ultimate 멤버십 사

1페타플롭 Blackwell 탑재 RTX Spark와 원클릭 로컬 에이전트 환경이 나왔다

1페타플롭 Blackwell 탑재 RTX Spark와 원클릭 로컬 에이전트 환경이 나왔다

NVIDIA가 1페타플롭 성능의 RTX Spark 하드웨어와 로컬 AI 에이전트 최적화 도구를 공개했다. llama.cpp와 vLLM 최적화로 추론 성능을 최대 1.9배 높이고, PAIR로 유휴 PC 자원을 통합한다. 24GB VRAM 이상의 RTX

수동 수정 50% 줄인 GPT-6 Astra, 게임 엔진 직접 제어로 프로토타이핑 속도 높였다

수동 수정 50% 줄인 GPT-6 Astra, 게임 엔진 직접 제어로 프로토타이핑 속도 높였다

Playco가 GPT-6 Astra를 도입해 게임 프로토타이핑 과정의 수동 수정 작업을 50% 줄였다. AI IDE인 Playbot을 통해 Unity와 Godot 엔진을 직접 제어하며 공간 추론과 UI 구현 능력을 높였다. 게임 개발 실무자는 AI가

10억 달러 지원과 '디펜스 팩토리'로 기반시설 보안망을 구축하는 OpenAI

10억 달러 지원과 '디펜스 팩토리'로 기반시설 보안망을 구축하는 OpenAI

OpenAI가 필수 서비스 보호를 위해 10억 달러 규모의 Daybreak 지원책을 발표했다. 모델 접근권과 '디펜스 팩토리'라는 에이전트 중심의 취약점 수정 아키텍처를 제공한다. 기반시설 운영자와 오픈소스 유지관리자는 지원 대상 여부와 적용 가능한

주당 5시간 아끼는 Amazon Quick의 Outlook 이메일 자동화 설정법

주당 5시간 아끼는 Amazon Quick의 Outlook 이메일 자동화 설정법

Amazon Quick이 Microsoft Outlook 연동을 통해 이메일 요약, 답장 초안 작성, 워크플로우 자동화 기능을 제공한다. Microsoft Graph API와 OAuth 2.0 인증을 기반으로 연결하며, 채팅 에이전트와 자동화 플로우로

SQL 스키마를 다이어그램으로 바꾸고 코드 보안을 자동 스캔하는 Bedrock AgentCore 구현체

SQL 스키마를 다이어그램으로 바꾸고 코드 보안을 자동 스캔하는 Bedrock AgentCore 구현체

Amazon Bedrock AgentCore를 통해 개발 생명주기 전반에 AI를 결합한 AI-DLC 구현 사례를 공개했다. SQL 스키마 기반 ER 다이어그램 자동 생성과 멀티 에이전트 기반 코드 보안 분석 시스템을 레퍼런스로 제공한다. AI 에이전트

6시간 시차를 1시간으로 줄이고 해상도 5배 높인 Google WeatherNext 3

6시간 시차를 1시간으로 줄이고 해상도 5배 높인 Google WeatherNext 3

Google이 실시간 위성 데이터를 학습해 1시간 단위로 업데이트하는 기상 AI 모델 WeatherNext 3를 공개했다. 기존 25km 해상도를 5km까지 정밀화해 5배 더 세밀해졌으며, 강수 예측 정확도를 최대 60% 높였다. Google Clou

코딩 에이전트의 과거 추론을 8배 저렴하게 불러오는 메모리 레이어 funes

코딩 에이전트의 과거 추론을 8배 저렴하게 불러오는 메모리 레이어 funes

코딩 에이전트가 남긴 세션 로그를 인덱싱해 재사용 가능한 메모리로 전환하는 funes가 공개됐다. 로컬 Lance 데이터셋과 Hugging Face 허브를 연동해 벡터 및 BM25 검색 기반의 리콜 기능을 제공한다. 에이전트 간 컨텍스트 공유가 필요하

Deep100단계 GRPO 학습으로 350M 소형 모델을 2B 모델 수준의 JSON 출력기로 만드는 법

100단계 GRPO 학습으로 350M 소형 모델을 2B 모델 수준의 JSON 출력기로 만드는 법

350M 소형 모델의 구조화된 출력 능력을 GRPO 학습으로 개선했다. 500개 샘플과 100단계 학습만으로 IFStruct 점수를 22.6%에서 29.7%로 올렸다. 소형 모델을 다운스트림 시스템에 연결하려는 실무자는 태스크 특화 보상 신호 설정을

JS 함수 10개로 수채화를 그리게 만드는 TRL 기반 RL 학습 레시피

JS 함수 10개로 수채화를 그리게 만드는 TRL 기반 RL 학습 레시피

TRL과 OpenEnv를 활용해 JS 코드로 수채화를 그리는 소형 모델 학습 파이프라인이 공개되었다. HPSv3와 Qwen3-VL-30B-A3B-Instruct를 조합한 보상 모델로 개인의 미적 취향을 학습시킨다. 소형 모델에 특정 도메인의 '취향'을

단일 호출 신뢰도 65%를 95%로 높인 Amazon Bedrock AgentCore의 코드-다이어그램 자동화

단일 호출 신뢰도 65%를 95%로 높인 Amazon Bedrock AgentCore의 코드-다이어그램 자동화

Amazon Bedrock AgentCore가 코드베이스를 분석해 아키텍처 다이어그램을 자동 생성하고 유지하는 파이프라인을 공개했다. 반복적 정제와 자가 수정 과정을 통해 단일 API 호출 대비 생성 신뢰도를 65%에서 95%로 끌어올렸다. CI/CD

100만 토큰 GPT-5.6 3종, 호주 리전 Bedrock에서 글로벌 추론으로 쓴다

100만 토큰 GPT-5.6 3종, 호주 리전 Bedrock에서 글로벌 추론으로 쓴다

Amazon Bedrock이 호주 리전에서 OpenAI GPT-5.6 Sol, Terra, Luna 모델 접근을 지원한다. 글로벌 교차 리전 추론과 100만 토큰 컨텍스트 창, 프롬프트 캐싱으로 성능과 비용을 최적화한다. 워크로드 성격에 맞는 모델 선

72시간의 탐지 지연을 1시간으로 줄인 AWS의 대시보드 자동 검증 시스템

72시간의 탐지 지연을 1시간으로 줄인 AWS의 대시보드 자동 검증 시스템

인프라 모니터링이 잡지 못하는 '침묵의 실패'를 잡는 대시보드 자동 검증 솔루션을 구축했다. Amazon Bedrock의 Claude 모델과 Rekognition을 활용해 탐지 시간을 72시간에서 1시간 미만으로 단축했다. BI 엔지니어는 LLM의 의

교육 영상으로 SOP 자동 생성하고 SLA 리스크 예측하는 AWS 지원 운영 체계

교육 영상으로 SOP 자동 생성하고 SLA 리스크 예측하는 AWS 지원 운영 체계

파편화된 운영 지식을 생성형 AI로 통합해 인력 증원 없이 지원 규모를 확장한다. 교육 영상의 SOP 자동화, RAG 기반 티켓 가이드, ML 리스크 예측을 2계층 구조로 구현한다. 운영 리더는 단순 티켓 수치보다 워크플로 가시성과 지식 추출 자동화

비용은 그대로인데 코딩·추론 성능은 프론티어급으로 올린 Gemini 3.8 Flash 출시

비용은 그대로인데 코딩·추론 성능은 프론티어급으로 올린 Gemini 3.8 Flash 출시

추론과 코딩 성능을 강화한 Gemini 3.8 Flash와 보안 특화 모델인 3.8 Flash Cyber가 공개됐다. 3.7 Flash의 비용과 속도를 유지하며 DeepSWE v1.1 등 주요 벤치마크에서 대형 모델 성능에 근접했다. 복잡한 작업 시

데이터 과학자 없이 CPU로 10만 개 지표를 예측하는 IBM Granite 시계열 모델

데이터 과학자 없이 CPU로 10만 개 지표를 예측하는 IBM Granite 시계열 모델

IBM이 Confluent와 협력해 실시간 시계열 파운데이션 모델(TSFM) 4종을 공개했다. Flink SQL 함수 호출만으로 별도 ML 스택 없이 실시간 예측과 이상 탐지를 구현한다. GPU 없이 CPU만으로 대규모 지표를 처리하려는 실무자는 모델

탭 이동 없이 Docs에서 이미지 고치는 Google Pics, Nano Banana 모델 탑재

탭 이동 없이 Docs에서 이미지 고치는 Google Pics, Nano Banana 모델 탑재

구글이 워크스페이스 앱 내에서 AI 이미지 생성과 편집이 가능한 Google Pics를 출시했다. Nano Banana 모델을 기반으로 Docs, Slides, Drive에 통합되어 탭 전환 없는 편집 환경을 제공한다. Google AI Pro 및 U

토큰 비용 반값으로 낮춘 Gemini 3.7 Flash와 Tensor G6 탑재 픽셀 11 공개

토큰 비용 반값으로 낮춘 Gemini 3.7 Flash와 Tensor G6 탑재 픽셀 11 공개

Gemini 3.7 Flash, 3.5 Transcribe, Omni 1.1 Flash 및 Tensor G6 기반 픽셀 11 시리즈를 출시했다. 3.7 Flash는 3.6 Flash 대비 토큰당 비용을 50% 절감하며 코딩 및 에이전트 성능을 강화했다