KO EN

AX BRIEF

AI 뉴스 · 벤치마크 · 기술 블로그 큐레이션

● LIVE
지능1. Claude Fable 5.1 (max with fallback) 100 pt2. Claude Fable 5 (with fallback) 96 pt3. Claude Opus 5 (max) 95 pt4. GPT-6 Astra (max) 95 pt5. GPT-5.6 Sol (max) 91 pt코딩1. Claude Fable 5.1 (max) 100 pt2. Claude Opus 5 (xhigh) 94 pt3. GPT-6 Astra (max) 91 pt4. Muse Spark 1.3 (xhigh) 81 pt5. Grok 4.5 (high) 81 pt이미지1. GPT Image 2 (high) 100 pt2. MAI-Image-2.6 93 pt3. GPT Image 1.5 (high) 90 pt4. Reve 2.1 88 pt5. Muse Image 85 pt비디오1. Gemini Omni Flash 100 pt2. Minimax H3 Max (post-trained by fal) 94 pt3. Dreamina Seedance 2.0 720p 91 pt4. gemini-omni-1.1-flash 85 pt5. Wan 3.0 85 pt가격1. Claude Fable 5.1 (max with fallback) 100 pt2. GPT-6 Astra (max) 100 pt3. Claude Fable 5 (with fallback) 100 pt4. Claude Opus 5 (max) 49 pt5. GPT-5.6 Sol (max) 39 pt속도1. Gemini 3.5 Flash-Lite 100 pt2. Muse Spark 1.3 (max) 46 pt3. gpt-oss-120b (high) 39 pt4. GPT-5.6 Luna (max) 27 pt5. GPT-5.6 Terra (max) 22 pt

AI 기술 블로그

엔지니어링·제품·전략 관점에서 기술 리더와 연구자들의 심층 인사이트를 큐레이션합니다.

4배 빠른 출력과 비용 1/3 절감, NVIDIA가 공개한 에이전트 최적화 모델과 라우터

4배 빠른 출력과 비용 1/3 절감, NVIDIA가 공개한 에이전트 최적화 모델과 라우터

NVIDIA가 30B MoE 모델 Nemotron 3.5 Lightning과 라우팅 라이브러리 NeMo Switchyard를 공개했다. Lightning은 기존 대비 최대 4배 빠른 출력을, Switchyard는 Opus 4.8 단독 사용 대비 비용을

Deep질문법을 넘어 '완료 기준'을 설계하는 스펙 엔지니어링의 시대

질문법을 넘어 '완료 기준'을 설계하는 스펙 엔지니어링의 시대

LLM 활용의 중심이 단순 질문(Prompt)에서 정밀한 요구사항 정의(Specification)로 이동하고 있다. ROPE 연구에 따르면 요구사항 중심 훈련이 사용자 능력을 20% 향상시켰으며, 이는 JSON 스키마나 SWE-bench 같은 검증 체

4.4mm 씨앗 크기 로봇 하나로 수술 기능 5가지 구현

4.4mm 씨앗 크기 로봇 하나로 수술 기능 5가지 구현

싱가포르 NTU 연구진이 무선 자기장으로 제어되는 4.4mm 크기의 다기능 수술 로봇을 개발했다. 자기장 방향에 따라 절개, 약물 방출, 조직 채취 등 5가지 기능을 1초 미만으로 전환하며 6자유도 이동을 지원한다. 임상 적용을 위해 향후 영상 기술

OpenAI, 보안 파트너사에 'Daybreak' 사이버 전용 모델 공급 확대

OpenAI, 보안 파트너사에 'Daybreak' 사이버 전용 모델 공급 확대

OpenAI가 보안 파트너사를 통해 프론티어 사이버 모델을 공급하는 Daybreak 프로그램을 확장한다. Daybreak Blue(방어)와 Red(공격/검증) 모델을 파트너사 제품과 서비스에 통합해 취약점 탐지와 수정을 가속한다. 기업은 자체 AI 구

실무자가 코딩 없이 구축하는 Microsoft 365 Copilot 에이전트 활용 가이드

실무자가 코딩 없이 구축하는 Microsoft 365 Copilot 에이전트 활용 가이드

단순 답변을 넘어 스스로 계정을 비활성화하거나 보고서를 초안하는 AI 에이전트 구축 환경이 공개됐다. Microsoft 365 Copilot의 노코드 빌더를 통해 자연어 설명과 데이터 연결만으로 맞춤형 에이전트를 만든다. 반복적인 보고서 작성이나 공유

DeepAmazon EKS에 IDE를 직접 올리는 SageMaker AI Spaces, GPU 효율 30% 높이기

Amazon EKS에 IDE를 직접 올리는 SageMaker AI Spaces, GPU 효율 30% 높이기

EKS 클러스터 내에서 JupyterLab과 Code Editor를 직접 실행하는 SageMaker AI Spaces 애드온이 공개됐다. 별도 구축 시 3~5일 걸리던 환경 설정을 5분으로 단축하고, GPU 활용률을 최대 30%까지 높인다. 인프라 팀

데이터 분석과 시각화를 자동화하는 구글 애즈·애널리틱스의 Gemini AI 에이전트

데이터 분석과 시각화를 자동화하는 구글 애즈·애널리틱스의 Gemini AI 에이전트

구글 애즈와 애널리틱스에 Gemini 기반 AI 에이전트 'Ask Advisor'를 도입했다. 텍스트 프롬프트 기반의 대시보드 시각화와 유사 기업 성과 벤치마킹 기능을 제공한다. 마케팅 실무자는 수동 리포트 작성 공수를 줄이고 AI 요약 기반의 전략

스프레드시트 버린 OpenAI, '제로데이 결산' 만드는 AI 네이티브 재무 설계

스프레드시트 버린 OpenAI, '제로데이 결산' 만드는 AI 네이티브 재무 설계

OpenAI가 재무 프로세스를 AI 중심으로 재설계해 실시간 결산과 자동 예측 체계를 구축했다. 해커톤을 통한 맞춤형 GPT 개발과 Codex를 활용한 도구 제작으로 정적 보고서를 실시간 대시보드로 대체했다. 재무 실무자는 단순 데이터 취합에서 벗어나

B200에서 TTFA 32ms 달성, NVIDIA Magpie TTS로 제어하는 실시간 음성 에이전트

B200에서 TTFA 32ms 달성, NVIDIA Magpie TTS로 제어하는 실시간 음성 에이전트

NVIDIA가 12개 언어를 지원하는 364M 파라미터 규모의 오픈 웨이트 TTS 모델 Magpie를 공개했다. B200 GPU 기준 첫 오디오 출력 시간(TTFA) 32ms와 320배의 처리 속도를 통해 실시간 대화 수준의 지연 시간을 구현했다. 자

1시간 금융 보고서를 5분으로, GPT-5.6 Sol이 구현한 편집 가능 리포트

1시간 금융 보고서를 5분으로, GPT-5.6 Sol이 구현한 편집 가능 리포트

Model ML이 GPT-5.6 Sol을 도입해 편집 가능한 PPT와 엑셀을 자동 생성하는 금융 워크플로우를 구현했다. PPT 완성도 100% 달성 및 엑셀 토큰 사용량 36% 절감 등 기존 모델 대비 효율과 정확도를 높였다. 금융 실무자는 최종 결과

SSI와 바이브 코딩까지, 2026년 AI 실무자가 추적해야 할 10인의 기술 지표

SSI와 바이브 코딩까지, 2026년 AI 실무자가 추적해야 할 10인의 기술 지표

2026년 AI 산업은 모델 구축, 인프라, 학술, 안전성이라는 4가지 핵심 축으로 재편되었다. SSI 설립과 200억 달러 규모의 Perplexity 등 구체적인 지표가 기술적 방향성을 결정한다. 실무자는 각 리더가 제공하는 전용 리소스를 통해 차세

스스로 양자화하고 배포하는 30B 로컬 멀티모달 모델, Meta Muse Glimmer 공개

스스로 양자화하고 배포하는 30B 로컬 멀티모달 모델, Meta Muse Glimmer 공개

Meta가 30B 파라미터 규모의 오픈소스 멀티모달 모델 Muse Glimmer를 공개했다. 2B 비전 인코더와 DFlash 투기적 디코딩을 통해 이미지·영상 처리 속도와 효율을 높였다. 로컬 환경에서 모델 최적화와 배포를 자동화하려는 AI 엔지니어는

H200 한 대로 32K 롱컨텍스트 지식 증류가 가능해진 VRAM 최적화 기법

H200 한 대로 32K 롱컨텍스트 지식 증류가 가능해진 VRAM 최적화 기법

지식 증류(KD) 비용을 획기적으로 낮춰 단일 GPU에서도 롱컨텍스트 모델 학습이 가능해졌다. 오프라인 Top-K 로짓 캐싱과 청크 단위 KL 손실 함수를 통해 VRAM 사용량을 최대 15.6배 줄였다. 대규모 모델을 경량화하려는 실무자는 전체 보카블

2027년까지 GPU 7만 개 투입, Firebird가 구축하는 CIS 최대 AI 팩토리

2027년까지 GPU 7만 개 투입, Firebird가 구축하는 CIS 최대 AI 팩토리

Firebird가 아르메니아에 NVIDIA와 Dell 기반의 CIS 지역 최대 AI 팩토리를 구축했다. 2027년까지 Rubin 및 Blackwell GPU 7만 개와 300MW 전력 용량을 확보할 계획이다. CIS 지역 내 자체 모델 개발 및 인프라

업무 자동화에서 모델 튜닝까지, 실무자용 무료 AI 학습 경로 5가지

업무 자동화에서 모델 튜닝까지, 실무자용 무료 AI 학습 경로 5가지

현대 AI 실무에 필수적인 LLM, RAG, 에이전트 학습을 위한 무료 코스 5종을 제안한다. 입문자용 업무 활용법부터 엔지니어용 모델 튜닝 및 프로덕션 구축까지 단계별 경로를 제공한다. 자신의 현재 기술 수준과 목표(단순 활용, 프로토타입 제작, 시

11.2조 토큰 학습한 SmolLM3, 3B 규모로 Llama-3.2-3B 성능 추월

11.2조 토큰 학습한 SmolLM3, 3B 규모로 Llama-3.2-3B 성능 추월

Hugging Face가 11.2조 개의 토큰을 학습한 3B 규모의 SLM인 SmolLM3를 공개했다. 128k 컨텍스트 윈도우와 듀얼 모드 추론을 지원하며 특정 벤치마크에서 4B 모델을 앞서는 수치를 기록했다. 단일 소비자용 GPU 환경에서 도메인

Astra, 인간 개입 없는 제로데이 공격 가능성 확인

Astra, 인간 개입 없는 제로데이 공격 가능성 확인

차세대 모델 Astra가 인간 개입 없이 제로데이 취약점을 찾아 공격하는 임계(Critical) 수준의 사이버 능력을 보였다. 하드닝된 실제 시스템에서 기능적 익스플로잇을 개발하고 엔드투엔드 공격 전략을 수립하는 성능이 확인되었다. 보안 실무자는 모델

DeepAWS의 NHL 플레이오프 확정 자동화, 제약 프로그래밍으로 복잡한 타이브레이커 해결

AWS의 NHL 플레이오프 확정 자동화, 제약 프로그래밍으로 복잡한 타이브레이커 해결

AWS가 제약 프로그래밍과 트리 탐색을 이용해 NHL 플레이오프 진출 확정 시나리오 자동화 시스템을 구축했다. 7단계의 복잡한 타이브레이커 규칙을 CP-SAT 솔버로 처리하여 4개 시즌 데이터에서 공식 결과와 100% 일치함을 검증했다. 복잡한 조합

로그 분석 30분을 자동화로: Amazon Bedrock 기반의 장애 원인 분석 파이프라인

로그 분석 30분을 자동화로: Amazon Bedrock 기반의 장애 원인 분석 파이프라인

TReNDS가 Amazon Bedrock과 Strands Agents SDK를 활용해 장애 원인 분석(RCA)을 자동화했다. CloudWatch 로그에서 에러를 감지해 소스 코드와 컨텍스트를 스스로 조회하고 분석 결과를 SNS로 전송한다. 인프라 내

도움과 자립 사이의 균형, TutorMoments가 측정한 AI 튜터의 적정 개입 기준

도움과 자립 사이의 균형, TutorMoments가 측정한 AI 튜터의 적정 개입 기준

AI 튜터가 학생을 돕는 '스캐폴딩'과 스스로 생각하게 하는 '엄격함' 사이의 균형을 측정하는 TutorMoments 프레임워크가 공개됐다. 실제 수학 튜터링 데이터 462건과 1,500개 이상의 교사 주석을 바탕으로, 프롬프트에 개입 기준을 명시했을

2.1조 토큰 학습한 1.7B 모델, 단 4단계 추론으로 고품질 텍스트 생성

2.1조 토큰 학습한 1.7B 모델, 단 4단계 추론으로 고품질 텍스트 생성

Categorical Flow Maps(CFM)를 1.7B 파라미터 규모로 확장해 텍스트 생성 가능성을 입증했다. 2.1T 토큰 학습 후 자가 증류를 통해 단 4회의 추론 단계만으로 데이터 수준의 엔트로피를 유지하며 텍스트를 생성한다. 추론 속도 최적

Amazon Bedrock 기반 Codex 사용량, OpenTelemetry로 팀별 가시성 확보

Amazon Bedrock 기반 Codex 사용량, OpenTelemetry로 팀별 가시성 확보

Amazon Bedrock에서 Codex를 사용하는 조직이 OpenTelemetry와 CloudWatch를 통해 사용량을 모니터링하는 방법을 공개했다. 로컬 컬렉터가 모델 요청 경로를 방해하지 않고 메트릭을 수집해 팀·부서·비용 센터별로 시각화한다.

수동 테스트에서 자동 최적화로, SageMaker Python SDK v3의 추론 추천 기능

수동 테스트에서 자동 최적화로, SageMaker Python SDK v3의 추론 추천 기능

SageMaker Python SDK v3.17.0부터 생성형 AI 추론 최적화 추천 기능이 노트북 워크플로우에 통합됐다. p90 TTFT와 처리량 등 데이터 기반 지표로 최적의 인스턴스와 프레임워크 설정을 자동 추천하고 즉시 배포한다. MLOps 엔

부동산 분석 9시간을 2시간으로 줄인 HSP GRUPPE의 세무 AI 운영 모델

부동산 분석 9시간을 2시간으로 줄인 HSP GRUPPE의 세무 AI 운영 모델

세무·법률 네트워크 HSP GRUPPE가 ChatGPT Enterprise를 도입해 전문직 업무 프로세스를 전환했다. 맞춤형 에이전트로 표준 업무를 자동화하고 부동산 투자 평가 시간을 9시간에서 2시간으로 단축했다. 단순 도구 활용을 넘어 에이전틱 A

DeepBedrock AgentCore, AI 트래픽 독점 막는 '2중 쿼터' 제어 기능 공개

Bedrock AgentCore, AI 트래픽 독점 막는 '2중 쿼터' 제어 기능 공개

Amazon Bedrock AgentCore gateway가 사용자별 AI 트래픽 제한 기능을 지원한다. 차원 키와 엔트리를 통해 RPM, CPS 등을 제어하며 고객 정의 제한과 서비스 쿼터를 2중 적용한다. 멀티 테넌트 AI 서비스를 운영하는 엔지니

생물학 답변 거부 85% 줄인 Fable 5, 의료·교육 활용 범위 넓힌다

생물학 답변 거부 85% 줄인 Fable 5, 의료·교육 활용 범위 넓힌다

Fable 5가 생물학 세이프가드 업데이트를 통해 오탐지율을 낮췄다. 분류기 재학습으로 생물학 관련 폴백 발생률을 약 85% 감소시켰다. 의료 실무자와 교육자는 임상 및 학습 활용 가능 여부를 확인해야 한다.

SMT-LIB 몰라도 된다, Amazon Bedrock 자동 추론 정책을 코딩 에이전트로 자동화하기

SMT-LIB 몰라도 된다, Amazon Bedrock 자동 추론 정책을 코딩 에이전트로 자동화하기

Bedrock의 자동 추론 정책 생명주기를 코딩 에이전트용 'Agent Skills'로 자동화했다. 6종의 스킬 세트를 통해 규칙 추출부터 배포, 검증까지 SMT-LIB 기반 워크플로를 코드로 관리한다. 정밀한 논리 검증이 필요한 금융·인사 정책 실무

GPT-5.6 Sol·Luna 공개, 무료 사용자 텍스트 채팅 무제한과 추론 강도 제어 도입

GPT-5.6 Sol·Luna 공개, 무료 사용자 텍스트 채팅 무제한과 추론 강도 제어 도입

GPT-5.6 Sol과 Luna를 출시하며 무료 사용자의 텍스트 채팅 제한을 완전히 없앴다. Sol 모델은 사실 오류를 최대 68% 줄였으며, 사용자가 추론 강도를 조절하는 슬라이더를 제공한다. 무료 사용자는 텍스트 무제한 이용 범위를, 유료 사용자는

구글 웨더넥스트, 사이클론 예측 리드타임 24시간 앞당기며 오픈소스 공개

구글 웨더넥스트, 사이클론 예측 리드타임 24시간 앞당기며 오픈소스 공개

사이클론 경로와 강도 예측 정확도를 높여 경보 발령 시점을 평균 하루 앞당겼다. 1,000개의 앙상블 시나리오와 FGN 구조를 통해 TPU 1대로 1분 만에 15일 예보를 생성한다. 기상 연구자와 실무자는 공개된 모델 가중치와 코랩 노트북을 통해 지역

Amazon Bedrock AgentCore, 단일 액션을 넘어 세션 전체의 행동과 비용을 제어한다

Amazon Bedrock AgentCore, 단일 액션을 넘어 세션 전체의 행동과 비용을 제어한다

에이전트의 자율적 행동으로 인한 보안 및 비용 리스크를 막는 인프라 제어 기능을 출시했다. 오픈소스 언어 Dogwood 기반의 시계열 정책과 게이트웨이 수준의 토큰 및 요청 제한을 제공한다. 에이전트의 예측 불가능한 동작으로 인한 예산 초과나 보안 사