이번 주 AI 업계는 모델 성능 경쟁과 가격 정책의 변화, 그리고 설계 방식의 전환이라는 세 가지 흐름이 동시에 나타났다.

앤스로픽의 클로드 Opus 5.5와 오픈AI의 GPT-6가 전략적 추론 능력을 두고 정면충돌했다. 오픈AI는 GPT-6 Saul과 Luna를 출시하는 동시에 API 가격을 50% 낮췄다. 가격 파괴가 시작됐다.

실제 구현 단계에서는 명암이 갈렸다. Bonsai 2는 장기 과제 수행 중 무한 루프에 빠지는 등 기술적 한계를 보였다. 반면 클로드는 이정표 설정과 Supabase 데이터베이스 통합 등 작업 흐름(workflow)을 효율적으로 처리하며 대조적인 모습을 보였다.

전문 서비스 업계의 인력 활용 방식도 변하고 있다. 주니어 직원들의 역할이 단순 초안 작성에서 편집 및 품질 검토 중심으로 빠르게 옮겨가는 추세다. 쓰는 시대에서 고르는 시대로 바뀌고 있다.

효율성을 극대화하려는 시도도 눈에 띈다. DHH는 서버 CPU와 메모리 사용량을 줄이기 위해 Hey 이메일 앱을 AI가 생성한 Rust 언어로 완전히 다시 짰다. 메타는 실시간 비디오 안경인 Muse와 Muse Charm 키체인을 선보이며 소비자 하드웨어 영역을 확장했다.

클로드는 시댄스 2.5 같은 비디오 생성 도구의 프롬프트 엔지니어링 영역까지 파고들었다. 이 밖에도 메타는 2D 및 3D 게임 제작을 위한 Meta Horizon Create를 출시했고, Grok 4.7은 성능과 비용 효율성을 개선했다. Odyssey는 인간과 AI가 공존하는 자율형(multi-agent) 시뮬레이션 월드 모델인 Agora 2를 공개했다.

01클로드 Opus 5.5와 GPT-5.6 Sol — 상세 설계와 빠른 결론의 차이

최상위 인공지능 모델들을 대상으로 리서치, 제품 개발, 시장 진입 전략, 출시 계획, 성장 운영 능력을 정면 비교하면 각기 다른 작업 스타일이 드러난다. 시장의 빈틈을 분석하거나 콘텐츠 기획안을 구성하는 등 복잡한 비즈니스 과제를 해결하는 방식에서 근본적인 차이가 확인됐다. 스타일의 차이가 명확하다.

주요 기업과 타겟 고객, 범용화 리스크, 시장의 빈틈을 분석한 결과, 클로드 Opus 5.5와 GPT-5.6 Sol 모두 새로운 비디오 스타트업의 성공 가능성이 있다고 판단했다. 다만 GPT-5.6 Sol의 전략적 결론 도출 속도가 더 빨랐다. GPT-5.6 Sol은 결과물 첫 페이지부터 단순한 '프롬프트-비디오' 도구 제작을 지양하고, 제작 전 어떤 콘텐츠를 만들지 결정하도록 돕는 작업 흐름(workflow)을 구축하라고 구체적으로 조언했다. 클로드 Opus 5.5 역시 비디오 모델 자체를 만드는 것은 최선의 기회가 아니라는 유사한 판단을 내렸으나, 전반적으로 더 깊고 포괄적인 시스템 설계안을 제시했다. 속도는 GPT, 깊이는 클로드다.

이러한 패턴은 다른 과제에서도 반복된다. 리서치 내용을 콘텐츠 기획안으로 바꿀 때 클로드 Opus 5.5는 일관되게 깊이 있는 내용을 담아냈고, GPT-5.6 Sol은 결과물을 더 깔끔하고 단순하게 유지했다. 트래픽 확보에 어려움을 겪는 기업을 분석할 때도 두 모델 모두 핵심 문제는 신규 방문자 유입이 아니라 고객 유지(retention)에 있다는 점을 정확히 짚어냈다. 다만 제안 방식을 다르게 구성했다. 한편 클로드 Opus 5.5는 출시 전 METR과 FrontierAI의 외부 성능 시험(eval)을 거쳤으며, 제시된 규칙과 제약 조건을 엄격히 준수하는 항목에서 테스트 모델 중 가장 높은 정렬(alignment) 점수를 기록했다. 정답은 같아도 풀어가는 방식이 다르다.

단순히 벤치마크 점수에 의존하기보다, 수행해야 할 업무의 성격에 따라 모델을 선택해야 한다는 분석이 나온다. 클로드 Opus 5.5는 세부 사항이 철저한 포괄적 엔드-투-엔드 시스템을 구축하는 데 강점이 있다. 반면 GPT 버전들은 군더더기 없는 단순함으로 핵심 권고안을 더 빠르게 도출하는 경향이 있다. 결국 용도에 맞는 선택의 문제다.

02오픈AI의 신모델 출시 — API 비용 50% 낮춘 GPT-6 Saul과 Luna

오픈AI가 개발자와 기업이 고성능 AI를 더 쉽고 저렴하게 사용할 수 있는 환경을 만든다. 신규 모델인 GPT-6 Saul과 Luna를 출시하며 AI 운영 규모를 확장하는 데 걸림돌이 됐던 비용과 기술적 장벽을 낮췄다. 진입 장벽이 무너졌다. 가장 눈에 띄는 변화는 API 가격(소프트웨어를 AI 모델에 연결할 때 내는 이용료)을 기존 대비 50% 인하한 점이다. 비용 절감과 더불어 사용 한도까지 늘려, 개발자들이 제한 없이 더 많은 요청과 데이터를 처리할 수 있게 됐다.

이번 플래그십 라인업의 신규 모델들은 GPT-6 Astra의 기술적 성과를 바탕으로, 실행 속도와 효율성을 극대화하는 데 집중했다. 오픈AI는 전문적인 요구사항에 맞춰 두 모델의 역할을 명확히 나눴다. GPT-6 Saul은 정밀함이 필수적인 전문 업무와 복잡한 코딩 등 고난도 작업에 최적화하면서도 비용 효율성을 챙겼다. 반면 Luna는 대규모로 처리해야 하는 일상적인 작업에 맞췄다. 속도와 효율을 우선해 대량의 작업 흐름(workflow)이 끊김 없이 빠르게 돌아가도록 설계했다.

이는 단순히 모델의 크기를 키우는 단계를 넘어, 지능을 어떻게 효율적으로 전달할 것인가로 전략의 중심이 이동했음을 의미한다. Astra 기반 기술을 정교화해 비용과 속도는 잡고 실행 능력은 더 높였다는 설명이다. 기업과 개인 개발자에게는 AI 도입의 경제학이 바뀌는 지점이다. 복잡한 엔지니어링에는 GPT-6 Saul을, 빠른 자동화에는 Luna를 기존 비용의 절반으로 운용할 수 있게 되면서, 그동안 비용 부담 때문에 포기했던 과감한 프로젝트들이 가능해졌다.

03Bonsai 2, 98% 성능이라는 수치는 왜 실제 업무에서 무용지물일까?

성능 시험 점수가 높다고 해서 실제 생산성으로 이어지는 것은 아니다. PrismML은 Bonsai 2 모델이 8GB 미만의 메모리만으로 270억(27B) 파라미터 모델 성능의 98%를 구현한다고 주장한다. 하지만 복잡한 다단계 프로젝트를 수행하는 실제 환경에서는 큰 격차가 드러났다. 간단한 작업에서는 Qwen 3.827B 모델과 비슷하게 작동했지만, 계획 수립부터 코드 작성, 검증, 수정까지 반복해야 하는 장기 과제(long-horizon work)에서는 한계를 보였다. 수치와 실무는 다르다.

자동화된 체크리스트로 실제 기능 구현 여부를 확인한 결과, Bonsai 2는 장기 구축 작업에서 빈번하게 실패했다. 해결책을 찾아 나가는 대신 같은 동작을 반복하는 루프에 빠진 것이다. 일례로 ISS 추적기 프로젝트를 수행하며 총 153번의 도구 호출(tool calls)을 기록했는데, 그중 150번이 파일 검색이나 목록 확인 같은 불필요한 반복 행동이었다. 특정 도구를 114번이나 중복 실행한 사례도 있었다. 반면 Qwen 모델은 훨씬 안정적이었다. 6개 프로젝트를 통틀어 최악의 반복 횟수가 단 6회에 불과했다. 무한 루프의 늪에 빠진 셈이다.

이러한 차이는 AI 성능 측정 방식의 허점을 보여준다. Bonsai 2가 내세운 98%라는 수치는 '사고(thinking)' 모드를 최대치로 설정한 20개 성능 시험의 평균값이다. 이는 짧고 단절된 개별 테스트에서는 대형 모델을 따라잡을 수 있어도, 전체 과정을 끝까지 완수하는 신뢰성은 부족하다는 뜻이다. 개발자와 기업 입장에서 벤치마크 점수가 비슷하다고 해서 실제 운영 성공이 보장되는 것은 아니다. 서류상으로 완벽해 보이는 모델이라도 실제 복잡한 작업 흐름(workflow)에서는 무의미한 반복 작업으로 무너질 수 있다. 지표가 실력을 보장하지 않는다.

04클로드 코드가 바꾼 데이터베이스 연동과 마일스톤 관리

개발자가 애플리케이션을 더 효율적으로 구축할 수 있도록 구조화된 마일스톤 계획과 전용 서버 명령어를 활용해 기능 개발 범위를 좁히고 데이터베이스 수정을 자동화하는 기능이 제공된다. 개발자는 정밀한 계획 프롬프트를 클로드에 입력해 프로젝트를 개별 마일스톤으로 쪼개고 이를 하나씩 구축하며 검증할 수 있다. 이 접근 방식은 개발 범위를 나열된 기능에 엄격하게 제한하면서 검색 기능이나 구독 같은 원치 않는 요소의 추가를 원천적으로 차단한다.

백엔드 작업을 원활하게 처리하기 위해 개발자는 두 번째 터미널 창에서 특정 명령어를 실행해 데이터베이스 플랫폼을 연결할 수 있다. 이 동작은 필요한 서버 설정을 자동으로 추가해 클로드가 인증을 요청하고 브라우저에서 로그인 창을 열 수 있게 만든다. 일단 연결되면 별도의 수동 조정 없이 설정이 즉시 사용 준비 완료 상태로 표시된다. 개발자는 또한 이미지킷(ImageKit) 문서 참조 같은 미디어 도구를 빌드 지침에 직접 포함해 시스템이 업데이트된 비디오 플레이어와 기능을 자동으로 활용하도록 만들 수 있다.

이처럼 간소화된 제어 기능에도 불구하고 초기 연동 과정에서는 여전히 개발 장벽이 나타날 수 있다. 예를 들어 회원가입 과정은 성공으로 표시되지만 확인 이메일 발송에 실패할 수 있으며, 생성된 자격 증명을 사용한 후속 로그인 시도는 초기 인증 오류를 유발할 수 있다. 하지만 클로드와의 대화형 문제 해결을 거치면 이러한 인증 버그가 해결되어 사용자가 성공적으로 로그인하고 홈, 구독, 기록 화면을 이용할 수 있다. 업로드된 미디어 자산은 전용 비디오 플레이어 컴포넌트를 통해 자동으로 저장되고 렌더링되며, 이 컴포넌트는 애플리케이션이 원본 비디오나 이미지 자산을 직접 관리하지 않아도 썸네일, 자막, 메타데이터, 댓글을 처리한다. 비디오 분석 역시 미디어 플레이어 대시보드 내에서 기본적으로 추적되거나 더 깊은 통찰을 위해 API를 통해 가져올 수 있다.

05기업용 인공지능이 바꾼 신입 사원의 역할 — 단순 문서 작성에서 품질 검토로의 전환

기업용 인공지능 자동화가 도입되면서 전문 서비스 업계 신입 사원들의 일상 업무 방식이 근본적으로 바뀌고 있다. 초안을 작성하느라 몇 시간씩 쓰던 신입 직원들은 이제 편집 품질 관리와 검토 업무로 빠르게 전환하고 있다.

회계 분야에서는 이러한 변화가 이미 뚜렷하게 나타난다. 예전에는 처음부터 복잡한 세무 신고서를 직접 준비하던 인턴과 신입 사원들이, 이제는 소프트웨어가 자동으로 생성한 결과물을 검토하도록 재교육을 받고 있다. 이들은 직접 문서를 만드는 주체가 아니라, 문서가 고객에게 전달되기 전에 정확성을 검증하는 최종 인간 검토자의 역할을 맡는다. 이러한 변화는 신입 인재들을 단순 데이터 수집과 초안 작성 업무에서 벗어나, 자동화 시스템을 감독하는 관리 역할로 곧바로 이동시킨다.

이러한 운영 방식의 진화는 기업이 인적 자원과 인재 육성을 관리하는 방식을 바꾼다. 소프트웨어가 일상적인 준비 작업을 맡는 비중이 커질수록 신입 전문가들의 매일 업무 책임은 제작에서 감독으로 이동한다. 이러한 작업 흐름을 활용하는 기업들은 자동화 시스템이 높은 전문 기준을 충족하도록 보장하는 동시에, 신입 사원들이 경력 초기부터 검토 과정을 배우는 중요한 책임 장치로 인간의 검토에 의존한다.

06DHH의 이메일 서비스, AI로 쓴 러스트 언어 전환: 서버 자원 95% 절감

프로그래머의 편의보다 기계 성능에 집중하면 서버 운영 효율을 완전히 바꿀 수 있다. 이메일 서비스 Hey의 개발자 DHH는 최근 애플리케이션 코드를 러스트(Rust)로 전면 재작성해 서버 CPU와 메모리 사용량을 95% 줄였다고 밝혔다. 러스트는 속도와 자원 관리 능력이 뛰어나지만 사람이 배우기 어렵기로 악명 높은 프로그래밍 언어다.

이번 전환에서 가장 눈에 띄는 부분은 새로운 코드가 전부 인공지능(AI) 손에서 나왔다는 사실이다. 이는 과거 러스트를 사람이 직접 쓰기에는 비인간적이라며 강하게 비판했던 DHH의 태도에서 완전히 돌아선 모습이다. AI를 활용해 코드를 짜면서 인간 개발자를 괴롭히던 복잡한 문법과 까다로운 조건이라는 러스트 특유의 진입장벽이 의미를 잃었다. AI가 복잡한 규칙을 도맡아 처리하면서 개발팀은 사람이 직접 겪는 고통 없이 성능 개선 효과를 고스란히 누렸다.

이번 변화는 소프트웨어를 만드는 방식이 더 큰 틀에서 바뀌고 있음을 보여준다. 그간 업계는 개발자가 코드를 더 직관적이고 편하게 짜도록 돕는 도구 모음인 루비온레일즈(Ruby on Rails) 같은 프레임워크를 쓰며 개발자의 행복을 최우선으로 여겼다. 하지만 DHH는 이제 개발자의 편의를 좇는 태도가 오히려 성능을 떨어뜨리고 최적의 결과를 가로막는다고 지적한다. AI가 단 몇 초 만에 고성능 코드를 척척 뽑아내는 시대가 오면서, 인간의 경험을 단순화하던 프레임워크의 필요성은 점점 줄어드는 추세다. 이제 우선순위는 원초적인 실행 속도와 자원 효율성 쪽으로 기울고 있으며, AI가 사람이 쓰기 편한 도구와 기계에 최적화된 코드 사이의 간극을 메울 수 있음을 증명하고 있다.

07메타가 공개한 실시간 영상 인공지능 뮤즈와 안경·참

메타는 개인용 인공지능 비서인 뮤즈(Muse)의 대규모 업그레이드를 통해 소비자 하드웨어 생태계를 확장했다. 메타 커넥트(Meta Connect) 기간 동안 회사는 뮤즈가 이제 음성 상호작용과 실시간 영상 기능을 모두 지원하여, 시스템이 백그라운드에서 작업을 처리하는 동안 사용자가 긴 대화를 나눌 수 있다고 발표했다. 이번 업데이트는 비서를 기본 텍스트 프롬프트 도구에서 실시간 시청각 스트림을 처리할 수 있는 능동적인 대화 동반자로 전환시킨다.

기존 화면의 소프트웨어 업데이트를 넘어, 회사는 이 기술을 웨어러블 하드웨어에 직접 적용하고 있다. 뮤즈는 메타 안경(Meta Glasses)에 공식 탑재되어 사용자가 일상 환경을 걸어 다니면서 핸즈프리로 이용할 수 있게 한다. 이러한 통합을 통해 착용자는 휴대전화를 꺼내거나 부피가 큰 헤드셋을 착용할 필요 없이 인공지능과 자연스럽게 상호작용할 수 있으며, 이는 주변 컴퓨팅과 일상용 안경 사이의 간격을 좁혀준다.

이러한 웨어러블 및 소프트웨어 개발을 보완하기 위해 메타는 비서와 상호작용하도록 특별히 제작된 소형 열쇠고리 기기인 뮤즈 참(Muse Charm)도 출시했다. 이 주머니 크기의 하드웨어에는 사용자가 간단히 탭하여 뮤즈와 즉시 대화를 시작할 수 있는 지문 센서가 탑재되어 있다. 안경, 특수 열쇠고리, 음성·영상 처리 전반에 걸쳐 소프트웨어를 확산시킴으로써 메타는 사용자가 어디서든 인공지능 도구에 연결 상태를 유지할 수 있도록 하드웨어 입지를 다지고 있다.

08클로드, 영상 제작 모델의 지휘관으로 변신 — 프롬프트 엔지니어 역할과 제작 자동화

애니메이션 장면을 만들 때 사용자가 직접 시각 도구마다 일일이 명령어를 고민할 필요가 사라진다. 클로드는 최종 영상 픽셀을 직접 그려내는 대신, 고성능 영상 생성 모델을 조율하는 핵심 프롬프트 엔지니어이자 총괄 감독 역할을 맡아 정밀한 텍스트 지시문을 작성한다.

이 통합 환경에서 사용자는 클로드와 직접 대화하며 창작 구상을 펼친다. 클로드는 시나리오를 바탕으로 매크로 샷 같은 전문 카메라 연출 기법 등 시댄스 같은 도구가 시각 리소스를 제대로 움직이는 데 필요한 기술 용어를 정교하게 다듬는 복잡한 작업을 도맡아 처리한다. 원래 이 정도 수준의 영화적 연출을 구현하려면 전문 감독의 전문성이 필요하다. 클로드는 사용자의 일상적인 아이디어를 이러한 전문 프롬프트로 번역하고, 이 프롬프트는 시댄스 2.5 같은 구체적인 렌더링 모델로 전달되어 실제 시각 결과물을 만든다.

이러한 역할 분담은 창작자가 애니메이션 작업 흐름에 접근하는 방식을 바꾼다. 클로드가 전체 과정을 조율하고 올바른 프롬프트를 작성하는 동안, 사용자는 핵심 개념에만 온전히 집중할 수 있다. 동시에 제공된 참고 자료와 프롬프트를 바탕으로 무거운 렌더링 작업을 처리하는 시각 전문 모델의 힘을 빌린다.

09메타 호라이즌 크리에이트, 텍스트 입력만으로 2차원·3차원 게임을 만든다고?

메타가 간단한 문장 입력만으로 완전한 2차원 및 3차원 게임을 만들 수 있는 새로운 인공지능 게임 제작 도구 메타 호라이즌 크리에이트(Meta Horizon Create)를 선보였다. 대중의 진입 장벽을 낮추도록 설계된 이 시스템은 창작자가 모바일 기기나 웹 브라우저에서 직접 게임을 구축할 수 있게 돕는다. 제작된 게임은 페이스북과 인스타그램에 바로 게시할 수 있으며, 이용자는 별도의 애플리케이션을 내려받지 않고도 멀티플레이 세션에 곧바로 접속할 수 있다.

이러한 접근 방식은 게임 플레이를 소셜 피드에 매끄럽게 녹여내어 디지털 게임 제작의 전통적인 걸림돌을 없애고, 가벼운 둘러보기 과정을 즉흥적인 상호작용 경험으로 바꾼다. 플랫폼 내부에 게임을 심으려는 유사한 시도가 업계 전반에서 엇갈린 성적표를 받아왔지만, 메타는 방대한 기존 소셜 네트워크를 활용해 가벼운 게임 개발 도구를 일반 소비자의 손에 직접 쥐어준다.

10Grok 4.7, 가격은 그대로 두고 성능은 높인 업데이트

Grok 4.7은 이전 모델과 같은 가격을 유지하면서도 성능을 대폭 끌어올려, 사용자가 추가 비용 없이 더 뛰어난 기능을 쓸 수 있게 만든다. 일반 사용자나 다양한 시스템을 검토하는 개발팀 입장에서 이번 업데이트는 최신 인공지능 모델이 복잡하고 무거운 작업을 얼마나 효율적으로 처리하는지 보여주는 확실한 진전이다.

다른 경쟁 시스템과 비교해도 Grok 4.7은 밀리지 않으며 종종 기대 이상의 결과를 보여준다. GPT-5.6 Sol(GPT 5.6 Sol), Fable 5.1 같은 다른 모델과 직접 비교했을 때도 경쟁력 있는 성능을 낸다. 특히 소프트웨어 개발 같은 특정 테스트 분야에서는 Fable 5.1을 앞서며, 작은 기능 개선이 전문 분야에서 얼마나 큰 실질적 이점으로 이어지는지 증명한다.

향상된 성능과 안정적인 가격의 조합 덕분에 이번 최신 버전은 운영 비용을 늘리지 않고도 작업 흐름을 최적화하려는 개발자들에게 매력적인 선택지가 된다. 기술 평가 지표에서 더 강한 결과를 내면서도 경제성을 지켜낸 이번 출시는, 대중적인 인공지능 플랫폼에서 사용자가 기대할 수 있는 기준을 새로 세운다.

11Odyssey의 Agora 2 — AI와 인간이 함께 상호작용하는 가상 세계

Odyssey가 인간과 AI가 함께 행동하고 반응하며 경험을 나누는 가상 환경 'Agora 2'를 공개했다. 이 가상 세계에서 자율형 AI(AI agents)는 특정 행동을 취한 뒤 그 결과가 어떻게 나타나는지 즉각적으로 관찰한다. 인간 참여자가 직접 접속해 소프트웨어와 상호작용하는 역동적인 시나리오가 가능하다. 실전과 유사한 환경이다.

이 환경은 인간과 AI를 포함해 최대 20명의 참가자가 동일한 공유 공간에 머무는 것을 지원한다. 참여 인원이 많을수록 AI가 학습할 수 있는 공유 경험의 가짓수가 늘어난다는 설계 원리를 적용했다. 개발자와 연구자들은 이 가상 세계 속 게임을 활용해 자동화 로봇과 인간 사이의 협력 방식을 정밀하게 연구하고 개선한다. 경험의 밀도가 학습의 질을 결정한다.

AI 훈련에는 자신의 결정이 실제 결과로 이어지는 현실적인 시험장(testing grounds)이 필수적이다. 복잡한 시뮬레이션 환경에 AI를 인간과 함께 배치함으로써, 개발자는 소프트웨어와 사람이 실시간으로 어떻게 협력하는지 실질적으로 관찰할 수 있게 됐다. 결국 AI의 현실 적응력을 높이는 과정이다.