생성형 AI의 패러다임이 빠르게 바뀌고 있다. 이제 AI는 단순한 텍스트 생성을 넘어, 실제로 작동하는 소프트웨어를 만드는 단계로 진입했다. 텍스트의 시대가 가고 실행의 시대가 온 것이다.
특히 앤스로픽의 클로드 Opus 5 출시는 상징적이다. 이제 사용자는 간단한 명령어만으로 실제로 플레이 가능한 게임 프로토타입을 즉시 만들어낼 수 있다. 이는 우리가 창작 도구를 다루는 방식 자체가 근본적으로 변하고 있음을 시사한다. 시각 처리 분야의 왕좌도 바뀌었다. Seedance 5.0 Pro가 업계 표준 성능 시험(visual benchmarks)에서 1위를 차지하며 새로운 강자로 떠올랐다.
화려한 기능 뒤에서는 보이지 않는 인프라 전쟁이 더 치열하다. 최근 Zinc와 Magnesium 모델의 체크포인트(학습 중간 저장 지점) 정보가 유출되며, 더 효율적인 설계 구조(architecture)를 확보하기 위한 경쟁이 심화되는 양상이다. 구글의 제미나이 4 시리즈 개발팀 역시 출시 일정을 앞당기며 속도전에 나섰다.
현재 업계는 전문적인 마케팅 역량 통합과 같은 '활용도 제고'와 고성능 모델에 대한 강제적 안전 시험(safety testing) 도입이라는 '안정성 확보' 사이에서 줄타기를 하고 있다. 결국 핵심은 쓸모와 안전의 균형이다. 이번 리포트에서는 AI의 기본 행동 지침(system prompts) 간소화와 새로운 공격적 보안 검증(red-teaming) 노력이 AI의 다음 단계를 어떻게 설계하고 있는지 분석하고, 현재 기술 최전선을 정의하는 전략과 도구들의 실체를 짚어본다.
01기획서 한 줄에 게임이 튀어나온다 — 클로드 Opus 5의 공간 추론 능력
클로드 Opus 5가 소프트웨어 프로토타입 제작 방식을 근본적으로 바꾸고 있다. 단순한 에셋 조합이 아니라, 프롬프트 한 줄로 실제 플레이 가능한 게임을 통째로 만들어낸다. 조명, 거리 배치, 무기 시스템 같은 핵심 요소를 바닥부터 직접 코딩하는 방식이다. 특히 한 번의 시도로 완성품을 내놓는 '원샷(one-shot)' 능력이 압권이다. 스노보드 게임의 경우 가속도와 경사면, 충돌 감지 같은 복잡한 물리 엔진을 첫 시도에 결함 없이 구현했다. 전문가들은 이 물리 구현 수준이 상용 게임인 Fable과 견줄 만하다고 평가했다. 공간 추론 능력이 비약적으로 상승했다는 증거다.
단순한 기능 구현을 넘어 정교한 게임 메커니즘과 예술적 방향성까지 잡았다. 기존 프로젝트를 '콜 오브 듀티' 좀비 모드 스타일로 변환하며, 3JS를 이용해 텔레포터나 총구 화염 같은 상호작용 시스템을 자동으로 생성했다. 미적 감각도 놀랍다. 잠수함 게임에서는 일반적인 그라데이션 대신 16색 팔레트와 디더링(dithering, 픽셀을 배치해 색상 전환을 흉내 내는 기법)을 선택해 레트로 분위기를 일관되게 유지했다. AI가 의도적인 스타일 선택까지 수행한다는 뜻이다.
이런 능력은 교육 및 과학 도구로 확장되어, 아이디어와 실제 프로그램 사이의 간극을 없애고 있다. 3D 상호작용 동물 세포 모델이나 공기 흐름을 정확히 보여주는 풍동 시뮬레이션 등을 즉각적으로 구현한다. 더 중요한 변화는 작업 흐름(workflow)의 자율화다. 사람이 만들고 테스트하며 오류를 잡던 방식에서, AI가 스스로 제품을 만들고 문제를 찾아 코드를 수정하는 자율 루프로 진화하고 있다. 시각적 퀄리티보다 더 무서운 것은 이 '자기 수정 사이클'이 가져올 생산성 혁명이다.
02앤스로픽 Opus 5 — 비용은 절반, 성능은 챙긴 실전형 대안
앤스로픽은 사용자가 복잡한 정보를 찾다가 막히는 일이 없도록 모델 라인업을 정교하게 설계했다. 최근 공개한 Mythos 5, Fable 5, Sonnet 5에 Opus 5를 더해 완성도를 높인 것이다. 가장 까다로운 작업은 Fable 5가 맡지만, Opus 5는 높은 지능과 효율성을 동시에 갖춘 '실전형 모델'로 작동하며 업무 흐름(workflow)이 끊기지 않게 받쳐준다. 빈틈없는 안전망을 구축한 셈이다.
Opus 5의 핵심은 Fable 5의 성능을 비슷하게 구현하면서 운영 비용을 획기적으로 낮춘 데 있다. Fable 5가 처리하는 작업 대부분을 수행할 수 있으면서도 비용은 정확히 50% 저렴하다. 초고난도 추론이나 최상위 수준의 코딩 능력은 Fable 5에 밀릴 수 있지만, 이전 버전인 Opus 4.8보다는 비약적으로 발전했다. 최고 사양 모델의 비싼 가격이 부담스러운 사용자에게는 가장 합리적인 기본 선택지가 된다. 가성비와 고성능의 접점을 찾았다.
비용 외에도 보안 및 안전 필터링을 유연하게 관리하는 역할이 중요하다. AI 모델은 생화학 무기 제조나 사이버 공격 같은 위험 콘텐츠 생성을 막기 위해 보안 필터를 사용한다. Fable 5가 이 필터에 걸려 답변을 거부할 때, Opus 5는 더 유연한 대안이 된다. 유전체 서열 분석(genomic sequencing)처럼 전문적인 기술 논의 중 Fable 5가 차단할 만한 내용도 Opus 5는 자신 있게 처리한다. 그렇다고 안전을 포기한 것은 아니다. AI를 속여 악의적인 답변을 유도하는 프롬프트 주입(prompt injection) 공격을 막아내는 설계가 적용되어 보안성은 그대로 유지했다. 규제와 유연함 사이의 균형을 잡은 결과다.
03장바구니 이탈 고객, 클로드의 마케팅 분석으로 잡을 수 있을까?
소비자 직접 판매(D2C) 브랜드의 가장 큰 고민은 장바구니에 상품을 담아두고 결제 없이 사이트를 떠나는 고객이다. 클로드의 마케팅 특화 기능은 이를 해결하기 위해 구매 전환율 최적화(CRO, Conversion Rate Optimization) 과정을 자동화한다. 웹사이트를 개선해 실제 구매로 이어지는 방문자 비율을 높이는 기술적 공정을 AI가 대신하는 것이다. 이제 추측이 아니라 데이터로 돈이 새는 곳을 찾는다.
이 도구는 사용자가 결제를 망설이게 만드는 '구매 방해 요소'를 정확히 짚어낸다. 마지막 결제 단계에서야 갑자기 공개되는 배송비나, 구매 전 강제적인 회원가입 절차 같은 허들을 찾아내는 식이다. 클릭을 유도하기에 너무 밋밋한 구매 버튼의 시각적 효과나 문구의 적절성까지 분석한다. 실제로 인도 시장의 18~25세 모바일 이용자를 타겟팅하는 브랜드에 적용하면, 결제 과정의 실패 원인을 분석해 가장 시급하게 해결해야 할 10가지 과제를 순위별로 제시한다.
모호한 조언 대신 즉시 실행 가능한 정밀 계획을 내놓는다. 문제별로 레이아웃과 문구를 어떻게 바꿔야 하는지 구체적으로 지정해 수정의 정확도를 높였다. 특히 웹페이지 최상단 메인 영역(hero section)을 Z세대 취향에 맞게 고급스럽고 매력적으로 재설계하는 것까지 가능하다. 이 모든 분석 결과는 주차별 실행 계획으로 정리되어, 복잡한 마케팅 진단이 관리 가능한 프로젝트로 변한다. 진단에서 적용까지의 시간을 단축해 브랜드는 사용자 경험을 빠르게 개선하고 놓쳤던 매출을 회복한다.
04클로드 Opus 5의 등장 — '최강 AI' 경쟁보다 '적당한 성능'의 효율성
클로드 Opus 5의 출시는 AI의 성공을 측정하는 기준 자체가 바뀌었음을 알리는 결정적 분기점이다. 이제 업계는 모든 일을 다 잘하는 단 하나의 전지전능한 AI를 쫓지 않는다. 대신 실제 현장에 어떻게 적용할 것인가라는 실용적인 접근법으로 방향을 틀었다. 사용자나 기업의 고민은 더 이상 "이 모델의 최대 성능이 얼마인가"가 아니다. 운영 비용과 접근성을 고려했을 때 "이 정도면 충분한가"가 핵심이다. 단일 시스템의 지배력을 추구하던 시대에서, 상황과 제약 조건에 맞춰 최적의 도구를 골라 쓰는 복합 구조의 시대로 진입한 것이다. 단일 시스템의 시대는 끝났다.
지난 몇 년간 AI 경쟁의 핵심은 이른바 '모든 것을 지배하는 단 하나의 모델'을 만드는 것이었다. 지능의 한계를 어디까지 밀어붙일 수 있느냐가 유일한 목표였다. 하지만 클로드 Opus 5의 등장은 업계의 담론이 진화했음을 보여준다. 이제 평가는 이론적인 정점이 아니라, 실제 사용 환경에서의 효용성에 집중한다. 개발자들은 이제 "내가 정말 쓰고 싶은 다른 모델들이 있는데, 비용과 가용성을 따졌을 때 이 모델의 성능이 납득 가능한 수준인가"를 묻는다. 진공 상태에서의 성능 대결이 아니라, 효율성과 접근성이 모델의 진짜 가치를 결정하는 시대가 된 것이다. 이제 가치는 '절대적 성능'이 아니라 '상대적 효율'에서 나온다.
이러한 평가 기준의 변화는 시장 투자자들에게 일종의 로르샤흐 테스트(보는 관점에 따라 해석이 갈리는 상황)가 됐다. AI 거품론을 주장하는 회의론자들은 이를 '순환 금융'의 증거로 본다. 생태계 내부에서 투자금만 맴돌며 덩치를 키우고 있다는 시각이다. 반면, 제약 조건을 고려한 실용적 평가 방식이 오히려 시스템적 리스크를 줄인다고 믿는 투자자들도 많다. 소수의 거대 모델에만 의존하지 않게 되면서 산업 전체의 회복탄력성이 높아졌다는 분석이다. 이 관점에서 보면 시장의 다변화는 긍정적이다. 설령 오픈AI 같은 거대 기업이 무너진다 해도, AI 산업 전체가 함께 침몰할 가능성은 훨씬 낮아지기 때문이다. 의존도를 낮추는 것이 곧 생존 전략이다.
05단순한 채팅, 스스로 일하는 AI 회사
이제 AI는 단순한 챗봇이 아니다. 명령어 하나로 비즈니스 업무 흐름(workflow) 전체를 관리하는 '가상 회사'로 진화하고 있다. 깃허브(GitHub)에서 별 4만 개 이상을 기록한 코리 헤인즈(Corey Haynes)의 '마케팅 스킬(Marketing Skills)' 저장소가 대표적이다. 이 라이브러리는 47가지 AI 기능을 통해 타겟 고객 설정부터 리드 마그넷(lead magnets) 구상, 이메일 시퀀스 작성까지 복잡한 다단계 과정을 처리한다. 단계마다 프롬프트를 새로 입력할 필요가 없다. 특히 알렉스 호모지(Alex Hormozi)의 저서 '100 Million Offers'의 프레임워크를 적용한 '그랜드 슬램 오퍼(Grand Slam Offers)' 기능은 시장 점수와 가치 방정식을 분석해 고단가 상품의 제안서를 최적화한다.
마케팅을 넘어, 기업의 정적인 지식을 살아있는 운영 자산으로 바꾸는 시도도 이어지고 있다. '스킬 시커(skill seekers)' 툴은 웹사이트나 PDF를 분석해 AI 직원처럼 작동하는 맞춤형 지침을 생성한다. 예를 들어, 회계 법인이 60페이지 분량의 GST 신고 표준 운영 절차(SOP) PDF를 클로드(클로드) 스킬로 변환하는 식이다. 직원이 문서를 일일이 뒤지는 대신 AI에게 물어 즉각적인 답을 얻는다. 지식이 곧 노동력이 됐다.
이런 능력의 도약은 클로드 Opus 5에서 더 명확히 드러난다. 프롬프트 하나로 복잡한 건축물을 재현해낸다. 프로젝트의 각 부분을 담당하는 하위 자율 에이전트(sub-agents)를 배치해 브루클린 다리를 정밀하게 렌더링했다. 단 90분 만에, 10만 토큰을 소모해 모든 시각적 자산을 바닥부터 만들어냈다.
단 한 번의 명령으로 복잡한 결과물을 만드는 '원샷(one-shot)' 능력은 디지털 창작의 경제학을 뿌리째 흔들고 있다. 최근 외부 자산 없이 커스텀 코드만으로 구현한 '콜 오브 듀티' 스타일의 게임 데모가 그 예다. 2012년이었다면 500만 달러에서 1,000만 달러의 가치를 인정받았을 퀄리티지만, 이제는 적절한 프롬프트만 있으면 누구나 즉시 만들 수 있다. 수백만 달러의 전통적 경제 가치가 순식간에 증발했다. 가치의 기준이 바뀌었다.
06Seedance 5.0 Pro: 이미지 AI의 정답이 매번 바뀌는 이유
특정 AI 모델 하나에만 의존해 자율형 AI(AI agent)를 구축하는 것은 기업 입장에서 매우 위험한 도박이다. 개발자가 Opus 5나 Fable 5 같은 특정 모델에만 시스템을 묶어두면, 해당 모델의 서비스가 종료되거나 시장에서 사라지는 순간 AI 전체가 먹통이 된다. 이를 막기 위해 전문가들은 모델 독립적 구조(model-independent architecture)를 권장한다. 시스템을 완전히 새로 만들지 않고도 기반이 되는 AI 모델을 언제든 갈아끼울 수 있는 설계다. 유연함이 곧 생존 전략이다. '최고의 모델'이라는 업계 기준은 며칠 만에도 바뀔 만큼 변동성이 크기 때문이다.
이런 유연함의 필요성은 고성능 이미지 생성 분야에서 특히 두드러진다. 모델마다 구현하는 미적 감각이 제각각이기 때문이다. 최근 진행된 이미지 생성 도구 성능 시험(benchmark)에서 Nano Banana Pro, Seedance 5.0 Pro, Nano Banana 2, GPT Image 2를 대상으로 '심해 속 발광 식물 온실'이라는 복잡한 SF 프롬프트를 입력해 보았다. 빛나는 식물을 가장 정교하게 묘사한 GPT Image 2가 최종 승자로 뽑혔지만, Seedance 5.0 Pro의 성과도 만만치 않았다. Nano Banana 2와 비교했을 때 자연스러운 조명 처리와 압도적인 공간감, 그리고 특유의 어둡고 신비로운 분위기를 조성하는 데 탁월한 강점을 보였다.
이제 이런 모델별 강점을 섞어 쓰는 방식이 표준 작업 흐름(workflow)으로 자리 잡고 있다. Higgs Field 같은 플랫폼은 여러 모델을 교차 사용하는 파이프라인을 지원한다. 예를 들어 GPT Image 2로 고품질의 첫 장면을 만든 뒤, 이를 Seedance 2.0이나 제미나이 Omni Flash로 넘겨 영상으로 구현하는 식이다. 효율을 높이기 위해 무료 체험 기간을 일종의 성능 검증 단계로 활용하는 사례가 늘고 있다. 무료 기간 동안 다양한 모델을 실험하며 내 프로젝트에 딱 맞는 도구를 미리 찾아내는 것이다. 시행착오에 유료 크레딧을 낭비하지 않겠다는 실용적인 계산이다.
07제미나이 3.5 생략 — 세대 교체로 승부수 띄운 구글
구글이 AI 개발 일정을 앞당기고 있다. 중간 단계의 업데이트를 건너뛰고 곧바로 다음 세대로 넘어가는 전략이다. 업계가 예상했던 제미나이 3.5 프로(제미나이 3.5 Pro) 대신 제미나이 4(제미나이 4) 시리즈를 바로 내놓을 가능성이 크다. 단순한 기능 개선보다 아키텍처의 근본적인 변화를 택한 셈이다. 일반 사용자 입장에서는 소소한 업데이트가 아니라, 성능이 완전히 달라진 '체급 변경' 수준의 변화를 경험하게 된다. 단순 개선이 아니라 세대 교체다.
이런 움직임은 최근 AI 모델들의 성능을 블라인드 테스트하는 경쟁 평가장(testing arena)에서 정체불명의 신규 모델이 포착되며 시작됐다. 여러 AI 모델을 나란히 두고 어떤 모델이 특정 작업에서 더 뛰어난지 사용자가 직접 판단하는 곳이다. 이 모델이 제미나이 3.5 프로인지 4 프로인지 아직 확실치 않지만, 구글이 대규모 출시를 준비하고 있다는 신호는 분명하다. 제미나이 3.5 프로를 건너뛰면, 최신 모델이 쏟아지는 현재의 살벌한 속도전에 더 빠르게 대응할 수 있다. 속도전에서 밀리지 않겠다는 계산이다.
개발자와 기업들에게는 AI 세대 교체의 속도가 예상보다 훨씬 빠르게 다가올 것이다. 제미나이 4로 직행하면 기존의 소프트웨어 버전 관리 방식으로는 설명하기 힘든 비약적인 성능 향상이 한꺼번에 이루어진다. 주요 AI 연구소 간의 경쟁이 치열해지면서, 어설픈 중간 업데이트보다는 압도적인 차세대 모델을 내놓는 것이 훨씬 유리하기 때문이다. 구글은 준비가 끝나는 즉시 가장 진보된 기술을 배치해, 사용자가 지체 없이 제미나이 4 시리즈의 정점을 경험하게 만들 계획이다. 어설픈 중간 단계는 필요 없다.
08앤스로픽 Fable 5.1 — 출시 직전 최종 안전 점검 단계
앤스로픽이 Fable 5.1의 출시를 앞두고 최종 단계인 취약점 점검(red teaming)에 착수했다. AI를 극한까지 몰아붙여 잠재적 위험을 미리 찾아내고 성능 한계를 파악하는 일종의 '스트레스 테스트'다. 보통 이 단계에 진입하면 2주 안에 정식 출시되는 것이 일반적이다. 예측 시장인 Polymarket은 이르면 8월 중 출시될 것으로 보고 있다. 출시가 임박했다.
이번 출시 타이밍에는 치밀한 전략적 계산이 깔려 있다. 앤스로픽이 Fable 5.1의 공개를 늦춘 이유는 오픈AI의 차세대 모델인 GPT-6와 정면 승부를 벌이기 위해서라는 분석이다. 오픈AI가 시장의 관심을 독점하는 것을 막고, 전문 사용자 층을 확보하기 위해 최첨단 성능의 대응 카드를 준비한 셈이다. 주도권 싸움이 본격화된다.
한편 오픈AI는 GPT-6를 통해 더 복잡한 기능을 구현하는 데 집중하고 있다. 여러 AI가 협력해 문제를 푸는 다중 자율 시스템(multi-agent systems)과 장기적인 계획과 실행이 필요한 복잡한 과제 수행(long-horizon tasks) 능력이 핵심이다. 개발 과정이 순탄치만은 않았다. 샘 올트먼 CEO는 모델의 성능이 "두려울 정도"라며 안전장치 마련을 위해 학습을 일시 중단하기도 했다. 하지만 현재는 개발 마무리 단계에 접어든 것으로 알려졌으며, 올트먼은 다음 주 백악관에 이 신기술을 보고할 예정이다.
09단순 채팅을 넘어 전문가 수준으로? Grok 4.7의 10조 개 매개변수가 가져올 변화는?
인공지능의 규모가 단순한 대화를 넘어 전문적인 영역에서 실질적인 기여를 할 수 있는 임계점에 도달했다. Grok 4.7이 그 전환점이다. 이 모델은 매개변수(parameter) 규모를 10조 개까지 확장한 것으로 알려졌다. 쉽게 말해 매개변수는 AI가 정보를 처리할 때 사용하는 내부 연결 고리와 같다. 이 숫자가 많을수록 더 복잡한 패턴을 인식하고 적용할 수 있다. 이제는 단순한 디지털 비서가 아니다. 첨단 과학부터 복잡한 사이버 보안까지, 고도의 기술적 영역에서 유의미한 결과물을 내놓는 시스템으로 진화하고 있다.
일론 머스크는 Grok 4.6과 Grok 4.7을 이번 8월 중에 출시할 예정이라고 밝혔다. 이번 업데이트의 규모를 가늠해 보자면, Grok 4.7은 GPT 5.6 Sol보다 거의 두 배 가까이 크다. Fable 5나 Opus 5 같은 기존 최신 모델들을 압도하는 성능을 목표로 공격적인 규모 확장에 나선 셈이다. 물량 공세로 성능의 한계를 뚫겠다는 전략이다. 단순히 인간의 대화를 흉내 내는 수준을 넘어, 고난도 문제 해결에 필요한 압도적인 연산 능력을 확보하려는 의도다.
단순히 덩치만 키운 것이 아니라, 사용자 맞춤형 활용도를 높이는 데 집중했다. 개인화 기능과 기억 능력을 대폭 강화해, 시간이 흐를수록 사용자의 특성을 더 정확히 반영하고 일관된 관계를 유지한다. 또한 Grok 4.7은 다른 AI 시스템과 협업하도록 설계되었다. 단독 도구가 아니라 여러 모델이 함께 움직이는 협력 생태계로 나아가겠다는 뜻이다. AI가 도구를 넘어 생태계가 되는 시점이다. 이러한 거대 규모와 시스템적 협업 능력이 결합되면, 기존 모델로는 해결 불가능했던 복잡한 난제들을 연구자와 보안 전문가들이 풀어내는 방식 자체가 완전히 바뀔 것이다.
10앤스로픽의 요구: 고성능 AI, 출시 전 '강제 안전 시험' 필수
AI 출시 방식이 자율에서 규제로 바뀐다. 앤스로픽은 특정 성능 임계치를 넘는 모델에 대해 의무적인 안전 시험(mandatory safety testing)을 요구하고 있다. 위험한 수준의 성능을 갖춘 시스템이 검증 없이 배포되는 것을 막겠다는 취지다. 표준화된 안전 장벽을 세워 무기화나 시스템 붕괴 같은 치명적 사고를 원천 차단하겠다는 전략이다. 자율에 맡기기엔 리스크가 너무 크다.
이 제안의 핵심은 공개 여부와 상관없이 '성능'만 보겠다는 점이다. 앤스로픽은 위험성이 낮은 모델은 모두가 누려야 할 공공재로 본다. 하지만 고성능 구간에 진입한 모델은 이야기가 다르다. 코드를 공개하는 오픈 소스든, 비밀리에 유지하는 폐쇄형 소스든 상관없이 안전 검증이 최우선이다. 접근성보다 안전이 우선이라는 논리다. 공개 여부보다 중요한 건 통제 가능성이다.
안전 시험은 글로벌 AI 패권을 관리하려는 더 큰 전략의 일부다. 모델 자체의 검증을 넘어, AI를 만드는 물리적 인프라까지 통제하겠다는 계산이다. 구체적으로는 중국으로의 첨단 칩 수출 제한과 미국 모델의 지식 증류(distilling) 차단을 주장한다. 지식 증류란 거대 모델의 성능을 작은 모델이 그대로 흉내 내게 만드는 학습 방식이다. 강제 안전 시험과 하드웨어 규제, 그리고 모방 학습 차단을 엮어 위험한 AI의 확산을 막고 기술적 우위를 유지하겠다는 구상이다. 결국 기술의 확산을 막아 안전의 주도권을 쥐겠다는 뜻이다.
11단순 구독 서비스의 한계, 고객사 현장으로 투입되는 AI 엔지니어
기업용 AI의 위상이 바뀌고 있다. 단순한 소프트웨어 구독 서비스에서 벗어나, 이제는 기업 운영의 핵심 엔진으로 자리 잡는 중이다. 이에 따라 클라우드와 AI 업계의 거물들은 제품 전달 방식부터 완전히 뜯어고치고 있다. 단순히 툴과 매뉴얼만 던져주는 방식으로는 부족하기 때문이다. 대신 전문 엔지니어를 고객사의 사업 환경에 직접 투입해, 기술이 실제 고부가가치 문제를 해결하도록 만드는 '현장 밀착형 엔지니어링(Forward Deployed Engineering, FDE)' 전략을 택하고 있다. 고도의 소프트웨어 개발 능력과 전략 컨설팅을 결합한 형태다. 범용 AI 모델과 실제 성과를 내는 맞춤형 업무 흐름(workflow) 사이의 간극을 메우려는 시도다. 이제 AI는 단순한 도구가 아니라 경영의 필수 요소다.
이런 변화는 업계 리더들에게서 뚜렷하게 나타난다. 구글은 구글 클라우드 플랫폼(GCP)을 통해 고객사 엔지니어와 FDE 인력을 대폭 확충하며 기업 고객 지원을 강화하고 있다. 오픈AI 역시 막대한 자금을 투입해 AI의 기업 환경 통합을 가속화하는 전담 조직을 신설했다. 이는 고객이 알아서 설치하고 사용하는 기존의 '셀프 서비스' 방식에서 완전히 벗어난 행보다. 엔지니어가 고객과 나란히 앉아 실시간으로 복잡한 AI 시스템을 구축하고 다듬는 '고밀도 밀착 지원' 모델로 전환하고 있는 것이다. 고객이 알아서 쓰게 두는 시대는 끝났다.
이 방식의 원조는 팔란티어(Palantir)다. 팔란티어는 단순한 데이터 수집을 넘어 실제 의사결정으로 이어지게 만드는 모델로 성공을 거뒀다. 당시 얻은 핵심 교훈은 명확하다. 데이터 대시보드가 아무리 화려해도, 그 결과가 다시 원천 데이터로 반영되지 않으면 결국 가치를 잃는다는 점이다. 오늘날 AI의 성공 조건도 이와 같다. 에런 레비(Aaron Levie) 같은 인물은 X를 통해 FDE가 단순한 작업이 아닌 다면적인 역할임을 강조했다. 거대한 AI 투자가 '비싼 실험'으로 끝나지 않고 실질적인 기업 가치로 이어지려면, 기술적 숙련도와 비즈니스 직관이 동시에 필요하다. 결국 실행력이 성패를 가른다.
12앤스로픽: 기본 지침 80% 삭제, '소심한 AI'에서 '결단력 있는 도구'로
앤스로픽이 클로드 5 모델의 시스템 프롬프트(AI의 행동 방식을 규정하는 숨겨진 기본 지침)를 80%나 덜어냈지만, 내부 코딩 성능 시험 결과는 전혀 떨어지지 않았다. 그동안 모델에 걸어두었던 수많은 제약 조건들이 실제 기술적 성능 향상에는 사실상 아무런 도움이 되지 않았다는 뜻이다. 불필요한 지침을 제거하자 코딩 문제 해결 능력은 그대로 유지됐다. 기존 가이드라인이 중복되었거나, 오히려 사용자가 입력한 구체적인 요청과 충돌하고 있었음이 드러난 셈이다. 쓸모없는 제약이 성능을 갉아먹고 있었다.
이번 변화는 지나치게 조심스러운 모델의 성격 때문에 쌓였던 사용자들의 불만을 해결하기 위한 조치다. 일부 사용자는 클로드의 태도를 '강박적'이라고 표현하며, 지나치게 소심하고 사과가 너무 많다고 지적했다. 이런 성향은 실제 개발 현장에서 큰 걸림돌이 됐다. 예를 들어, 서로 다른 코드 버전을 합치는 과정에서 발생하는 코드 충돌(merge conflict) 상황이 오면 AI가 주저하는 모습이 잦았다. 문제를 즉시 해결하기보다 다른 개발자의 작업물을 망칠까 봐 걱정하며 망설이는 악순환이 반복된 것이다. 과도한 배려가 오히려 업무 효율을 떨어뜨렸다.
제약이 너무 많다 보니, AI가 코드를 짜는 시간보다 허락을 구하는 시간이 더 길어지는 주객전도 상황이 벌어졌다. 간단한 한 줄짜리 버그를 수정하면서도 내부 지침을 몇 번이나 다시 확인하고, 사용자에게 여러 차례 확답을 요구해야만 겨우 작업을 수행하는 식이었다. 심한 경우에는 아예 코드 작성을 다시 인간에게 떠넘기기도 했다. 결과물의 기술적 완성도는 높았을지 몰라도, 그 과정에 깔린 '공포 섞인 페르소나'가 생산성을 가로막은 셈이다. 앤스로픽은 이제 불필요한 제약을 걷어내고, 과한 조심성보다는 실질적인 유용성을 우선하는 결단력 있는 모델을 만들고 있다. 이제 AI는 사과 대신 정답을 내놓아야 한다.
