facts
사용자의 요청에 따라 웹사이트를 탐색하고 결제나 메시지 전송 등의 작업을 끝까지 수행하는 '컴퓨터 사용 에이전트(CUA, Computer Use Agent)' Handoff가 공개됐다. 이 도구는 DoorDash에서 음식을 주문하거나 United, Delta 항공편을 예약하고, LinkedIn에서 후보자에게 메시지를 보내는 작업을 자율적으로 처리한다. 서비스 신청은 hark.com에서 가능하며, 이번 달 말 소프트웨어 플랫폼의 초기 릴리스와 함께 제공될 예정이다.
비용 구조는 기존 프런티어 모델 대비 10분의 1 수준으로 책정됐다. 입력 토큰 100만 개당 0.18달러, 출력 토큰 100만 개당 2.37달러를 적용한다. 이는 GPT 5.5의 입력 5달러, 출력 30달러와 비교해 크게 낮춘 수치다. 턴당 모델 지연시간은 0.8초로 측정됐다.
요청마다 할당되는 인프라는 전용 가상 컴퓨터 방식이다. 각 요청마다 독립적인 브라우저, 파일 시스템, 터미널이 생성되며, 사용자가 기존 계정을 연결하면 저장된 주소, 결제 수단, 히스토리를 그대로 사용하여 로그인 및 작업을 수행한다.
how-it-works
연구팀이 분석한 결과, 사용자가 하루 스크린 타임의 75%를 브라우저에서 보내지만 공개 API를 제공하는 웹사이트는 1,000개 중 1개 미만인 것으로 나타났다. Handoff는 API 의존성을 없애고 브라우저 인터페이스를 직접 조작하는 방식으로 이 제약을 해결했다.
학습 파이프라인은 지도 미세 조정(SFT) 후 GRPO(Group Relative Policy Optimization) 알고리즘을 이용한 비동기 강화 학습을 적용했다. 현재까지는 포스트 트레이닝(Post-training) 단계만 완료된 상태이며, 프리 트레이닝(Pre-training)은 올해 말로 예정되어 있다. 사용된 베이스 모델과 학습 데이터의 구성은 구체적으로 밝혀지지 않았다.
성능 측정 결과는 Online-Mind2Web(OM2W) 벤치마크에서 Handoff가 97.7점을 기록하며 GPT 5.4(92.8점), Claude Opus 4.8(84.1점), Gemini 2.5 Pro(69점)를 상회했다. 반면 WebTailBench v2에서는 GPT 5.5가 72.3점을, Handoff가 68.6점을 기록해 열세를 보였다.
다만 비교 대상이 GPT 5.6, Opus 5와 같은 최신 모델이 아닌 이전 세대 모델이라는 점이 변수다. 특히 최신 모델들은 컴퓨터 사용 능력이 크게 향상되어, OSWorld 2.0 벤치마크에서 Opus 5가 70.6%를 기록해 Hark가 비교 대상으로 삼은 Opus 4.8(55.7%)보다 높은 성능을 보였다. 또한 지연시간 비교 수치는 Hark가 자체 구축한 하네스(Harness)에서 경쟁 모델을 가장 느린 추론 레벨로 설정해 측정한 결과다.
implementation-impact
운영 비용 측면에서는 확실한 우위를 점하고 있다. 최신 모델인 Opus 5 역시 입력 5달러, 출력 25달러의 가격 정책을 유지하고 있어, Handoff의 비용 절감 효과는 최신 모델과 비교해도 유효할 가능성이 크다.
보안과 프라이버시는 현재 '기술 프리뷰' 단계로, 전용 가상 컴퓨터에 접근할 수 있는 권한과 생성된 파일의 관리 체계에 대한 세부 사항은 아직 공개되지 않았다. Hark 측은 여름 말 제품 출시 시점에 맞춰 관련 내용을 공유할 계획이라고 밝혔다.
개발자와 실무자는 Handoff의 비용 효율성을 검토하되, 실제 도입 전에는 최신 프런티어 모델(GPT 5.6, Opus 5 등)과의 교차 벤치마크 결과와 가상 컴퓨터의 데이터 격리 수준을 먼저 검증해야 한다.


