기술 제원 및 벤치마크 결과
Standard 하네스와 Provider Adapter 두 가지 조건에서 측정된 GPT-6 Astra의 성능은 환경 탐색 및 규칙 추론 능력의 단계적 변화를 보여준다. Standard 하네스는 모델이 가시적 메모를 직접 선택하는 공급자 중립적 인터페이스이며, Provider Adapter는 모델 공급자가 설계한 문맥 관리 기능과 불투명한 추론 상태 보존, 장기 대화 압축 기능을 활용한다.
Semi-Private 평가 기준에서 Astra(max)는 Standard 하네스에서 62.7%의 정답률을 기록했으며, 비용은 $26,098가 소요됐다. 반면 Provider Adapter를 적용한 Astra(high)는 99.9%의 정답률을 기록하며 비용을 $18,817로 낮췄다. 추론 수준에 따른 세부 결과는 다음과 같다.
| 추론 수준 | Standard | Provider Adapter |
| :--- | :--- | :--- |
| max | 62.7%, $26,098 | 98.6%, $17,332 |
| xhigh | 59.3%, $37,317 | 98.4%, $18,147 |
| high | 54.8%, $40,705 | 99.9%, $18,817 |
| medium | 38.6%, $48,090 | 98.4%, $19,285 |
| low | 17.5%, $38,166 | 98.0%, $21,298 |
| none | 35.2%, $49,791 | 96.7%, $23,457 |
추론 수준이 높아질수록 게임 해결에 필요한 행동 수와 모델 호출, 토큰 사용량이 줄어들어 전체 비용이 감소하는 경향이 확인됐다. 특히 max 추론은 가장 적은 행동으로 과제를 해결해 다른 수준보다 비용 효율적인 운영이 가능했다.
추론 메커니즘과 도구 활용 방식
Provider Adapter의 핵심은 요청 사이의 불투명한 추론 상태를 보존하고 긴 대화를 압축해 이전 작업을 재사용하는 방식에 있다. 두 하네스가 공통으로 해결한 167개 게임-추론 조합을 비교한 결과, Provider Adapter는 Standard 대비 경과 시간 기준 약 3.66배 빨랐으며 전체 토큰 사용량은 49% 적었다.
Astra가 생성한 대수적 속기는 객체 위치, 상호작용 규칙, 행동 순서를 코드 형태의 상징 모델로 압축해 정보 밀도를 높인다. 이는 완전한 프로그래밍 언어라기보다 실행 중 생성되는 도메인 특화 표기법에 가깝다. s5i5 레벨에서 사용된 표기 사례는 다음과 같다.
- 게임 상태: `L8: hub q2 (8↓). Lengths: 14=1…` (레벨, 지역 회전 인덱스, 장치 길이 기록)
- 다단계 계획: `extend8 to3; retract10 to2; shorten8 to1` (장치 변경 순서 저장)
- 조작과 좌표: `9−=(39,4), rotate=(49,18), 14+=(59,11)` (조작과 화면 좌표 연결)
- 시간과 위치: `Turn 5: P=(24,20), empty, facing west` (턴, 위치, 소지 상태, 방향 기록)
PRO-LONG 하네스에서는 샌드박스 내 사용자 정의 코드 실행 능력이 추가됐다. Astra는 게임별로 보드 파서, 상태 모델, 탐색 알고리듬, 플래너를 직접 제작했다. 미로형 게임 tu93에서는 `maze_solver.py`(탐색), `combat_solver.py`(전투 규칙), `patrol_solver.py`(순찰 모델), `sync_state.py`(상태 대조)와 같은 전용 소프트웨어 라이브러리를 단계적으로 확장하며 과제를 해결했다.
행동 효율성과 운영 제약
행동 효율성 측정 결과, Provider Adapter의 Astra(max)는 완료한 레벨의 96.0%에서 인간 중앙값보다 적은 행동을 사용했다. 레벨당 평균 행동 수는 인간보다 51.7% 적었으며, 이는 프런티어 AI가 환경 역학을 이해한 뒤 인간의 효율성 범위 내에서 실행하는 이분법적 양상을 보임을 의미한다. 무차별 대입 방식의 비효율성은 여전히 남아있으나, 역학 이해 후의 실행력은 인간 수준을 넘어섰다.
인간 참가자의 비용과 비교하면 AI의 계산 자원 소비는 매우 높다. 통제 실험 참가자의 게임 시도당 비용은 약 $12.78이며, 뇌의 대사 전력(20W)과 전기 가격($0.20/kWh)만 계산한 순수 에너지 비용은 게임당 약 0.067센트에 불과하다. 반면 Astra의 최저 비용은 $17,332로, 행동 효율성과는 별개로 계산 자원 비용의 격차가 극심하다.
ARC-AGI-3는 결정적이고 폐쇄적인 환경에서 인과적 세계 모델을 합성하는 능력을 측정하며, Astra는 이 기준을 통과해 벤치마크 포화 상태에 도달했다. 다만 이는 엄격히 제한된 범위 내의 성과이며 현실 세계의 개방성과 복잡성을 대표하지 않는다. 따라서 에이전트를 설계하는 개발자는 폐쇄 루프 환경의 높은 정답률이 실제 개방형 환경의 일반화 성능이나 AGI 달성으로 직결되지 않는다는 점을 고려해 도입 시나리오를 설정해야 한다.




