3.1배의 노동력 투입과 '자동화된 연구 인턴'의 달성
OpenAI 연구 조직은 2026년 8월 중순 기준 인간 노동 1일당 3.1일분의 에이전트 노동력을 사용하고 있다. 표준 8시간 근무일을 기준으로 계산했을 때, 연구 조직 전체가 사용하는 에이전트의 총 런타임이 인간 연구원의 전체 노동량을 넘어선 결과다. OpenAI는 2026년 9월까지 숙련된 연구원이 며칠간 수행할 수 있는 수준의 과업을 처리하는 '자동화된 연구 인턴(automated research intern)' 구축 목표를 달성했다. 여기서 연구 인턴이란 인간의 지시 하에 잘 정의된 연구 과업을 수행할 수 있는 시스템을 의미한다.
OpenAI 연구원들은 올해 한 해 동안 일과 전반에 걸쳐 코딩 에이전트를 활용하며 업무 방식을 실질적으로 변경했다. 연구원들은 종종 여러 세션을 동시에 실행하는 방식으로 에이전트를 사용하고 있으며, 이러한 사용량 증가 속도는 OpenAI 내 다른 팀들의 성장 속도를 앞지르고 있다. 에이전트는 점차 더 복잡한 과업을 처리하고 있으며, 과업 수행의 성공률 또한 지속적으로 상승하는 추세다. 연구원들은 에이전트를 통해 코드를 더 빠르게 기여하고 더 많은 실험을 수행하는 성과를 거두었다.
OpenAI는 이러한 성과를 바탕으로 2028년 3월까지 '자동화된 AI 연구원(automated AI researcher)'을 구축하는 다음 단계의 목표를 설정했다. 자동화된 AI 연구원은 인간의 감독 하에 딥러닝과 정렬(alignment) 분야의 진전을 위해 스스로 반복적인 개선을 수행하는 체계를 지향한다. 이는 지능의 비용을 낮추어 전 세계 사람들이 혜택을 입게 함과 동시에, 정렬 문제를 해결하고 고성능 AI에 대한 방어 체계를 구축하는 데 기여할 것으로 기대된다.
일일 7,000달러 토큰 소모와 고집적 동시 워크플로우
OpenAI 연구 조직의 중앙값 연구원은 2026년 8월 중순 기준 일일 600달러 이상의 API 추론 비용을 소모하며 에이전트를 업무에 통합했다. 특히 연구 조직 내 90분위(90th percentile) 사용자는 하루에 7,000달러 이상의 토큰 비용을 지출하는 고집적 워크플로우를 운용하고 있다. 이러한 고비용 구조는 연구원이 4개 이상의 에이전트를 동시에 실행하는 고집적 동시 워크플로우를 사용함에 따라 발생했다. 여기에는 사용자가 직접 시작한 에이전트뿐만 아니라, 그 하위에서 생성된 서브 에이전트들의 일일 피크 사용량이 모두 포함된다.

연구원들은 단일한 상호작용을 넘어 다수의 에이전트를 동시에 구동함으로써 연구 파이프라인의 병목을 제거하고 있다. AI 연구는 모델 지능이나 성능의 개선 사항을 핵심 모델에 통합하는 노동 집약적인 과정으로 구성된다. 구체적으로 연구원은 새로운 개선안을 설계하고, 모델 성능을 판단할 평가 지표를 작성하며, 대규모 테스트를 위한 인프라를 구축해야 한다. 또한 훈련 과정에서 발생하는 버그나 안전하지 않은 행동, 정렬되지 않은 동작을 포착하여 승리한 아이디어를 핵심 훈련 과정에 통합하는 단계를 거친다.
이 과정 중 어느 한 곳에서라도 실패가 발생하면 전체 연구 루프가 제약받게 되는데, 연구원들은 코딩 에이전트를 통해 코드 작성과 실험 실행이라는 두 가지 주요 활동의 속도를 높였다. 에이전트가 복잡한 구현과 테스트를 분담함에 따라 연구원은 더 상위 수준의 설계에 집중할 수 있게 되었으며, 이는 전체적인 연구 진척 속도를 유의미하게 가속하는 결과로 이어졌다. [IMG_1]
Hugging Face 인시던트와 RL 훈련 일시 중단 조치
OpenAI는 최근 발생한 Hugging Face 인시던트 이후 배포 예정인 최신 모델의 강화 학습(RL) 훈련을 일시 중단하는 안전 조치를 실행했다. 이번 결정은 연구 환경을 더욱 견고하게 만드는 하드닝(Hardening) 작업과 레드팀 테스트를 수행하고, 모니터링 시스템의 커버리지를 확장하기 위해 내려졌다. 모든 연구가 중단된 것은 아니며, 일부 워크로드는 더 강력한 제어 체계 아래에서 재개되었으나 보안 기준을 충족하지 못한 일부 작업은 중단 상태를 유지했다.
OpenAI는 안전 및 정렬 기준을 상향 조정하고, 안전 관련 작업을 모델 생애주기의 더 앞 단계로 전진 배치했다. 이에 따라 모든 훈련 과정 전반에 걸쳐 모델이 정렬된 행동을 보인다는 더 강력한 증거를 요구하는 체계로 변경했다. 이는 고성능 시스템이 개발될수록 모니터링이 더 어려워질 수 있다는 판단에 따른 조치다. OpenAI는 진행 과정에서 수용 불가능한 안전 리스크가 발견될 경우, 시스템의 개발이나 배포를 늦추거나 중단하는 방식으로 대응한다는 원칙을 고수하고 있다.
또한 OpenAI는 재귀적 자기 개선(RSI)으로 가는 경로에서 정렬과 안전 조치를 역량 확장과 동시에 규모 있게 추진하고 있다. 정렬된 고성능 시스템은 중요 인프라를 보호하고 위험한 AI 에이전트를 방어하며 새로운 보호 조치를 개발하는 데 활용될 수 있다. 다만 OpenAI는 급격한 RSI가 반드시 추구해야 할 결과라고 보지 않으며, 진행 여부는 인간의 통제력 유지 능력과 민주적인 선택에 달려 있다고 명시했다. [IMG_0]
RSI 진전 추적과 인간 통제권의 유지 기준
OpenAI는 프런티어 정책 청사진에 따라 RSI 진전 상황을 공개적으로 추적하고 투명하게 공개하는 체계를 도입했다. 연구 조직은 측정 기술과 이해도가 향상됨에 따라 투명성 접근 방식을 진화시키되, 보안 및 독점 정보 보호 사이의 균형을 유지할 계획이다. 이러한 공개는 대중에게 정보를 제공하고 공개 공시의 규범을 장려하며, 업계가 공유된 측정 표준으로 나아가는 데 기여하는 것을 목표로 한다.

자율적 연구 역량이 강화되더라도 연구의 핵심 결정권은 여전히 인간 연구원이 소유한다. 인간은 연구의 우선순위를 설정하고, 어떤 아이디어와 결과물을 추구할지 판단하며, 시스템을 확장하거나 일시 중단 또는 배포할지 여부를 최종적으로 결정한다. 즉, 에이전트가 실행의 속도를 높이는 도구로 작동하더라도, 전략적 방향성과 안전에 대한 최종 승인 권한은 인간이 보유하는 구조를 유지한다.
결과적으로 AI 에이전트를 통한 연구 가속화를 도입하려는 조직은 단순한 인적 노동력 대체 효율이 아니라, 실제 투입되는 컴퓨팅 자원의 비용 규모와 보안 리스크 관리 능력을 기준으로 판단해야 한다. OpenAI의 사례에서 확인된 인간 노동 대비 에이전트 노동 비율(3.1:1)과 상위 사용자의 일일 토큰 소모 비용(7,000달러)은 고집적 에이전트 워크플로우 도입 시 고려해야 할 실제 비용 규모를 보여준다. 또한 RL 훈련 일시 중단 사례와 같은 보안 하드닝 수준이 확보되지 않은 상태에서의 가속화는 치명적인 리스크를 초래할 수 있음을 주의해야 한다.




