후 모델들은 2025년 12월 말경에 종료된 동일한 학습
2026년 5월로 발표된 Opus 5의 공식 컷오프와 달리 실제 지식 회상 능력은 2026년 1월 수준에 머문다. 모델의 정체성 응답과 팩트 회상률을 분석하면 제조사가 발표한 시점과 별개로 실제 사전 훈련(Pre-training) 체크포인트 시점을 추정할 수 있다. 이러한 데이터 분석은 모델이 실제로 보유한 지식의 시간적 한계를 명확히 드러내는 지표가 된다.
2025년 12월 말경에 종료된 동일한 학습 런(training run)이 Opus 4.7 이후 모델들의 생성 기반이 된다. 분석 결과 이 모델들은 매우 유사한 유효 지식 컷오프(effective knowledge cutoff)를 공유한다. 동일한 학습 런에서 파생된 모델들은 버전 구분과 관계없이 지식의 최신성 측면에서 동일한 시점에 멈춰 있다.
2026년 2월 말경에 완료된 별도의 체크포인트는 GPT-5.6 제품군을 생성했다. GPT-5.6 제품군은 이전 모델인 GPT-5.5와 뚜렷하게 구분되는 유효 지식 컷오프를 가진다. 별도의 체크포인트를 통해 학습을 완료함으로써 이전 세대 모델과 지식의 경계선을 명확히 분리하고 업데이트 시점을 차별화했다.
기술이 실제로 작동하는 방식
학습 데이터의 성격에 따라 모델의 기본 성능과 페르소나가 결정된다. 대규모 언어 모델(LLM)의 학습 과정은 일반적으로 3단계로 수렴한다. 우선 인터넷 스크래핑 데이터를 통해 방대한 양의 일반 목적 데이터를 학습하는 사전 학습(pre-train) 단계를 거쳐 자동 완성 모델을 만든다. 이후 도메인 특화 교과서 품질 데이터를 투입해 긴 텍스트 이해와 같은 기본 능력을 확장한다. 마지막으로 페르소나와 추론 능력을 다듬어 모델을 어시스턴트 형태로 완성한다.
위키피디아의 일일 사실 데이터를 활용한 8지선다 퀴즈는 모델의 학습 타임라인을 추정하는 도구가 된다. 이는 모델 내부의 정보를 추출해 확인하는 프로빙(probing) 방식으로 작동한다. 특정 날짜에 발생한 사건에 대해 퀴즈를 풀게 한 뒤 에러율 타임라인을 분석한다. 학습 데이터셋의 신호가 소실되는 지점을 찾아내면 사전 학습 체크포인트 날짜를 구체적으로 산출한다.
모델의 자기 식별 패턴을 통해 과거 모델의 출력물(사용자 채팅
학습 데이터의 출처를 확인하려는 개발자는 모델이 스스로를 식별하는 패턴에서 과거 모델의 출력물 흔적을 찾는다. OpenAI는 GPT-4, GPT-4o, GPT-4.1, GPT-5 그리고 "ChatGPT"를 학습 데이터로 사용한 뚜렷한 패턴을 보인다. Anthropic은 3.5 Sonnet을 사용하다가 최근 모델에서 Sonnet 4.5로 교체하는 패턴을 나타낸다. 이는 ChatGPT.com과 Claude.ai의 사용자 세션 데이터가 실제 학습 자료로 투입되었음을 증명한다.
Opus 5는 공식 발표 수치와 실제 지식 수준 사이에서 명확한 괴리를 보인다. 제조사는 지식 컷오프를 2026년 5월로 발표했으나, 실제 테스트 결과 2026년 1월 컷오프 모델들보다 더 많은 정보를 알지 못하는 상태다. 공식 문서에 명시된 날짜가 모델의 실제 지식 경계를 보장하지 않는 결과다. 이는 제조사가 제공하는 컷오프 정보가 실제 모델의 능력치와 일치하지 않을 수 있음을 보여준다.
모델의 실제 지식 경계를 확인하려면 특정 날짜의 세부 팩트를 8지선다 퀴즈 형태로 질문하여 에러율이 급증하는 시점을 찾는 검증 방법론을 적용한다. 이 지점을 기준으로 RAG(검색 증강 생성, Retrieval-Augmented Generation) 보완 범위를 결정한다.




