아마존이 AI 모델 학습 데이터 확보를 위해 희귀 도서를 대량 구매해 스캔하고 있다. 라스베이거스 소재 VGT3 시설에서 도서의 제본 부분을 절단한 뒤 디지털화하는 작업을 수행한다. 아마존은 고객 서비스 및 제품 개선을 위해 상업적 경로로 도서를 구매한다고 밝혔다.
이번 작업은 인터넷상의 텍스트 데이터를 대부분 소진한 상황에서 새로운 학습원을 찾기 위한 조치다. 특히 절판되었거나 온라인에서 찾을 수 없는 희귀 도서는 가치 있는 데이터 소스가 된다. 2022년 이전에 출판된 텍스트는 LLM(거대언어모델)이 작성했을 가능성이 없어 데이터의 순도가 높다.
이는 AI가 생성한 텍스트를 다시 학습해 출력 품질이 저하되는 모델 붕괴(Model Collapse, AI 생성 데이터 학습으로 인한 성능 저하 현상)를 막기 위한 전략이다. 아마존은 이를 통해 학습 데이터의 품질을 유지하고 모델의 성능 저하를 방지한다.




