넷플릭스가 대형 언어 모델(LLM) 기반의 추천 시스템 GenRec을 공개했다. GenRec은 사용자 이력과 콘텐츠 정보를 자연어 문장으로 변환해 입력하고, 넷플릭스 전용 데이터로 학습시킨 모델과 점수 산정 헤드(항목별 순위를 매기는 장치)를 결합해 추천 순위를 정한다.

학습은 2단계로 진행된다. 먼저 오픈소스 LLM에 넷플릭스의 콘텐츠와 행동 패턴을 학습시킨 뒤, 랭킹 데이터와 보상 목표를 바탕으로 추가 학습을 수행한다. 토큰 비용을 줄이기 위해 중요도가 낮은 이벤트는 생략하거나 압축하는 컨텍스트 엔지니어링(입력 데이터 최적화)을 적용했다.

추론 효율을 위해 vLLM(LLM 서빙 최적화 라이브러리)의 프리필 전용(입력값 처리만 수행하는 방식) 모드를 사용해 서빙 비용을 낮췄다. 약 10%의 트래픽을 대상으로 4주간 A/B 테스트를 진행한 결과, 기존 모델보다 적은 데이터와 신호를 사용하고도 온라인 지표가 통계적으로 유의미하게 개선됐다.