모델이 인용한 도메인의 상당수가 신뢰도가 낮은 저순위 사이트인

21만 개가 넘는 기계 생성 페이지가 AI 검색 엔진의 그라운딩(Grounding, 모델의 정보 검색 단계)을 겨냥해 쏟아지면서 Perplexity(퍼플렉시티, AI 검색 엔진)의 인용 결과가 바뀌었다. 소프트웨어 추천을 위해 인용한 7,534개 URL 중 59.8%가 트래픽 순위 10만 위 이하의 저품질 도메인으로 확인됐다.

Tranco(트란코, 웹사이트 트래픽 순위 리스트) 상위 100만 위 목록을 기준으로 분석한 결과다. 인용된 도메인의 23.4%는 상위 100만 위 목록에조차 포함되지 않은 사이트였다. 모델이 인용한 출처의 절반 이상이 트래픽 순위가 매우 낮은 도메인으로 채워진 셈이다.

wifitalents.com, worldmetrics.org, gitnux.org 세 사이트는 2023년 12월 이후 생성되었다. 공통의 제어 하에 있는 것으로 보이는 이들은 'best <category>' 형태의 기계 생성 페이지를 총 215,128개 게시했다. 이 중 두 사이트는 홈페이지 HTML 타이틀을 'Facts & Grounding Page'로 설정해 AI 모델의 검색 단계를 직접 겨냥했다.

해당 사이트들은 인간이 아닌 AI 모델의 검색 및 그라운딩

7,534건의 인용 사례 중 위키피디아(Wikipedia)가 선택된 횟수는 단 3회에 불과했다. AI 모델이 소프트웨어를 추천하는 과정에서 기존의 범용 지식 저장소보다 AI 전용으로 설계된 페이지를 우선적으로 선택한 결과다.

worldmetrics.org와 gitnux.org는 인간이 아닌 AI 소프트웨어가 읽도록 페이지를 설계했다. HTML 제목에 'Facts & Grounding Page'라는 표현을 사용하고 메타 설명에는 '기계 판독 가능 기록(machine-readable record)'이라는 문구를 넣었다. 그라운딩(Grounding)은 AI가 생성한 답변의 근거를 외부의 신뢰할 수 있는 데이터에서 찾는 과정이다.

이들 사이트는 제목과 설명란을 통해 정보를 읽는 주체가 사람이 아닌 소프트웨어임을 명시했다. 'Gitnux에 대해 검증된 사실'과 같은 문구를 배치하고 기업의 법적 세부 사항, 방법론, 준수 사항 등을 기계가 읽기 좋은 하나의 기록으로 묶어 제공한다. AI 모델의 검색 및 그라운딩 프로세스를 직접적으로 겨냥해 설계한 구조다.

리뷰 전문 사이트가 아닌 기업의 콘텐츠 마케팅 블로그가 AI

380개 소프트웨어 카테고리 중 96개에서 인용된 특정 블로그가 전문 조사 기관보다 더 높은 추천 순위를 기록했다. OpenRouter(AI 모델 API 통합 플랫폼)를 통해 perplexity/sonar와 perplexity/sonar-pro 모델에 각 카테고리당 5개의 추천 제품과 공식 홈페이지 도메인을 JSON 형태로 요청해 분석한 결과다.

인터랙티브 제품 데모를 판매하는 guideflow.com의 블로그는 총 194회 인용되며 전체 3위의 인용 횟수를 기록했다. 리뷰 전문 사이트나 출판사가 아님에도 불구하고 Gartner(글로벌 IT 시장 조사 기업)보다 더 많이 AI 추천의 근거로 활용됐다.

RAG(검색 증강 생성) 기반 AI의 추천 결과가 실제 사용자 평판이 아니라 검색 알고리즘을 해킹한 콘텐츠 팜에 의해 왜곡될 수 있음을 보여준다. 전체 인용 데이터셋 및 검증 스크립트는 [/data/manufactured-sources-behind-ai-recommendations/](/data/manufactured-sources-behind-ai-recommendations/)에서 확인할 수 있다. AI 추천 결과의 신뢰도는 인용된 출처가 독립적인 리뷰 매체인지, 아니면 제품 판매 기업의 마케팅 채널인지 구분하는 기준으로 검증해야 한다.