facts: AI 에이전트 활동 분류와 데이터 수집 범위

5,000개 이상의 웹사이트에서 수집한 '에이전트 분석(Agent Analytics)'과 'AI 채팅 추천 추적(AI Chat Referral Tracking)' 데이터를 기반으로 하는 에이전틱 웹 인덱스가 공개됐다. 이 인덱스는 웹을 방문하는 기계적 주체를 목적과 작동 방식에 따라 네 가지 유형으로 분류한다. 모델 학습을 위해 콘텐츠를 긁어가는 'AI 데이터 제공자 및 스크래퍼(AI Data Providers and AI Data Scrapers)', 실시간 RAG(검색 증강 생성) 작업을 위해 콘텐츠를 가져오는 'AI 어시스턴트 및 코딩 에이전트(AI Assistants and AI Coding Agents)', AI 검색 엔진의 답변 생성을 위해 인덱싱을 수행하는 'AI 검색 크롤러(AI Search Crawlers)', 그리고 브라우저를 통해 자율적으로 페이지를 탐색하고 작업을 수행하는 'AI 에이전트(AI Agents)'가 그 대상이다.

데이터 수집은 매일 업데이트되며, 개별 웹사이트의 트래픽 규모와 상관없이 동일한 가중치를 부여하는 평균 방식을 채택했다. 이는 소수의 고트래픽 사이트가 전체 결과에 지배적인 영향을 미치는 것을 방지하기 위한 조치다. 분석 대상에서는 내부 테스트 데이터나 비정상적인 데이터, 불완전한 데이터가 제외되며, 봇 트래픽 비율은 전체 서버 트래픽을 분모로 계산한다. AI 채팅 추천 비율의 경우, 식별된 봇 방문을 제외한 추정 인간 트래픽을 분모로 설정해 실제 사용자 유입 경로를 측정한다.

how-it-works: 봇 식별 및 준수율 측정 메커니즘

웹사이트의 접근 제어 파일인 robots.txt의 실효성은 'Robots.txt Effectiveness' 지표로 측정된다. 측정 방식은 해당 봇이 허용된 사이트에서의 기준선(Baseline)을 설정한 뒤, 이를 거부(disallow) 규칙이 설정된 사이트의 트래픽과 비교해 요청률이 얼마나 감소했는지를 추정하는 방식이다. 결과값은 0%(감소 없음)에서 100%(요청 관찰 안 됨) 사이의 수치로 나타나며, 이는 통제된 실험이 아닌 관찰 기반의 추정치로 정의된다.

봇의 정체성을 사칭하는 스푸핑(Spoofing) 여부는 인증 방법의 통과 여부로 판별한다. 특정 봇이 자신의 정체성을 주장하더라도, 해당 봇이 지원하는 '검증된 IP(Verified IP)'나 '웹 봇 인증(Web Bot Auth)', 'HTTP 메시지 서명(HTTP message signatures)'과 같은 인증 수단을 통과하지 못하면 스푸핑된 방문으로 간주한다. 인증 수단이 공개되지 않은 에이전트는 이 측정 대상에서 제외된다.

AI 채팅 플랫폼의 추천 및 인용 측정은 서로 다른 경로로 이루어진다. 추천 트래픽은 추천 URL이나 캠페인 소스에 ChatGPT, Perplexity, Gemini 등 인식 가능한 AI 플랫폼 정보가 포함된 인간의 방문을 직접 관찰해 집계한다. 반면 인용(Citation) 수치는 AI 플랫폼이 콘텐츠를 검색하기 위해 보낸 에이전트의 요청을 기반으로 추정한다. AI 플랫폼이 소스 기록을 완전히 공개하지 않으므로, 이는 정확한 인용 횟수가 아닌 방향성 패턴으로 해석된다.

implementation-impact: 웹 운영자의 봇 제어 및 검증 전략

운영자가 체감하는 가장 큰 변화는 robots.txt 설정만으로 봇의 접근을 완전히 제어할 수 없다는 점이 수치로 드러났다는 것이다. 인덱스에 따르면 일부 에이전트는 거부 규칙을 무시하며, 특히 알려진 봇의 정체성을 사칭해 보안 필터를 우회하려는 시도가 지속적으로 발생하고 있다. 단순히 User-Agent 문자열을 확인해 봇을 식별하는 방식은 스푸핑 공격에 취약하며, 이는 원치 않는 데이터 수집이나 서버 자원 낭비로 이어진다.

웹 운영자는 단순한 robots.txt 설정에 그치지 않고, IP 검증과 HTTP 서명 기반의 인증 체계를 도입해 실제 봇의 정체성을 검증하고 스푸핑 시도를 차단하는 필터링 전략을 세워야 한다.