AI 모델에 따라 사용자의 이용 방식이 크게 다르다

52개 AI 모델과 나눈 24,521건의 대화 데이터에서 모델별로 뚜렷하게 구분되는 사용 패턴이 확인됐다. 사용자는 선택한 도구에 따라 대화 주제와 상호작용 스타일을 다르게 가져갔다. 대화의 구조뿐 아니라 민감한 사례가 발생하는 가능성과 그 구체적인 유형에서도 모델별 차이가 나타났다. 사용자가 어떤 AI를 선택하느냐에 따라 도구를 활용하는 방식 자체가 달라진 결과다.

AI Observatory(AI 사용 행태 분석 기구)는 MIT, 스탠퍼드, 데이터 프로비넌스 이니셔티브(Data Provenance Initiative) 등의 연구진이 참여해 2023년부터 2025년 사이의 실세계 데이터셋을 분석했다. 5,000명의 사용자가 ChatGPT, Gemini, Claude, Grok을 포함한 52개 모델과 나눈 대화를 집계했다. 분석 대상은 총 24,521건의 대화이며, 사용자가 입력한 프롬프트와 그에 대응하는 AI의 응답을 하나의 단위로 설정한 대화 턴은 85,633개에 달한다.

분석 결과 AI 모델에 따라 사용자가 접근하는 방식은 완전히 달랐다. 도구별로 사용자가 다루는 주제가 달랐다. AI와 상호작용하는 스타일과 대화를 이끌어가는 구조에서도 뚜렷한 차이가 관찰됐다. 특히 민감한 사용 사례가 얼마나 자주 발생하는지, 그리고 어떤 형태로 나타나는지가 모델마다 다르게 집계됐다. 사용자가 각 AI 모델의 특성에 맞춰 서로 다른 목적과 방식으로 도구를 소비하고 있다는 점이 확인됐다.

모델별로 특화된 사용 용도가 관찰되었다

외부 연구 기관의 분석 데이터는 AI 개발사가 직접 집계한 규모에 비해 현저히 작다. AI Observatory(AI 관측소, AI 사용 패턴을 분석하는 연구 단체)의 데이터는 표본 크기 면에서 한계가 있다. 반면 AI 개발사들은 훨씬 방대한 데이터를 직접 분석한다. Anthropic의 Economic AI Index는 100만 건의 Claude 대화를 분석 대상으로 삼았다. OpenAI는 보고서를 통해 150만 건의 ChatGPT 대화 데이터를 분석한 결과를 제시했다. 분석 대상의 수치 차이가 데이터의 대표성을 결정한다.

사용자들은 목적에 따라 서로 다른 AI 모델을 선택한다. Grok과 Gemini는 정보 검색 용도로 빈번하게 활용된다. 특히 Grok은 뉴스 및 정치 정보 검색에 특화된 사용 양상을 보였다. 다만 Grok에서는 오정보가 집중되는 경향이 함께 관찰되었다. Anthropic은 코딩 관련 작업에 주로 쓰인다. Gemini는 소셜 활동이나 역할극 수행에 더 많이 활용된다. ChatGPT는 숙제 도움을 받는 용도로 가장 높은 활용도를 보였다. 모델별로 사용자가 기대하는 효용이 구체적으로 갈린다.

성희롱 및 혐오 표현과 같은 민감한 사용 사례가 감소했다

성희롱과 혐오 표현 같은 민감한 사용 사례가 줄었다. 연구진이 분류한 유해하거나 제한된 콘텐츠 교환 사례가 감소한 결과다. 플랫폼들이 안전장치를 더 효과적으로 배포하고 있다.

모델 버전별로 대화 패턴이 갈린다. ChatGPT의 GPT-3.5 사용자는 대화 길이가 짧았다. GPT-4o 사용자는 더 길고 반복적인 대화를 이어갔다.

이번 분석 대상은 2.4만 건으로 100만 건 이상의 기업 자체 데이터보다 표본이 작다. Grok은 뉴스와 정치, Anthropic은 코딩, Gemini는 소셜과 역할극, ChatGPT는 숙제에 주로 쓰였다. 기업이 발표하는 대규모 통계 보고서보다 실제 사용자 그룹의 세부 목적별 모델 선택 경향을 기준으로 벤치마킹해야 한다.