발표에서 확인된 핵심 사실

연구자가 논문 초안의 뼈대를 잡거나 복잡한 문장을 매끄럽게 다듬기 위해 생성형 AI를 활용하는 모습은 이제 일상적인 연구 환경의 일부가 되었다. 이러한 흐름 속에서 최근 arXiv(아카이브, 오픈 액세스 논문 저장소)에 제출된 논문 중 기계가 작성한 것으로 판별된 비중은 약 32%까지 치솟았다.

2021년과 2022년의 데이터를 분석한 결과 기계 작성으로 판별된 플래그 비율은 0.4% 수준에서 일정하게 유지되었다. ChatGPT 출시 이후 수개월 만에 이 수치는 상승 곡선을 그리기 시작했다. 이후 두 차례의 상승 파동을 거치며 최근 완전한 분기 기준으로 약 32%까지 증가했다.

총 12,750편의 논문을 대상으로 분석을 진행한 결과 AI 작성 판별 비중의 상승 추세는 계속되었다. 기계 작성으로 판별된 논문의 비중은 2026년 초 약 39%에 도달하며 정점을 찍었다. ChatGPT 출시 이후 기계가 작성한 논문의 비중이 급격히 확대되었음이 수치로 확인되었다.

학문 분야별로 AI 작성 비중의 차이가 크며, Computer

연구자의 화면 속 문장들이 비슷해 보이지만, 실제 작성 도구의 선택은 전공에 따라 극명하게 갈린다. Computer science 분야의 논문은 약 65%가 AI로 작성된 것으로 분석되어 전체 학문 분야 중 가장 높은 비중을 차지했다. 반면 Mathematics 분야는 약 0.7%로 측정되어 가장 낮은 수치를 기록했다. 동일한 연구 환경 내에서도 전공별 특성에 따라 AI 문체에 대한 의존도와 수용도가 상이하게 나타난 결과다.

AI 작성 신호를 정확히 포착하기 위해 분석 대상은 초록(abstract, 논문 내용을 요약한 앞부분)이 아닌 논문 전체 본문(full body text)으로 설정했다. 초록만 분석할 경우 AI 신호가 과소평가되는 경향이 확인되었기 때문이다. 실제 동일한 논문을 대상으로 분석을 진행했을 때, 초록에서는 20% 미만의 점수가 나왔으나 본문에서는 70% 이상의 점수가 기록된 사례가 확인되었다.

이러한 수치 격차는 초록의 정형화된 특성이 AI 검출 신호를 희석시킬 수 있음을 보여준다. 분석 범위를 본문 전체로 확장함으로써 AI가 생성한 문체의 비중을 더 정밀하게 측정했다. 이는 단순한 작성 여부를 확인하는 단계를 넘어, 실제 논문 본문에서 AI 스타일의 문체가 어느 정도의 비중으로 지배하고 있는지를 판단하는 기술적 근거가 된다. 전공별 민감도 차이를 반영한 분석 방식이다.

확인해야 할 핵심 지점

연구자가 ChatGPT를 활용해 논문의 문장을 매끄럽게 다듬은 뒤 AI 탐지기에 걸려 작성자 자격을 의심받는 상황이 발생할 수 있다. 탐지기가 표시하는 플래그(flag)는 단순한 저작권이나 작성 주체를 확정하는 지표가 아니다. 이는 완전한 AI 생성물뿐만 아니라 강력한 AI 보조 편집을 거친 기계 같은 글쓰기(machine-like writing)의 유무를 나타낸다. 탐지기는 입력된 텍스트가 기계가 쓴 것처럼 읽히는지를 추정하는 방식으로 작동한다. 가볍게 편집된 문서와 AI가 완전히 생성한 문서를 기술적으로 구분할 수 없으므로, 탐지기의 단일 점수만으로 특정 개인의 부정행위를 비난하는 근거로 활용하는 것은 무리가 있다.

분석에 투입된 탐지기는 2021년과 2022년에 발행된 논문을 기준(ground-truth human)으로 설정해 캘리브레이션(calibration, 측정 장치의 정밀도 조정)을 수행했다. LLM(Large Language Model, 대규모 언어 모델)이 보급되기 전의 논문을 대조군으로 삼아, 인간이 쓴 글을 기계 작성본으로 오인할 확률인 오탐률(false-positive rate)을 0.4%로 고정했다. 이 설정값에서 탐지기는 LLM 이전의 실제 과학 텍스트 중 99.6%를 인간 작성본으로 정상 분류했다. 동시에 AI가 작성한 학술 텍스트의 85%를 정확하게 찾아냈다. 검출 수치는 단순한 작성 여부가 아니라 기계적인 문체의 비중을 측정하는 기준이 된다.

연구자가 ChatGPT로 초안을 잡고 문장을 다듬는 환경에서 arXiv 논문의 32%가 AI 작성본으로 분석되었다. 2021~2022년 논문을 대조군으로 설정해 오탐률을 0.4%로 고정한 수치다. 검출 결과는 단순한 작성 여부가 아니라 AI 스타일 문체의 비중을 나타내며, 전공별 특성에 따라 민감도가 달라진다. AI 탐지 수치는 저자의 정체성이 아닌 문장의 기계적 특성을 측정하는 지표로 해석해야 한다.