미출시 모델이 수학의 난제인 리만 가설(Riemann

해의 하한선(lower bound)을 크게 높인 성과를 미출시 AI 모델이 도출했다. 이 성과는 현대 AI가 기존 지식의 재구성을 넘어 새로운 과학적, 수학적 아이디어를 스스로 발견할 수 있는지에 대한 논의를 구체적인 실체로 바꾼다. 연구자가 가설을 세우고 검증하는 전통적인 방식에 AI가 직접적인 해법의 단서를 제공하는 구조로 전환한다.

Anthropic의 미공개 모델이 수학의 난제인 리만 가설(Riemann hypothesis) 연구에서 유의미한 진전을 이뤄냈다. 해당 모델은 리만 가설이 성립하는 해의 하한선을 기존보다 크게 높여 수학적 증명의 유효 범위를 확장했다. 이는 AI가 고도의 추상적 논리가 필요한 수학적 난제에서도 단순한 계산을 넘어 실질적인 아이디어를 제시하며 성과를 낼 수 있음을 증명한다. 모델의 연산 능력이 수학적 발견의 임계점을 넘어서는 사례를 보여준다.

도출된 결과물은 내부 전문가의 검토와 엄격한 도구 검증을 거쳐 신뢰성을 확보했다. Anthropic 내부 수학자 2명이 발견 내용을 직접 확인했으며, 오픈소스 증명 보조 도구인 Lean(린)을 사용하여 해당 결과를 공식화했다. 수학적 엄밀함을 요구하는 증명 보조 도구를 통해 AI의 결과물을 정형화함으로써, 인간 수학자의 직관과 AI의 연산 능력이 결합된 검증 체계를 구축했다. 이러한 공식화 과정은 AI가 생성한 가설이 실제 수학적 증명으로 이어지는 경로를 명확히 한다.

기술이 실제로 작동하는 방식

수학 전문 교육을 받지 않은 직원이 "제대로 시도하라(take a real stab)"는 프롬프트 하나로 모델의 자율적 과업 수행을 이끌어냈다. Anthropic의 해당 직원은 모델에게 가설 증명을 요청한 뒤, 모델이 스스로 작업을 조율하고 실행할 수 있도록 약 하루 반의 시간을 부여했다. 모델은 외부의 세밀한 가이드 없이도 스스로 작업 순서를 정하고 증명 과정을 밀어붙였다. 이는 고도의 전문 지식을 갖춘 운영자가 없어도 프롬프트만으로 복잡한 추론 과업을 완수하는 구조를 가능하게 한다.

60개의 서브 에이전트(특정 과업을 수행하도록 설계된 하위 모델)가 협력하여 총 650개의 서로 다른 아이디어를 테스트했다. 서브 에이전트들은 핵심 아이디어 개발, 아이디어 기여, 결과 검증, 논문 작성이라는 구체적인 역할 분담 체계 속에서 유기적으로 움직였다. 모델은 이 과정에서 총 3,100만(31 million)을 소비하며 수많은 가설을 세우고 폐기하는 반복 실험을 수행했다. 단순한 단일 모델의 추론이 아니라, 역할이 분리된 다수의 에이전트가 협업하는 워크플로우가 실제 수학적 증명이라는 결과물을 만들어낸다.

확인해야 할 핵심 지점

Jacobian conjecture(야코비안 추측)의 부정과 10가지 주요 결과의 증명 같은 성과가 AI 모델을 통해 잇따르고 있다. Anthropic(앤스로픽)은 별도의 연구 노력을 통해 오랫동안 해결되지 않았던 야코비안 추측을 부정하는 결과를 도출했다. OpenAI(오픈에이아이) 역시 내부 모델인 Astra(아스트라)를 활용해 10가지 주요 수학적 결과를 증명하는 성과를 냈다. 올해 여러 Erdos(에르되시) 문제들이 AI 모델에 의해 해결되면서 LLM이 단순 계산을 넘어 수학적 돌파구를 만드는 능력을 갖췄음이 입증되었다. OpenAI의 Astra가 증명을 수행한 것과 Anthropic이 추측을 부정한 것은 LLM이 수학적 증명과 부정이라는 서로 다른 과제를 모두 수행할 수 있음을 보여준다.

이러한 AI의 수학적 발견 능력은 증명이 특정 저자에게 귀속되어야 한다는 수학계의 전통적 가치와 정면으로 충돌한다. 저명한 수학자 그룹은 AI의 개입이 저자의 책임과 공헌도를 산정하는 기존 기준을 훼손하고 학계의 핵심 가치를 약화시킬 수 있다는 우려를 제기했다. 반면 필즈상 수상자인 Timothy Gowers(티모시 가워스)는 AI의 영향이 수학이라는 학문을 더 복잡하면서도 긍정적인 방향으로 변화시킬 수 있다고 주장한다.

전문 지식이 부족한 사용자도 아이디어 개발(2명), 기여(13명), 시도(30명), 검증(13명), 작성(2명)으로 이어지는 멀티 에이전트 역할 분배 구조를 설계하면 고도의 과학적 및 수학적 추론 과제를 수행할 수 있다.