핵심 내용

OpenAI는 10월 6일 내부 프런티어 모델이 수학과 이론 컴퓨터과학의 미해결 문제를 대상으로 작성한 연구 원고 및 증명 자료를 공개했다. 10월 9일 확인된 공식 GitHub README의 현재 집계는 719개 원고·372개 결과군(families)이며, 약 4,000개 문제를 제시했고 결과당 평균적으로 ChatGPT Pro thinking 약 3시간에 해당하는 연산을 사용했다고 설명한다. 초기 언론·독립 분석에 등장한 722개 원고와 숫자가 다른 것은 저장소 원고 수가 수정된 상태이므로, 여기서는 확인 시점의 원본 집계를 따른다.

일부 결과는 Lean 형식화로 기계검증 가능한 자료를 함께 공개했지만 모든 원고가 형식화된 것은 아니다. 저장소는 주요 결과 가운데 약 42%에 형식화가 있다고 명시하며, 형식화되지 않은 원고에는 오류가 있을 수 있다고 경고한다. Lean 검사 통과 자체도 증명 대상 명제가 원래 수학계의 질문과 정확히 같은지를 검증하는 전문가 검토를 대신하지 않는다.

배경

모델 benchmark에서 정답을 고르는 단계와 실제 새로운 수학 결과를 제시하는 단계 사이에는 큰 검증격차가 있다. OpenAI는 Institute for Advanced Study 관련 독립 자문그룹의 제안을 참고해 논문 수정·인용 절차와 원고·형식증명을 함께 공개하는 방식을 택했다. 연구계가 그 결과의 새로움, 기존 선행연구와의 관계, 증명 범위를 평가하는 절차는 계속 필요하다.

산업·시장에 미치는 영향

AI for Science가 논문 요약이나 실험보조에서 수학적 가설과 증명 작성으로 확장되고 있다는 신호다. 동시에 수백 건의 원고를 인간 연구자가 검증하는 데 필요한 시간과 리뷰 비용이 새로운 병목이 된다. 일부 결과가 장기간 검증 후 채택될 수 있지만 모든 주장이 이미 학문적 정설로 인정됐다는 의미는 아니다.

실무에서 바로 활용할 수 있는 시사점

형식기법을 도입하는 개발팀은 AI가 제안한 주장과 Lean 등으로 실제 검증된 명제를 분리 기록하고, 사용한 공리·외부 라이브러리·명제 의미를 검토해야 한다. 정리증명 도구나 프로그램 검증을 생산 업무에 연결할 때에도 전문가의 명세 작성과 사후 리뷰를 유지하는 것이 적절하다.

출처

OpenAI — Sharing AI progress in mathematics

GitHub — openai/math