핵심 내용

Epoch AI의 FrontierMath: Open Problems 보드에서 The Core in Approval-Based Committee Elections 문제가 현재 Solved (human + AI)이자 Major advance로 표시돼 있다. 문제는 approval voting에서 항상 core-stable committee가 존재하는지에 관한 사회선택이론의 장기 미해결 질문이었다. 원래 benchmark prompt는 core가 비어 있는 반례를 찾도록 요구했지만, Becker, Greger, Peters가 오히려 core가 항상 비어 있지 않음을 증명하면서 문제 자체에 반례가 존재하지 않는다는 방향으로 해결됐다.

Epoch는 저자들이 핵심 아이디어와 증명의 주된 기여를 GPT-6 Astra와의 긴 interactive session에 돌렸다고 기록했다. 동시에 Dominik Peters는 Astra가 간단한 단일 prompt만으로 문제를 독립적으로 해결한 것으로 보기는 어렵고, 인간 연구자의 적극적인 상호작용이 필요했다고 설명했다. 그래서 Epoch는 이를 ‘AI 단독 해결’이 아니라 human + AI solution으로 분류했다. 이는 AI가 난제 해결에 실질적으로 기여했다는 의미가 있지만, 사람의 방향설정·검토 없이 autonomous mathematician이 된 사례로 과장해서는 안 된다.

배경

FrontierMath는 기존 Olympiad·교과형 benchmark보다 실제 연구수학에 가까운 문제를 추적하기 위해 만들어졌다. 최근 모델들은 정답이 이미 알려진 benchmark보다 공개 미해결 문제에서 새로운 결과를 내는 방향으로 평가 범위가 확장되고 있다. 이번 사례는 특히 benchmark가 ‘반례가 있을 것’이라는 전제를 갖고 있었지만 AI와 인간의 공동연구가 그 전제 자체를 뒤집은 경우라는 점에서 흥미롭다.

산업·시장에 미치는 영향

과학·수학 AI의 경쟁 기준이 문제 정답률에서 새로운 증명·반례·연구방향을 실제로 만들어내는가로 이동하고 있다. 이런 결과가 반복되면 AI 연구도구의 가치는 답변 생성보다 hypothesis generation, proof sketch, search, formal verification, 인간과의 iterative research loop에서 더 크게 평가될 수 있다. 다만 기여도 산정은 아직 연구자 자기보고에 크게 의존하므로 AI가 어느 정도를 독립적으로 수행했는지 평가하는 공통 기준이 필요하다.

실무에서 바로 활용할 수 있는 시사점

연구형 Agent를 설계할 때 one-shot으로 ‘정답을 내라’고 시키는 것보다 가설 생성 → 반례 탐색 → 계산 검증 → 인간 피드백 → 증명 재구성을 반복하는 workflow가 더 현실적이다. 수학이라면 Lean·Coq 같은 formal verifier, 코드라면 test·static analysis, 과학이라면 독립 시뮬레이션 같은 외부 검증기를 붙여 모델이 제시한 아이디어와 검증을 분리하는 편이 좋다.

출처: Epoch AI — The Core in Approval-Based Committee Elections, Epoch AI — FrontierMath: Open Problems