무슨 일이 있었나
OpenAI가 수학 분야에서 AI가 이룬 진전을 소개하는 글을 공개했어요. 구체적인 사례와 수치는 원문에서 직접 확인해 보세요. 이 글에서는 한 발 물러서서 이런 발표를 어떤 맥락에서, 어떤 눈으로 읽어야 하는지 정리해 볼게요. 지난 2년 동안 AI 수학 분야에서는 진짜 돌파구와 과장된 홍보가 뒤섞여 나왔거든요. 배경을 알고 읽으면 같은 발표도 완전히 다르게 보여요.
지난 2년, AI 수학이 걸어온 길
2024년 여름, Google DeepMind의 AlphaProof와 AlphaGeometry 2가 국제수학올림피아드(IMO)에서 6문제 중 4문제를 풀어 은메달 수준을 기록했어요. 다만 사람이 문제를 Lean이라는 형식 언어로 먼저 번역해 줬고, 어떤 문제는 푸는 데 며칠이 걸렸어요.
2025년 5월에는 DeepMind의 AlphaEvolve가 4×4 복소수 행렬 곱셈을 곱셈 48번으로 끝내는 방법을 찾았어요. 1969년 Strassen 알고리즘 이후로는 49번이 기준이었으니, 반세기 넘은 기록이 바뀐 셈이죠.
2025년 7월에는 OpenAI의 실험적 추론 모델과 Google의 Gemini Deep Think가 IMO 2025에서 6문제 중 5문제를 풀어 금메달 수준에 올랐어요. 이번에는 형식 언어 번역 없이 자연어로, 시험 시간 안에 풀었어요. 1년 만에 조건이 확 달라진 거예요.
그리고 2025년 10월에는 에르되시 문제 해프닝이 있었어요. OpenAI 쪽 인사가 GPT-5가 미해결 에르되시 문제 10개를 풀었다는 식으로 홍보했는데, 알고 보니 이미 논문에 풀이가 있는 문제를 찾아낸 것이었어요. 에르되시 문제 사이트를 운영하는 Thomas Bloom이 '극적인 왜곡'이라고 반박했고, 게시물은 삭제됐어요. 흥미로운 건 묻혀 있던 논문을 찾아낸 문헌 검색 능력 자체는 수학자들에게 실제로 쓸모가 있었다는 점이에요. 다만 그건 '새로운 발견'과는 다른 이야기죠.
왜 하필 수학일까: 채점할 수 있는 문제
수학은 답이 맞았는지 확인할 수 있어요. 이게 AI 학습에서는 엄청난 장점이에요. 모델이 풀이를 내면 자동으로 채점하고, 맞힌 쪽으로 모델을 강화하는 강화학습(RL)을 돌릴 수 있거든요. 이걸 '검증 가능한 보상을 이용한 강화학습(RLVR)'이라고 불러요. 코딩도 똑같아요. 테스트를 통과했는지 기계가 판단할 수 있죠. 그래서 수학 실력과 코딩 실력이 함께 자라고, 수학에서 나온 성과는 앞으로 코딩이 어디까지 좋아질지 미리 보여주는 신호이기도 해요.
발표를 읽을 때 던질 다섯 가지 질문
1. 정말 새로운 결과인가? 기존 문헌에 이미 있던 걸 찾아낸 건 아닌지 봐야 해요. 에르되시 해프닝이 남긴 교훈이에요.
2. 누가 검증했나? Lean 같은 형식 증명인지, 전문 수학자가 검토했는지, 아니면 자체 평가인지 확인하세요.
3. 사람이 얼마나 개입했나? 문제 선정, 힌트, 여러 번 시도한 결과 중 좋은 것 고르기까지 모두 사람의 개입이에요.
4. 성공률은 얼마인가? 성공 사례만 골라 보여주는 체리피킹은 아닌지, 몇 번 시도해서 몇 번 성공했는지가 중요해요.
5. 얼마나 중요한 문제인가? 오랫동안 주목받지 못한 '롱테일' 문제를 정리해 주는 것도 분명 가치가 있어요. 하지만 그걸 수학계의 핵심 난제를 푼 것과 같은 무게로 읽으면 곤란해요.
업계 맥락: 자연어냐, 형식 검증이냐
지금 AI 수학은 크게 두 갈래로 나뉘어요. OpenAI나 Gemini Deep Think처럼 자연어로 사람처럼 추론하는 쪽이 있고, AlphaProof나 Harmonic의 Aristotle처럼 Lean으로 기계가 검증할 수 있는 증명을 만드는 쪽이 있어요. 자연어 쪽은 유연하지만 결국 사람이 검토해야 해요. 형식 검증 쪽은 확실하지만 느리고 까다롭고요. 장기적으로는 자연어로 생각하고 Lean으로 확인하는 형태로 합쳐질 가능성이 커 보여요. 벤치마크를 얼마나 믿을 수 있느냐도 계속 쟁점이에요. 연구 수준 문제로 구성된 FrontierMath는 OpenAI가 개발 자금을 댔다는 사실이 뒤늦게 알려지면서 논란이 됐거든요.
한국 개발자에게 주는 시사점
먼저, 추론 모델의 수학 실력은 알고리즘 설계, 복잡도 분석, 까다로운 엣지 케이스 처리 같은 코드 작업으로 바로 이어져요. 둘째, 에르되시 해프닝의 역설을 기억하세요. AI는 '이미 누군가 푼 문제'를 찾는 데 아주 뛰어나요. 개발에서도 바퀴를 다시 발명하기 전에 AI에게 기존 해법부터 찾게 하면 시간을 크게 아낄 수 있어요. 셋째, AI는 결과를 검증할 수 있는 곳에서 강해요. 우리 코드베이스에 테스트, 타입, 린터가 촘촘할수록 AI 에이전트에게 믿고 맡길 수 있는 일이 많아져요.
마무리
AI 수학은 진짜 진전과 과장이 동시에 일어나는 분야예요. 발표가 얼마나 요란한지보다 어떻게 검증했는지를 보세요. 여러분은 어떻게 생각하세요? AI가 증명했는데 아무도 이해하지 못하는 정리가 나온다면, 그것도 수학의 진보일까요?
🔗 출처: Hacker News