이론컴퓨터과학자 스콧 애런슨은 자신의 블로그에 'Mathocalypse(수학의 종말)'라는 제목의 글을 올렸다. OpenAI가 팀 가워스, 에드워드 위튼 등 저명한 수학자로 구성된 자문단의 권고에 따라 하루 만에 372건의 굵직한 수학 결과를 한꺼번에 공개했다는 이야기다. 그중에는 애런슨의 아내이자 복잡도 이론가인 다나 모시코비츠가 오랜 세월 증명하려 애써 온 유니크 게임 추측(UGC)도 들어 있었다. UGC는 수많은 최적화 문제가, 반정부호 계획법(SDP) 완화로 얻는 근삿값보다 아주 조금만 더 나은 근사를 원하더라도 여전히 NP-난해하다는 것을 함의하는 명제다. 평생의 연구 목표가 기계에 의해 먼저 풀렸다는 소식 앞에서 그가 느낀 감정은, 글의 표현을 빌리면 '아마 모든 감정'이었을 것이다.
증명은 있는데 읽을 수가 없다
이 사건의 핵심 긴장은 '풀렸다'와 '이해했다' 사이에 있다. 372개 결과 중 일부에는 형식 증명 도구 Lean으로 만든 인증서가 붙어 있어 기계적 검증은 가능하지만, 정작 사람은 거의 아무도 그 증명을 아직 이해하지 못한 상태다. 모시코비츠가 남긴 즉각적 반응은 이 혼란을 생생히 전한다. 논문이 '환각 상태에서 쓴 글 같고', 불가능성 결과가 있음에도 왜 기존 기법을 쓸 수 있는지 설명 없이 선행 연구만 나열하며, AI의 도움 없이는 읽는 것 자체가 불가능하다는 것이다. UGC 증명은 롱 코드도 숏 코드도 아닌, 노이즈 테스트를 갖춘 새로운 트리 기반 부호를 재귀적으로 구성하는 낯선 방식이라고 그는 전했다. 더 나아가 Max Cut과 모든 제약 충족 문제(CSP)에 대해서는 UGC를 거치지 않고 곧장 최적 난해성을 증명한 결과까지 포함돼 있었다.
두 가지 공개 방식의 갈림길
흥미롭게도 이 흐름에는 서로 다른 '발표 모델'이 등장한다. OpenAI가 소화되지 않은 증명을 그대로 세상에 던져 인간들이 앞다퉈 해독하게 만든 반면, 하루 앞선 월요일 저녁에는 버지니아 윌리엄스와 조시 올먼이 arXiv에 3SUM을 O(n^1.9992), 전쌍 최단경로(APSP)를 O(n^2.9995)에 푸는 결과를 올려 반세기 묵은 추측을 뒤집었다. 이 경우 결정적 아이디어를 제공한 것은 Anthropic 모델이었는데, Anthropic은 결과를 날것으로 뿌리는 대신 두 연구자에게 보상을 주고 소화된 버전을 직접 쓰고 발표할 기회를 줬다. 애런슨은 이 둘을 각각 'OpenAI 방식'과 'Anthropic 방식'으로 부른다. 전자는 공로 인정이 모호하고 경쟁적인 해독 경주를 낳고, 후자는 어떤 인간 수학자가 AI의 대변인이 될지 민간 기업이 선택하게 만든다. 양쪽 모두 장단이 분명하다.
비용과 성능, 그리고 남은 난제
실무자 입장에서 주목할 지점은 투입 자원이다. 이번 결과는 나비에-스토크스 유한시간 폭발 구성에 쓰였던 수천 개 에이전트의 특수 장치가 아니라, OpenAI의 최신 내부 모델 하나가 만든 것이라고 전해진다. 문제당 평균 약 3시간의 'GPT-Pro급' 연산을 썼고, 약 8,000개 문제를 시도해 그중 약 5%를 풀었다. 즉 커뮤니티가 수년을 쏟은 미해결 문제의 5%를, 단 한 번의 3시간 시도로 해결한 셈이다. 이 모델은 안전위원회 권고에 따라 몇 달 안에 유료 ChatGPT 사용자에게 공개될 수 있다고 한다. 동시에 한계도 뚜렷하다. P≠NP, P=BPP 같은 이론컴퓨터과학 최대 난제는 목록에 없고, 리만 가설·호지 추측·버치-스위너턴다이어 추측 등 밀레니엄 문제들은 '부분 진전'에 그쳤다. 가장 깊은 문제들은 여전히 기계에도 어려웠다는 뜻이다.
한국 기술 실무자에게 남는 질문
이 글은 블로그 게시물이자 당사자 가족의 즉각적 반응에 상당 부분 기대고 있어, 각 증명의 정확성과 세부는 앞으로의 검증을 지켜봐야 한다. 그럼에도 시사점은 선명하다. 형식 검증(Lean)으로 정답 여부는 빠르게 가릴 수 있지만, 그 결과를 사람이 이해하고 설명하는 노동은 자동화되지 않으며 오히려 더 중요해진다. 애런슨이 인용한 콴타 매거진의 비유처럼, 기계가 우리를 산 정상에 순간이동시켜 주더라도 안개를 걷고 경로를 그리는 일은 여전히 공동체의 몫이다. AI가 결과를 만들고 인간이 검증·해설·응용을 맡는 분업은 수학만의 이야기가 아니라, 코드 생성과 검증을 다루는 소프트웨어 현장에도 그대로 번질 구도다. 지금 던져야 할 질문은 '기계가 풀 수 있는가'가 아니라, 풀린 결과를 누가 어떻게 이해하고 신뢰할 것인가다.