과학사 연구자가 최신 프런티어 모델을 역사 연구에 투입한 실험 기록을 공개했다. 필자는 2024~25년만 해도 AI의 역할이 문서 전사(轉寫)나 데이터 시각화 같은 '연구 보조' 수준에 머물렀지만, 이번 세대 모델부터는 상황이 달라졌다고 말한다. 핵심 주장은 단순하다. 협업 그룹으로 일하는 역사학자와 현행 프런티어 모델을 짝지으면 역사 지식과 해석에서 유의미한 진전이 여럿 나올 수 있으며, AI 연구소·역사 연구자·연구비 지원 기관이 이런 협업을 적극적으로 추진해야 한다는 것이다.
어떤 문제가 '풀 만한' 문제인가
흥미로운 대목은 필자가 모델이 성과를 내는 조건을 수학 분야의 경험에 빗대 정리한 부분이다. 전문가들이 이미 풀어야 할 문제군을 식별해 두었는가, 필요한 데이터가 완전히 디지털화되어 접근 가능한가, 다국어 추론·고급 수학·대규모 데이터 자율 탐색 같은 모델의 뾰족한(spiky) 강점에 맞는가, 맞춤 코드 작성으로 접근할 수 있는가, 그리고 무엇보다 잠재적 해답을 명확히 증명하거나 반증할 수 있는가. 추론 모델이 수학에서는 활약하지만 인문학 전반에서는 그렇지 못한 이유가 바로 이 마지막 조건, 즉 검증 가능성에 있다는 지적이다. 이 기준을 통과하는 역사 난제는 암호 해독, 번역·번안을 가로지르는 텍스트 추적, 그리고 서로 다른 세부 분야에 흩어진 발견들을 연결하는 작업 정도로 좁혀진다.
전문가도 재현하기 어려운 탐색
필자가 가장 주목한 방법은 세 번째, 니치한 하위 분야에 흩어진 조각을 잇는 일이다. 저항 끝에 풀린 1941년 7월 10일 자 에니그마 메시지 사례에서 실제 돌파구는 암호 해독 기법 자체가 아니라, 흩어진 정보의 전체 범위를 알아챈 데 있었다. 암호사 연구자 프로데 바이어루드에 따르면 모델은 독일 연방문서보관소(Bundesarchiv)에 존재하는 SS 부대 병참 지휘부의 무선 메시지 모음에 관한 기록을 찾아냈고, 이것이 해독의 열쇠가 됐다. 더 인상적인 것은 전문가들조차 모델이 정확히 무엇을 했는지 완전히 추적하지 못한다는 점이다. 모델이 언급한 파일 참조번호는 정확했지만 공개된 웹사이트에는 없었고, '개인 소장 자료'라는 언급의 정체나 문서보관소 디지털 컬렉션 접근 여부는 불분명했다. 필자는 이를 두고, 풀 수 있다고 판단한 문제에 대해 모델이 집요하게 탐색을 밀어붙이는 성향이라고 표현한다.
검증 가능성의 힘을 보여주는 사례도 있다. 엘리자베스 시대 오컬티스트 존 디의 암호 마법서 '리베르 로가에스'에 대해 모델은 이것이 암호가 아니라 사실상 무의미한 음절의 나열이라고 결론지었다. 다만 문자 반복 빈도에 대한 수학적 분석을 존 디의 일기와 교차 확인해, 필경사 에드워드 켈리가 특정 시점 이후 게을러지며 반복이 늘었다는 정황을 짚었고, 겉보기 횡설수설 중 한 대목이 실제로 천사적 존재 '보르노고'를 가리킨다는 점도 찾아냈다. 필자는 이것이 존 디 연구의 돌파구는 아니며 나비에-스토크스 방정식을 푸는 일과 동급도 아니라고 분명히 선을 긋는다.
뉴턴과 하틀리브를 잇는 아나그램
필자가 자기 전공인 과학·의학사로 무대를 옮기자 결과가 나아졌다. 진행 중인 다윈 프로젝트에서는 모델이 스스로 '다윈과 정보 제공자 사이의 알려지지 않은 지식 연결고리 찾기'라는 연구 주제를 제안했는데, 이는 논문과 박사 논문 사이 어디쯤에 놓일 만한 값어치 있는 기획이라는 게 필자의 직업적 직관과 맞았다. 과거 모델에는 이 정도 규모의 연구 프로젝트를 독자적으로 구상하는 능력이 없었다는 평가다.
가장 구체적인 성과는 새뮤얼 하틀리브 문서에서 나왔다. 모델은 5,000건이 넘는 1차 사료를 내려받고 하위 에이전트를 만들어 구글 북스 등에서 익명 출처를 여러 언어로 교차 확인했다. 그 과정에서 뉴턴과 하틀리브가 핵심 재료인 '헝가리 황산염(Hungarian vitriol)'을 각기 다른 아나그램·암호로 표기했다는 사실을 포착했다. 뉴턴의 'Vltimorui'는 vitriolum의 철자를 재배열한 진짜 아나그램이고, 하틀리브의 표기는 단어를 거꾸로 쓴 형태에 가깝다. 두 사람이 같은 재료를 암호화했다는 병렬 구조에 동일한 분량 서술과 여러 텍스트 대응이 겹치면서, 뉴턴이 하틀리브의 원고를 참고했다는 상당히 설득력 있는 정황이 됐다. 필자는 이것이 실제로 새로운 발견이며 뉴턴의 역사적 비중을 고려하면 출판 가치가 있을 수 있다고 본다.
한계와 실무적 함의
한계도 솔직히 드러난다. 1차·2차 세계대전 암호 메시지를 더 찾아 풀게 하려던 시도는 이미 쉬운 성과가 소진된 탓에 빈손으로 끝났다. 글을 쓰는 도중 모델이 부분 해독한 카를 5세의 16세기 스페인 암호 편지 두 건도, 알고 보니 하나는 1530년대에, 다른 하나는 1916년에 이미 해독된 것이었다. 화려해 보이는 결과가 실은 이미 알려진 사실의 재발견일 수 있다는 경고다.
한국의 실무자 관점에서 이 실험은 두 가지를 시사한다. 첫째, 자율 에이전트에 대량의 사료 수집과 다국어 교차 검증을 맡기는 방식은 방대한 아카이브를 다루는 도메인 어디에나 이식 가능한 워크플로다. 둘째이자 더 중요한 것은, 모델이 성과를 내는 조건이 '데이터가 디지털화되어 있고, 강점에 맞으며, 결과를 증명·반증할 수 있는가'라는 점이다. 검증 가능한 정답 구조가 없는 과제에서는 그럴듯하지만 틀린 결과, 또는 이미 알려진 사실의 재발견에 그치기 쉽다. 결국 모델의 집요한 탐색력을 성과로 바꾸는 것은 문제를 '풀 만한 형태'로 다듬고 결과를 냉정하게 검증하는 전문가의 몫이다.