TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 22 READS

숨겨진 정보의 벽을 넘다: AI가 마침내 스트라테고를 정복한 방법

숨겨진 정보의 벽을 넘다: AI가 마침내 스트라테고를 정복한 방법
SOURCE IMAGE · HACKER NEWS

체스, 바둑, 포커가 차례로 함락되는 동안에도 보드게임 '스트라테고'는 오랫동안 인공지능의 벽으로 남아 있었다. 1997년 딥블루가 가리 카스파로프를 체스에서 꺾었고, 2016년 알파고가 이세돌을 바둑에서 이겼으며, 포커 봇은 수년째 프로를 상대로 승리해 왔다. 그러나 막대한 예산을 쓰는 딥마인드조차 스트라테고에서 최정상 인간을 안정적으로 이기는 기계를 만들지 못했다. 이번에 카네기멜런, MIT, 뉴욕대, 스탠퍼드 연구진이 만든 AI '아타락소스(Ataraxos)'가 그 과제를 풀었다. 역대 최강으로 평가받는 선수 핌 니마이어를 상대로 15승 1패 4무를 기록했고, 학습에 든 자원은 GPU 16대와 수천 달러에 불과했다.

왜 스트라테고가 어려웠나

스트라테고는 각 플레이어가 원수부터 스파이까지의 계급과 폭탄, 깃발을 포함한 40개의 말을 쓰는 게임이다. 상대의 깃발을 잡으면 승리한다. 상대는 내 말이 '어디' 있는지는 알지만 '무엇'인지는 모른다. 두 말이 충돌해 싸울 때에야 약한 쪽이 제거되고 이긴 말의 정체가 드러난다. 포커처럼 불완전정보 게임이지만 숨겨진 정보의 규모가 차원이 다르다. 텍사스 홀덤에서는 숨은 카드가 두 장뿐이라 가능한 패가 1,326가지에 그치지만, 스트라테고는 40개 말의 배치만으로 1데실리온(10의 33제곱) 이상의 경우의 수가 나온다. 게다가 체스가 보통 40수 만에 끝나는 데 비해 스트라테고는 2,000수까지 이어진다. NYU의 유진 비니츠키는 "엄청난 양의 숨겨진 정보가 아주 긴 시간에 걸쳐 서서히 드러난다는 점이 스트라테고의 독특함"이라고 말했다.

여기에 블러핑이라는 심리전이 더해진다. 약한 말을 원수인 척 움직여 상대를 겁주지만, 너무 자주 하면 위협이 무의미해지고 아예 안 하면 예측당한다. 이 균형 잡기가 2022년 딥마인드가 공개한 'DeepNash' 같은 앞선 AI들을 좌절시킨 지점이었다.

두 번째 신경망, 그리고 '앞을 내다보기'

아타락소스도 DeepNash처럼 자기 자신과 대국하며 배웠다. 총 1억 6,300만 판을 두었고, 이기는 수는 강화하고 지는 수는 줄이는 단순한 원리는 같았다. 차이는 매 판 이후 전략을 얼마나 조정하느냐에 있었다. 숨겨진 정보는 자가학습 알고리즘을 제자리에서 맴돌게 만드는데, 연구진은 학습 초반에는 전략을 크고 과감하게 바꾸고 후반에는 작고 신중하게 바꾸는 방식으로 이 문제를 다뤘다.

더 큰 혁신은 수를 두기 전에 미리 앞을 내다보는 탐색이었다. 알파고류 AI는 행동 직전 탐색으로 전략을 다듬지만, 딥마인드는 스트라테고의 탐색 공간이 너무 커서 이를 구현하지 못했다. 연구진의 해법은 상대가 말을 움직여 온 방식을 보고 숨은 정체를 추측하는 두 번째 신경망, 즉 '믿음 모델(belief model)'이었다. 모든 배치를 일일이 따지는 대신, 아타락소스는 그럴듯한 배치들을 표본으로 뽑아 후보 수를 실제로 두어 보고 결과를 보고 선택한다.

감정 없는 기계의 강점

아타락소스라는 이름은 '평정'을 뜻하는 고대 그리스어에서 왔다. MIT의 가브리엘레 파리나는 인간이라면 무너질 상황에서도 충동적으로 반응하지 않는 이 AI의 성격을 담았다고 설명했다. 큰 열세에 몰린 인간은 대개 큰 도박을 거는 반면, 아타락소스는 천천히 체계적으로 게임을 되돌린다. 또한 자신의 약점에 상대의 주의가 쏠릴 이유가 없다고 판단하면, 양쪽 판을 다 보는 사람에겐 재앙처럼 보일 자리도 그대로 내버려 둔다. 파리나는 "인간은 비밀을 알면 그걸 아는 사실을 무시하고 결정하기가 매우 어렵지만 기계에겐 쉽다"고 말했다. 비니츠키는 "승률 2%에서 아주 태연하게 블러핑으로 빠져나오는 봇을 지켜봤다"고 덧붙였다.

상대였던 니마이어는 세계선수권 4회 우승에 세계 랭킹 1위를 600주 넘게 유지한 선수다. 그는 3주에 걸쳐 온라인으로 20판을 두며 승리당 100달러를 받았고, AI가 자신에게 적응하지 않는다는 점을 이용해 약점을 찾을 시간이 충분했지만 단 한 번만 이겼다. 연구진은 그 패배가 결함이 아니라고 본다. 말 배치를 무작위로 해야 잘 둘 수 있는 게임 특성상 운이 늘 작용하며, "완벽한 전략도 때로는 그냥 진다"는 것이다. 운은 양쪽 모두에게 작용했다고 비니츠키도 인정했다. 2025년 스트라테고 세계선수권에서 아타락소스는 40판 중 38판을 이겼고, 깃발을 폭탄 두 개 뒤 구석에 숨기는 좀처럼 쓰지 않던 배치로 메타게임까지 바꿔 놓았다.

실무가 주목할 지점: 비용과 확장성

이 성과에서 한국 실무자가 특히 눈여겨볼 대목은 가격표다. DeepNash는 구글 전용 칩 1,024개로 2~3개월 학습했고, 2025년 기준으로 300만~450만 달러가 드는 규모로 추정된다. 반면 아타락소스는 GPU 16대를 일주일, 믿음 모델용으로 4대를 나흘 더 쓰는 데 그쳤다. 파리나와 주저자 새뮤얼 소코타는 그래픽카드에서 초당 수백만 수를 돌리는 시뮬레이터를 직접 작성해 이 효율을 달성했다. 학계가 GPU를 무한정 쓸 수 없는 현실에서 나온 선택이었고, 결과적으로 DeepNash보다 약 34배 적은 판으로 더 강해졌다. 같은 구조는 8개 말을 쓰는 변형 '배라지 스트라테고'에서 세계챔피언 3명을 이겼고, 협력형 카드게임 하나비와 중국 카드게임 더우디주에서도 통했다.

다만 한계도 분명하다. 협상, 금융시장, 군사 충돌 같은 현실 문제는 규칙이 고정돼 있지도, 승자가 명확하지도 않다. 연구진은 어떤 현실 문제든 단순화된 모델을 세우는 데서 출발하므로 간극이 보기보다 작다고 주장하며, 전쟁 게임처럼 강한 상대의 대응을 미리 시뮬레이션하는 용도를 거론한다. 그러나 아타락소스는 지금으로선 자신이 왜 그런 수를 뒀는지 설명하지 못한다. 파리나는 "강하면서도 해석 가능하고 설명 가능한 전략을 만드는 것이 목표이지만 아직 거기엔 이르지 못했다"고 말했다. 강력하지만 불투명한 의사결정을 실제 업무에 들여올 때 반드시 함께 따져야 할 조건인 셈이다. 연구는 2026년 네이처에 게재됐다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://arstechnica.com/science/2026/10/ai-finally-beat-the-...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...