TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 22 READS

30년 전 텍스트 게임 'MUD'가 AI 시험장이 됐어요 — 99달러로 만든 LLM 벤치마크

30년 전 텍스트 게임 'MUD'가 AI 시험장이 됐어요 — 99달러로 만든 LLM 벤치마크

혹시 'MUD(머드)'라는 게임을 아세요? PC통신 시절에 유행했던 텍스트 기반 온라인 게임인데요. 그래픽 없이 오로지 글자만으로 던전을 탐험하고, 몬스터와 싸우고, 다른 플레이어와 대화하는 게임이에요. 한국에서도 '쥬라기 공원'이나 '단군의 땅' 같은 머드게임이 90년대에 큰 인기를 끌었죠. 그런데 최근 이 30년 묵은 게임 장르가 전혀 예상 못 한 곳에서 다시 소환됐어요. 바로 LLM(대규모 언어 모델)의 능력을 평가하는 시험장으로요. 'CrucibleBench'라는 프로젝트인데, 단돈 99달러로 이 아이디어를 검증해냈다고 해요.

기존 벤치마크는 뭐가 문제길래?

지금 LLM 평가는 좀 곤란한 상황이거든요. MMLU 같은 유명 벤치마크들은 이미 최신 모델들이 만점 가까이 받아서 변별력이 없어졌어요. 더 심각한 건 '오염(contamination)' 문제인데요. 이게 뭐냐면, 벤치마크 문제와 정답이 인터넷에 공개되어 있다 보니 모델이 학습 과정에서 시험지를 미리 봐버리는 상황이에요. 시험 전날 족보를 통째로 외운 학생의 점수를 실력이라고 부를 수 없는 것처럼, 이런 점수는 모델의 진짜 능력을 보여주지 못해요.

그래서 요즘 평가 연구의 흐름은 '정적인 문제집'에서 '동적인 환경'으로 옮겨가고 있어요. 미리 정해진 정답이 없고, 상황이 계속 변하고, 모델이 직접 행동하고 그 결과를 받아봐야 하는 환경이요. 게임이 딱 그런 환경이죠.

왜 하필 MUD인가요?

MUD가 LLM 평가에 절묘하게 들어맞는 이유가 있어요. 첫째, MUD는 처음부터 끝까지 텍스트예요. LLM도 텍스트로 입출력하는 모델이니까, 화면을 이미지로 인식시키거나 별도의 인터페이스를 만들 필요 없이 게임 출력을 그대로 프롬프트에 넣고, 모델의 응답을 그대로 게임 명령어로 보내면 돼요. 궁합이 완벽한 거죠.

둘째, MUD는 긴 호흡의 능력을 요구해요. 던전을 클리어하려면 수백 턴에 걸쳐 계획을 세우고, 지나온 길을 기억하고, 인벤토리를 관리하고, 예상 못 한 상황에 대응해야 하거든요. 이건 단답형 문제로는 절대 측정할 수 없는 능력이에요. 요즘 다들 'AI 에이전트'를 이야기하는데, 에이전트에게 필요한 게 바로 이런 장기 계획 능력, 기억력, 상황 대응력이잖아요. MUD는 이걸 한꺼번에 시험할 수 있는 무대인 거예요.

셋째, 환경을 얼마든지 새로 만들 수 있어요. 던전 구조와 퀘스트를 바꾸면 그게 곧 새로운 시험지가 되니까, 족보 암기가 원천적으로 불가능해져요.

그리고 '99달러'라는 숫자가 주는 메시지도 커요. 대형 연구소의 인프라 없이도, 개인이 API 호출 비용 수준의 돈으로 의미 있는 평가 환경을 만들 수 있다는 걸 실제로 보여준 거거든요.

비슷한 시도들과 비교하면

사실 게임으로 AI를 평가하려는 시도는 계보가 꽤 길어요. 마이크로소프트의 TextWorld는 텍스트 어드벤처 게임을 학습·평가 환경으로 만들었고, NetHack Learning Environment는 악명 높은 로그라이크 게임 넷핵을 평가장으로 썼어요. 마인크래프트 안에서 LLM 에이전트를 굴린 Voyager 연구도 유명하고요. MUD 벤치마크는 이 흐름의 연장선에 있는데, '멀티 유저' 환경이라는 점이 차별점이에요. 다른 플레이어, 혹은 다른 AI와의 상호작용까지 평가 범위에 넣을 수 있는 가능성이 열리는 거죠.

한국 개발자에게 주는 시사점

이 프로젝트에서 배울 점은 '평가 환경은 생각보다 저렴하게 만들 수 있다'는 거예요. LLM을 서비스에 붙이는 회사가 많아졌는데, 정작 '우리 서비스에서 이 모델이 잘하는지'를 측정하는 자체 평가(eval)를 갖춘 팀은 드물거든요. 공개 벤치마크 점수는 우리 도메인에서의 성능을 보장해주지 않아요. 이 사례처럼 우리 업무를 시뮬레이션하는 작은 환경을 만들어서 모델을 직접 굴려보는 게, 모델 선택이나 프롬프트 개선에 훨씬 실질적인 근거가 돼요. 게임 서버 하나 띄우는 정도의 노력이면 시작할 수 있고요.

마무리

핵심 한 줄: 좋은 AI 평가는 비싼 인프라가 아니라 좋은 문제 설계에서 나와요. 여러분이라면 어떤 게임이나 환경으로 LLM을 시험해보고 싶으세요? 스타크래프트 같은 전략 게임? 아니면 우리 회사 사내 위키에서 답을 찾아 헤매게 하는 미로 탐험?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://cruciblebench.ai/
SHARE
처리 중...