‘AI가 이걸 해내면 인정할게’ 결산표
개발자 커뮤니티에서 AI 이야기가 나오면 꼭 등장하는 댓글이 있어요. “AI가 진짜 ○○를 해내면 그때 인정하겠다” 같은 거요. 그런데 이런 댓글들을 모아놓고, 그 도전이 이미 달성됐는지 사람들이 투표하게 만든 사이트가 나왔어요. 주소부터 재밌는데, goalposts예요.
영어에 ‘골대 옮기기(moving the goalposts)’라는 표현이 있어요. 상대가 공을 차는 순간 골대를 슬쩍 옮겨버린다는 뜻이에요. 상대가 기준을 채우면 기준 자체를 바꿔버리는 행동을 가리키죠. 이 사이트는 해커뉴스 댓글로 남은 과거의 ‘AI 도전 과제’들을 모아두고, 정말 깨졌는지를 집단 판정에 맡겨요. 일종의 실험인 셈이에요.
익숙한 패턴, ‘AI 효과’
사실 아주 오래된 현상이에요. 컴퓨터 과학자 래리 테슬러의 이름과 함께 알려진 “AI란 아직 이루어지지 않은 모든 것”이라는 말이 있어요. 흔히 AI 효과(AI effect)라고 부르는데요, 기계가 뭔가를 해내는 순간 사람들이 “그건 진짜 지능이 아니라 그냥 계산이지” 하면서 AI의 범위에서 빼버린다는 거예요.
역사를 보면 딱 맞아떨어져요. 1997년 딥블루가 체스 세계 챔피언 카스파로프를 이겼을 때 “체스는 경우의 수 계산일 뿐, 바둑은 다르다”는 말이 나왔어요. 그러다 2016년 알파고가 이세돌 9단을 이겼죠. 한국 개발자라면 그날의 충격을 생생히 기억하실 거예요. 그다음 기준은 자연스러운 대화, 그다음은 코딩, 그다음은 수학이었어요. 그리고 2025년에는 구글 딥마인드와 OpenAI가 자기네 모델이 국제수학올림피아드(IMO)에서 금메달 수준의 점수를 냈다고 발표했어요.
왜 하필 ‘투표’일까
여기서 재밌는 질문이 생겨요. ‘달성했다’는 걸 누가, 어떻게 판단하냐는 거죠. 예를 들어 “AI가 혼자서 실제로 돌아가는 앱을 만들면 인정”이라는 도전이 있다고 해볼게요. 한 번 성공하면 달성일까요, 열 번 중 아홉 번은 성공해야 할까요? 데모 영상 속 성공과 실제 업무에서의 성공이 같은 걸까요? 댓글 쓴 사람의 원래 의도와 문장 그대로의 의미가 다르면 어느 쪽을 따라야 할까요?
기준이 이렇게 애매하니까, 투표로 커뮤니티의 합의를 보는 건 꽤 영리한 선택이에요. 다만 한계도 분명해요. 투표는 사실 판정이 아니라 분위기 측정에 가깝거든요. AI에 열광하는 사람이나 강하게 회의적인 사람이 더 열심히 투표하면 결과가 한쪽으로 쏠릴 수 있어요.
골대를 옮기는 게 나쁜 걸까
공정하게 양쪽 이야기를 다 들어볼게요.
회의론 쪽 주장은 이래요. 골대를 옮기는 게 아니라, 처음 골대 위치를 잘못 잡았다는 걸 깨닫는 것이라는 거예요. 체스를 이기는 능력이 일반적인 지능과 같지 않다는 걸 알게 된 건 실패가 아니라 배움이라는 거죠. 굿하트의 법칙도 같은 맥락이에요. “측정 지표가 목표가 되면 더 이상 좋은 지표가 아니다”라는 법칙인데요, 특정 시험만 잘 보도록 최적화된 모델은 점수만큼 똑똑하지 않을 수 있어요.
반대쪽은 기준을 계속 바꾸면 영원히 반증할 수 없는 주장이 된다고 지적해요. AI가 뭘 해내든 “그건 진짜가 아니야”라고 하면 토론 자체가 안 되니까요. 실제로 벤치마크 업계를 보면 SWE-bench, ARC-AGI, Humanity’s Last Exam 같은 어려운 시험들이 나오자마자 점수가 빠르게 올라가는 ‘포화’ 현상이 반복되고 있어요. ARC-AGI-2 같은 후속 버전이 계속 나오는 것도 그래서예요.
개발자에게 주는 시사점
실무자라면 꼭 기억할 게 있어요. ‘할 수 있다’와 ‘믿고 맡길 수 있다’는 완전히 다른 이야기예요. 업무에서는 데모 한 번의 성공보다 “100번 시켰을 때 몇 번 제대로 하느냐”가 훨씬 중요하거든요. “틀렸을 때 얼마나 쉽게 알아챌 수 있느냐”도 마찬가지고요.
그래서 이 사이트에서 얻을 수 있는 가장 실용적인 습관은 예측을 기록하는 것이에요. 내 업무에서 “AI가 아직 못하는 일” 목록을 구체적으로 적어두세요. 그리고 몇 달에 한 번씩 최신 모델로 다시 테스트해보세요. 막연한 느낌 대신 직접 검증한 기준이 생기면 과장된 마케팅에도, 지나친 회의론에도 덜 휘둘려요.
마무리
한 줄로 정리하면, AI 논쟁에서 정말 필요한 건 골대 위치를 미리, 정확하게 적어두는 것이에요.
여러분은 예전에 “AI가 이것만 하면 인정한다”고 생각했던 기준이 있었나요? 그 골대는 지금 어떻게 됐나요? 아직 버티고 있는 골대가 있다면 그게 뭔지도 궁금해요!
🔗 출처: Hacker News