Simon Willison이 만든 "자전거 탄 펠리컨을 SVG로 그려라"는 테스트는 새 LLM이 나올 때마다 등장하는 유명한 비공식 벤치마크가 됐습니다. 문제는 벤치마크가 유명해지는 순간부터 신뢰를 잃는다는 것. 이 글은 AI 랩들이 이 펠리컨 그림에 일부러 최적화(pelicanmaxxing)하고 있는지 실험으로 파고듭니다. 저자는 펠리컨 대신 다른 동물이나 다른 탈것을 그리게 해 비교합니다. 만약 펠리컨-자전거만 유독 잘 그린다면, 실력이 아니라 특정 문제에 대한 과적합이라는 신호죠. 핵심 교훈은 명확합니다. 하나의 화제성 벤치마크 점수는 모델의 실제 일반화 능력을 보장하지 못한다는 것(굿하트의 법칙). 측정 지표가 곧 목표가 되면 지표로서의 가치를 잃습니다. IT 실무자라면 벤치마크 숫자에 현혹되지 말고, 실제 업무 데이터로 직접 평가(eval)를 만들어 검증하는 습관이 그 어느 때보다 중요합니다.