프런티어 모델이 출시 직후와 몇 주 뒤에 정말 같은 성능을 내는지에 대한 논쟁은 오래됐다. 이용자들 사이에서는 앤트로픽이 모델을 출시하고 나서 며칠 혹은 몇 주 뒤에 '너프(nerf)'한다는 이야기가 반복적으로 나왔다. 여기서 너프란 양자화, 같은 이름 뒤에 더 작은 모델을 두는 것, 추론 강도를 낮추는 것, 라우팅 변경 같은 여러 가능성을 포괄한다. 반대로 실제로는 아무 일도 일어나지 않았고 사람들이 노이즈에서 패턴을 읽어낸 것일 수도 있다. 문제는 지금까지 출시 당일의 깨끗한 기준선(day-0 baseline)이 없었다는 데 있다. 비교할 원점이 없으니 모든 논쟁은 '체감 대 체감'으로 끝났다.
'livenerf'는 바로 이 지점을 겨냥한 소규모 벤치마크다. 질문은 단 하나, '모델이 출시 후 나빠지는가'이다. Claude Opus 5.5가 2026년 9월 22일에 출시된 것을 계기로, 출시 시점부터 시계를 돌려 관측을 시작하는 프로젝트다. 접근 방식은 현실적이다. 이 모델들은 결정론적으로 만들 수 없다. 샘플링 파라미터를 제어할 수 없고 사고(thinking) 과정을 끌 수도 없기 때문이다. 그래서 livenerf는 나머지 모든 것을 고정한다. 프롬프트를 동결하고, CLI 버전을 고정하고, 채점기를 정확한 함수로 두고, 원시 로그를 영구 보존한다. 그런 뒤 수천 개의 샘플에 걸쳐 통계적으로 변화(drift)를 측정한다. 도구는 영국 AI 보안연구소(UK AI Security Institute)의 오픈소스 평가 프레임워크 Inspect를 쓰고, 통계 처리는 앤트로픽이 공개한 'Adding Error Bars to Evals' 방식을 따른다. 자체적으로 만든 방법론이 아니어서 논쟁의 여지를 줄였다는 점이 특징이다.
무엇을, 어떻게 측정하나
v0는 API 키 없이 Claude Max 구독을 헤드리스 Claude Code(claude -p)를 통해 사용한다. 이 대목이 중요하다. livenerf가 재는 것은 '구독을 통해 Claude Code로 제공되는 Opus 5.5'이지, 원시 API 모델이 아니다. 실제로 대부분의 너프 논란이 가리키는 대상이 바로 이 구독 경로다. 핵심 지표는 보정된 문제 패널에서 기준선 대비 문항별 점수 차이를 짝지어 비교한 값이며, 군집 표준오차(clustered standard errors)를 적용해 문항 난이도 요인을 상쇄한다. 저자가 가장 주목하는 보조 신호는 샘플당 출력 토큰 수다. 모델이 조용히 '덜 생각하기' 시작하면 정확도가 움직이기 전에 토큰 수에서 먼저 드러나는 경우가 많기 때문이다.
운용 방식은 단순하고 지루하도록 설계됐다. 패널 전체를 하루 한 번씩 30일간 돌린다. 1~10일은 기준선, 이후 두 개의 10일 창을 둔다. 9월 29일 기준으로 6일치가 수집됐고(기준선 6/10) 누락은 없었으며, 6일 모두 동일한 하네스 해시와 고정된 CLI(2.1.280)에서 90개 샘플을 완주했다. 다만 5일차는 예산 가드를 한 차례 수동으로 해제하고 실행한 편차가 기록으로 남아 있다.
실무자가 눈여겨볼 지점
재현성을 위해 이 프로젝트는 CLI 고정을 필수로 못박는다. Claude Code 업데이트는 하네스를 바꾸는데, 바뀐 하네스는 바뀐 모델과 겉보기에 완전히 똑같이 보이기 때문이다. 그래서 자동 업데이트를 끄고 고정 버전과 일치하지 않으면 러너가 실행을 거부한다. Max 요금제가 토큰 단위 한도를 공개하지 않는 탓에, 예산은 /usage가 보여주는 주간 미터의 퍼센트를 로컬 로그인으로 읽어(읽기 전용 요청) 관리한다. 주간 미터가 75% 이상이거나 5시간 미터가 60% 이상이면 그날 시도는 건너뛰고 매시간 재시도한다. 일반적인 사용과 자원을 다투지 않도록 벤치마크가 요금제의 정해진 몫만 쓰게 한 것이다.
판정 규칙은 보수적이다. 변화로 인정하려면 두 개의 연속된 10일 창에서 99% 구간이 0을 배제해야 하고, 효과 크기가 최소 3점 이상이어야 하며, 대조군(control arm)이 같은 방향의 움직임을 보이지 않아야 한다. 세 조건을 모두 충족해야 비로소 '변했다'고 말한다. 첫 결과 행은 20일차 이후에 나오고, 방향을 판정할 수 있는 첫 시점은 대략 10월 24일 무렵이다. 회귀뿐 아니라 개선도 똑같이 크게 보고하며, 아무 변화가 없다는 귀무 결과(null result)도 그대로 공개한다.
주목할 것은 이 프로젝트가 스스로 세운 한계다. 저자는 출시 주간의 기준선이 진리가 아니라 하나의 참조점일 뿐이라고 명시한다. 오히려 출시 주간이 가장 나쁜 주일 수도 있다. 새 서빙 스택, 용량 부담, 출시 초기 버그가 겹치기 때문이다. 실제로 2025년의 품질 사고들은 의도적 다운그레이드가 아니라 인프라 버그로 밝혀졌다. 그래서 livenerf는 원인을 가정하지 않고 양방향의 변화만 검증한다.
프로젝트의 목표는 의도적으로 좁다. 하나의 모델, 하나의 하네스, 적대적인 독자가 뜯어봐도 버틸 수 있는 하나의 깨끗한 시계열을 만드는 것이다. 리더보드도 아니고 범용 평가 프레임워크도 아니다. 문항은 정확히 채점 가능하고, 정답률 30~70% 구간에 위치하며, 매일 돌릴 만큼 저렴할 때만 패널에 들어간다. 동결된 패널 문항은 해시만 공개하고 내용은 비공개로 두며, 문항·프롬프트·채점기를 바꾸면 기존 것을 조용히 대체하지 않고 새 버전을 만든다. 흥미롭게도 저자는 이 저장소 상당 부분이 측정 대상인 Claude의 도움으로 작성됐다고 밝힌다. 채점기를 순수 함수로 두고, 임계값을 사전 등록하고, 원시 데이터를 공개하는 이유가 바로 여기에 있다. 저자가 사람이든 모델이든, 그를 신뢰할 필요 없이 데이터로 검증할 수 있게 하려는 설계다.