TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 27 READS

'1위'가 사실은 벤치마크 대상 그 자체일 때 — JevBench가 드러낸 순위의 함정

'1위'가 사실은 벤치마크 대상 그 자체일 때 — JevBench가 드러낸 순위의 함정
SOURCE IMAGE · HACKER NEWS

타입 지정 의사결정 모델(typed decision model)을 겨루는 공개 벤치마크 JevBench의 최신 버전 v1.3.0이 공개됐다. 52개의 Jev 계열 시스템을 534개의 의사결정 과제로 평가했고, Jev 1.13.0이 74.4점으로 1위를 차지했다. 숫자만 보면 평범한 리더보드 갱신처럼 보이지만, 실제로 흥미로운 지점은 순위표 맨 윗줄에 74.4보다 높은 83.6이라는 점수가 찍혀 있으면서도 그 항목이 '순위에는 포함되지 않는다'는 사실이다. 이 벤치마크는 왜 더 높은 점수를 1위로 올리지 않았을까. 그 이유를 따라가면 요즘 부쩍 늘어난 '분류 API' 제품을 실무자가 어떻게 읽어야 하는지가 보인다.

제품 이름 뒤에 있는 실제 모델

문제의 항목은 classifier.dev라는 서비스다. 이 벤치마크가 주목한 핵심은, classifier.dev가 자체 모델을 가진 것이 아니라는 점이다. 근거는 추측이 아니라 classifier.dev 자신의 문서다. 서비스 페이지는 '패스트 티어(fast tier)는 TypeSafe의 의사결정 모델인 Jev'라고 명시하고 있고, API를 호출하면 응답의 model 필드에 'jev-1.13.0'이 그대로 돌아온다. 즉 JevBench가 직접 측정한 Jev 1.13.0과 완전히 같은 모델 버전이다. classifier.dev를 Jev와 나란히 순위 매기는 것은 결국 'Jev의 모델을 Jev의 모델과 비교'하는 자기순환이 된다. 그래서 v1.2.4부터 이 항목은 1위가 아니라 '특별 언급(honorable mention)'으로 분류해 목록에는 올리되 서열에서는 뺐다. 벤치마크가 자기 방법론의 일관성을 위해 더 높은 점수를 스스로 강등시킨 셈이다.

classifier.dev가 모델 위에 얹은 것은 두 가지다. 하나는 가격 정책이고, 다른 하나는 스마트 티어의 오케스트레이션 계층이다. 스마트 티어는 Jev가 확신도 0.7 미만으로 내놓은 답만 추론 모델에 다시 물어보는 방식으로, 문서에 따르면 재질의에 쓰이는 모델은 gemini-3.8-flash다. 이것은 낮은 확신도에 대한 에스컬레이션, 즉 모델 캐스케이드이지 best-of-N이나 self-consistency, 위원회(committee) 방식이 아니다. 다만 이번 측정에서 스마트 티어의 에스컬레이션은 실제로 돌리지 않았다. 따라서 여기 실린 점수는 오직 패스트 티어에 대한 것이며, 스마트 티어의 성능은 이 벤치마크가 말할 수 있는 범위 밖에 있다.

같은 모델인데 점수가 다른 이유

실무자 입장에서 더 눈여겨볼 대목은, 같은 모델을 감쌌는데도 점수가 완전히 일치하지 않는다는 사실이다. 측정 세트에서 패스트 티어는 판단(judge) 구간에서 97.3%로 Jev의 94.5%보다 높았고, 반대로 어려운(hard) 구간에서는 70.5%로 Jev의 74.1%보다 낮았다. 순수한 패스스루라면 나오기 어려운 차이다. classifier.dev는 이런 종류의 차이를 배칭(batching)으로 설명한다. '패스트 티어는 요청 하나에 Jev를 천 개씩 묶어 넣는다'는 것이고, 자체 테스트 세트 두 곳에서는 동일한 차이를 노이즈 수준으로 측정했다고 한다. 결론적으로 '같은 모델을 쓴다'는 것과 '완전히 동일한 출력이 나온다'는 것은 다른 이야기이며, 호출 방식이 결과를 흔들 수 있다는 점을 기억할 필요가 있다.

가격은 사용량에 달려 있다

가격 해석에도 함정이 있다. 흔히 인용되는 1,000건당 0.0033달러라는 수치는 공개된 정액 요금제를 최대치로 다 쓸 때의 추정값이다. Pro 요금제는 월 20달러에 하루 20만 건의 패스트 분류를 제공하고, 분류 한 건이 곧 의사결정 한 건이다. 사용량이 적으면 건당 단가는 오히려 올라간다. 할당량의 10분의 1만 쓰면 1,000건당 0.033달러가 되고, 이번 측정에 실제로 쓰인 무료 티어(하루 2만 건)는 비용이 0이다. 주의할 점은 이 정액 요금이 어떻게 감당되는지, 즉 원가 구조는 공개돼 있지 않다는 것이다. 문서가 밝히는 유일한 원가성 숫자는 '패스트 티어 뒤의 모델은 1,000건당 약 0.005달러가 들고 TypeSafe 키가 필요하다'는 문장인데, 이는 짧은 한 문장짜리 입력 기준이지 JevBench의 통짜 질문 기준이 아니다. 단가 비교를 할 때 입력의 성격이 다르면 숫자도 다르다는 뜻이다.

classifier.dev 자체는 문제 있는 제품이 아니다. 계정 없이 무료로 쓸 수 있고, 마이클 랴부이(Michael Ryaboy, @michael_chomsky)가 만든 오픈소스이며 문서화도 충실하다. 이번 벤치마크가 겨냥한 것도 제품 비방이 아니라 순위표의 정직성이다. 재판매나 래핑 형태의 서비스가 늘어나는 지금, '무엇이 진짜 모델이고 무엇이 그 위에 얹힌 계층인가'를 구분하지 못하면 벤치마크는 같은 엔진을 여러 이름으로 중복 집계하게 된다.

한국의 실무자에게 이 사례가 주는 교훈은 분명하다. 분류·라우팅용 의사결정 API를 도입할 때는 벤치마크 순위 숫자 하나에 기대기보다, 그 뒤의 실제 모델과 버전, 호출 방식(배칭·캐스케이드 여부), 그리고 자신의 예상 사용량에 맞춘 건당 실단가를 각각 따로 확인해야 한다. 특히 정액제의 '최대 사용 시 단가'와 실제 트래픽에서의 단가는 크게 벌어질 수 있고, 벤더가 공개하지 않는 원가 구조는 요금 정책이 언제든 바뀔 수 있다는 신호이기도 하다. 겉으로 드러난 1위보다, 그 1위가 무엇을 측정한 결과인지를 읽어내는 눈이 결국 더 중요하다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://benchmarkheaven.com/jev-models
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...