TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 31 READS

'결정 모델' Jev, LLM 심판도 전통 분류기도 넘지 못했다

'결정 모델' Jev, LLM 심판도 전통 분류기도 넘지 못했다
SOURCE IMAGE · HACKER NEWS

엔터프라이즈 생성형 AI가 실제 서비스 단계로 넘어가면서 플랫폼 엔지니어들은 한 가지 숙제를 안게 됐다. 유연하지만 비싼 'LLM-as-a-judge(LLM 심판)' 방식의 가드레일과, 안정적이고 이식성이 좋지만 전용 학습 데이터가 필요한 전통적 분류기 사이에서 균형을 잡는 일이다. 최근 TypeSafe AI가 공개한 Jev와 'System One' 계열이 대표하는 이른바 '결정 모델(decision model)'은 이 둘 사이의 절충안을 표방한다. 텍스트를 생성하는 대신, 주어진 상태와 질문 목록에 대해 고정된 '결정'을 내놓는 방식이다.

이 접근의 장점은 세 가지로 요약된다. 첫째, 스키마와 타입이 보장된다. 예컨대 확률을 물으면 항상 0과 1 사이 값이 돌아오므로 애플리케이션에 안전하게 끼워 넣을 수 있다. 둘째, 토큰을 생성하지 않으므로 LLM보다 빠르고 저렴하다. 셋째, 제로샷(zero-shot)이어서 별도 학습 없이 새로운 문제에도 결정을 내릴 수 있다. 라벨 데이터로 미세조정이 필요한 고전적 분류기에 비해 진입 장벽이 낮다는 뜻이다.

정말 새로운 기술인가

그러나 이 방식이 주장만큼 새로운지는 따져볼 만하다. '제로샷 텍스트 분류기'라는 이름으로 수년간 존재해 온 기술이기 때문이다. 2019년 공개된 메타의 BART-large-mnli가 대표적이다. Laya를 만든 Nandakishor Mukkunnoth는 2026년 9월 글에서 Jev의 기반 기술이 그다지 새롭지 않다고 지적했고, vLLM이 DiffusionGemma로 Jev와 유사한 결정 모델을 제공하는 등 오픈소스 대안이 빠르게 등장한 점도 이를 뒷받침한다.

Red Hat AI Safety 팀은 이 질문들에 답하기 위해 4개 방법론에 걸쳐 9개의 가드레일 후보를 구성했다. 각 방법론마다 프롬프트 인젝션용과 콘텐츠 안전/유해성용 가드레일을 만들었다. 사전학습 분류기로는 Red Hat OpenShift AI 3.6에 기본 탑재될 deberta-v3-base-prompt-injection-v2(인젝션)와 granite-guardian-hap-125m(안전)을 썼고, 여기에 BART-large-mnli, Shieldstral, Qwen3.6-35B, Nemotron-3.5, Laya, Jev, DiffusionGemma를 포함했다. 평가는 EvalHub의 NeMo Guardrails 벤치마크 라이브러리로, 라벨이 붙은 위험·안전 프롬프트를 흘려보내 차단/허용 판정을 정답과 비교하는 방식으로 진행됐다.

벤치마크가 드러낸 것

결과는 분명했다. 가장 성능이 낮은 쪽은 예상대로 BART-large-mnli였다. 클래스 라벨 안에 담을 수 있는 위험 정의 정보가 너무 적은 데다, 프롬프트 인젝션 같은 보안 개념이 2019년 당시 학습 말뭉치에는 거의 존재하지 않았다는 개념 변화(concept drift)도 작용했다. 반면 Jev 계열의 최신 제로샷 분류기는 전용 사전학습 모델과 겨룰 만했다. 프롬프트 인젝션에서는 deberta-v3 분류기가 지연시간 1위에 정확도도 1위와 0.20%포인트 차이에 그쳐, 데이터가 풍부하고 위험이 잘 정의된 영역에서는 사전학습 분류기가 여전히 강력함을 보여줬다. 한편 콘텐츠 안전에서는 DiffusionGemma와 Jev가 granite-guardian-hap-125m을 크게 앞섰는데, 이는 결정 모델 패러다임의 가능성인 동시에 더 나은 소형 예측 모델이 필요하다는 신호이기도 하다.

LLM 심판 쪽은 아키텍처별 편차가 컸다. Shieldstral은 Mistral 공식 벤치마크와 달리 의외로 부진했고, 동일한 위험 정의를 쓰면 정확도가 약 10%포인트 떨어져 여러 차례 프롬프트 엔지니어링이 필요했다. 4B 규모의 Nemotron-3.5는 Jev와 정확도 차이가 1.13%포인트에 불과하면서 중앙값 지연시간은 훨씬 낮았다. Qwen3.6-35B는 가장 크고 비싼 모델답게 두 벤치마크에서 고르게 좋았으며, vLLM과 OpenShift AI에 올렸을 때 지연시간이 Jev보다 전반적으로 나았고 프롬프트 인젝션 1위를 차지했다.

주목할 대목은 프롬프트 민감성이다. Laya는 콘텐츠 안전에서 상위권보다 20%포인트가량 뒤처진 이상치를 보였는데, 전용 정책을 반복적으로 다듬자 성능이 크게 올라갔다. 그런데 Laya에 최적화한 그 정책을 Jev에 그대로 적용하자 비슷한 개선이 나타나지 않았다. 한 모델에 잘 맞는 제로샷 정책이 다른 모델에는 통하지 않는다는 뜻이다. 역설적으로 이는 인프라 요구가 적은 Laya를 잘 튜닝하면 저비용 제로샷 판정기로 쓸 수 있다는 가능성도 보여준다.

실무적 함의

결론적으로 Jev 같은 결정 모델은 속도나 정확도에서 LLM 심판, 사전학습 예측 모델, 오픈소스 결정 모델을 안정적으로 능가하지 못했다. 라벨 데이터가 풍부한 가드레일 영역에서는 밀리초 단위 지연에 전용 GPU도 필요 없는 경량 예측 모델이 여전히 최상위 선택지이며, OpenShift AI 3.6이 이들을 기본값으로 삼은 이유도 여기에 있다. 다만 사전학습 모델을 구할 수 없거나 부족한 특정 상황에서는 제로샷 분류기가 LLM 심판을 대체할 만한 선택지가 된다. 실무자 입장에서 더 중요한 교훈은 따로 있다. 모든 문제를 LLM으로 풀려던 흐름에서 벗어나, 문제의 규모와 범위에 맞는 '적합한 도구'를 고르는 실용주의로 회귀하는 신호라는 점이다. 참고로 이번 실험은 영어 기반으로 수행됐으며, 한국어를 포함한 다른 언어 환경에서는 결과가 달라질 수 있어 추가 검증이 필요하다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://developers.redhat.com/articles/2026/10/02/benchmarki...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...