TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 21 READS

클라우드플레어가 공개한 결정 모델 'Clef', 분류 작업은 LLM과 어떻게 달라지나

클라우드플레어가 공개한 결정 모델 'Clef', 분류 작업은 LLM과 어떻게 달라지나
SOURCE IMAGE · HACKER NEWS

최근 몇 주 사이 AI 업계에서는 '결정 모델(decision model)'이라는 개념이 주목받고 있다. 타입세이프 AI(Typesafe AI)의 Jev System One이 불을 지핀 이 흐름에 클라우드플레어가 합류했다. 클라우드플레어는 자사가 직접 학습시킨 결정 모델 Clef와 경량 버전 Clef-flash를 발표하고, 이를 Workers AI 인프라에서 호스팅한다고 밝혔다. 두 모델은 아파치 2.0 라이선스로 허깅페이스에 완전히 공개돼 로컬에서도 돌려볼 수 있으며, Jev API와 호환되도록 설계됐다.

결정 모델이란 무엇인가

결정 모델은 분류기(classifier)의 연장선에 있지만, 입력을 받아 정해진 스키마에 맞는 구조화된 출력을 빠르고 일관되게 내놓는다는 점이 핵심이다. 예를 들어 고객 지원 메시지를 넣고 '긴급한가, 어느 팀이 처리해야 하는가'를 물으면, 모델은 확률이 붙은 타입 지정 답변을 돌려준다. 코드는 이 값을 받아 티켓을 라우팅하거나 에스컬레이션을 걸거나, 필요하면 사람에게 넘긴다. 분류 범주가 바뀔 때마다 재학습할 필요 없이 다양한 입력에 대응한다는 점에서, 개방형으로 추론하고 텍스트·도구 호출을 생성하지만 비결정적인 대규모 언어모델(LLM)과는 성격이 다르다. 쉽게 말해 LLM이 '무엇이든 말할 수 있는' 모델이라면, 결정 모델은 '정해진 선택지 중에서 고르는' 데 특화돼 있다.

클라우드플레어는 내부 위협 인텔리전스 팀에서 Clef를 도메인 분류에 적용해 봤다고 한다. 특정 도메인을 Browser Run과 함께 Clef에 넘기면, 예컨대 '패션 사이트일 확률 95%, 이커머스 85%, 피싱 1% 미만' 식으로 여러 범주를 매긴다. 이 작업에 Clef는 웹사이트를 가져와 렌더링하고 분류하기까지 2.2초가 걸린 반면, 가장 빠른 범용 LLM인 gpt-oss-120b는 같은 워크플로에서 4.7초가 걸렸고 분류 결과도 두 개만 반환했다고 설명한다. 악성 여부를 빠르게 가려내야 하는 작업에서 지연 시간이 절반으로 줄어드는 것은 실무적으로 의미가 작지 않다.

Clef의 차별점과 아키텍처

결정 모델 시장이 포화되어 가는 가운데 Clef가 내세우는 차별점은 세 가지다. 먼저 비전 인코더를 탑재해 이미지를 받아 시각 콘텐츠를 분류할 수 있는데, 현재 텍스트 분류만 지원하는 Jev와 구분되는 지점이다. 둘째로 64k 컨텍스트 윈도를 제공해 Jev의 32k보다 더 많은 입력 상태를 밀어 넣을 수 있다. 셋째로 Jev Decision Index 기준 벤치마크에서 경쟁력 있는 점수를 받았으며, 클라우드플레어는 Clef가 해당 지수에서 선두라고 주장한다. 다만 이 수치는 모두 클라우드플레어가 직접 수행하고 공개한 벤치마크라는 점은 감안해 읽을 필요가 있다.

기술적으로 Clef는 클라우드플레어가 앞서 실험한 DiffusionGemma 기반 접근과는 다른 길을 택했다. 백본으로 Qwen을 쓰되 결정 모델 용도에 맞게 후처리 학습을 거쳤다. 추론 시에는 Qwen으로 프리필(prefill)만 한 번 수행한 뒤, 유효한 스키마 선택지들을 병렬로 점수화한다. 토큰을 하나씩 생성하는 자기회귀 방식이 아니라 중간 텍스트 생성이 없는 비자기회귀 구조이기 때문에, 일반 LLM보다 빠르다는 것이 속도 우위의 근거다. 내부적으로는 옵션별 증거 라우팅, 필드 간 교차 어텐션, 스키마에 묶인 점수화를 결합한 2단계 어텐션 라우팅을 사용한다. Clef는 Qwen3.8-27B를, Clef-flash는 Qwen3.5-9B를 동결한 상태에서 rank-256 저랭크 어댑터와 라우팅 헤드를 함께 최적화했고, 확률 보정을 위해 Brier 손실과 자체 개발한 RLCD(보정된 결정을 위한 강화학습) 기법을 적용했다고 밝혔다.

강화학습 기반 파인튜닝 플랫폼

함께 공개된 것이 Clef를 고객 데이터로 미세 조정할 수 있는 강화학습(RL) 제품이다. 클라우드플레어는 트러스트앤세이프티 제출물 평가, 지원 요청 분류, 봇 제품에서 좋은 크롤러와 나쁜 크롤러를 구분하는 등 내부 사례가 파인튜닝을 필요로 했다고 설명한다. 파인튜닝은 범용 성능을 일부 포기하는 대신 특정 도메인의 정확도를 높이는 거래이며, 15년 이상 쌓인 네트워크 데이터와 라벨링된 결정을 보유한 클라우드플레어 입장에서는 승산이 있는 영역이다. 이 플랫폼은 AI 트래픽을 수집하는 AI Gateway, RL 샌드박스용 컨테이너, 리플리케이트 인수 이후 진행해 온 Workers AI의 'Bring Your Own Model(Cog)' 작업 같은 기존 플랫폼 구성요소를 엮어 만든다.

실무자 관점에서 Clef의 가치는 명확하다. 엣지 GPU에서 호스팅돼 네트워크 지연이 낮고, 엄격한 타입 출력을 내며, Jev API와 호환되어 교체가 쉽다. 정밀도가 필요한 작업에는 Clef를, 지연에 민감한 결정에는 Clef-flash를 쓰고, 파인튜닝 제품을 쓰지 않는 한 요청·응답을 저장하거나 학습에 사용하지 않는다는 점은 도입 검토 시 긍정적인 조건이다. 다만 파인튜닝은 초기에 클라우드플레어의 FDE 팀과 함께하는 핸즈온 서비스 형태이고 셀프서브 플랫폼은 아직 구축 단계라는 점, 그리고 성능 비교가 자체 벤치마크에 의존한다는 점은 실제 워크로드에 적용하기 전에 직접 검증해 볼 필요가 있음을 시사한다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://blog.cloudflare.com/clef-decision-models/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...