
모든 걸 GPT급 모델에 물어봐야 할까요?
LLM으로 서비스를 만들다 보면 이런 순간이 꼭 와요. 사용자 입력이 스팸인지 아닌지, 이 문의를 어느 팀에 넘길지, 이 요청에 도구 호출이 필요한지 같은 간단한 판단 하나 때문에 거대한 API를 호출하게 되는 순간이요. 응답은 1~2초씩 걸리고, 트래픽이 늘면 비용도 금방 불어나요.
이번에 공개된 오픈소스 프로젝트 Jeff는 이 문제를 정면으로 다뤄요. 핵심은 세 가지예요. 파라미터 0.8B(8억 개)짜리 작은 모델이고, 판단(decision) 작업에 특화돼 있고, 한 번 추론하는 데 약 30ms 정도밖에 안 걸린다는 거예요. 그리고 이 모델들을 거대한 데이터센터가 아니라 집에 있는 장비로 학습했다는 점도 강조하고 있어요. 또 Jev라는 기존 규격과 호환되게 만들어서, 그 규격을 쓰던 곳에 그대로 끼워 넣을 수 있도록 설계했다고 해요. Jev의 정확한 스펙과 연동 방법은 레포 문서를 직접 확인해 보시는 걸 추천해요.
판단 모델이 뭐냐면
우리가 흔히 쓰는 챗봇은 생성 모델이에요. 긴 글을 써내고 대화를 이어가는 게 주 목적이죠. 반면 판단 모델은 입력을 보고 정해진 선택지 중 하나를 고르는 데 집중해요. 예를 들면 이런 것들이에요.
- 이 메시지는 환불 요청인가, 배송 문의인가, 불만인가?
- 이 에이전트의 다음 행동은 검색인가, 답변인가, 사람에게 넘기기인가?
- 이 콘텐츠는 정책 위반인가?
- 고객 문의 자동 분류, 스팸이나 욕설 필터링처럼 라벨이 명확한 작업
- AI 에이전트에서 다음 행동을 고르는 라우팅 단계
- 개인정보 때문에 외부 API를 쓰기 어려운 금융, 의료, 공공 분야
비유하자면 생성 모델은 에세이를 쓰는 작가고, 판단 모델은 서류를 보고 도장을 찍는 심사관이에요. 심사관은 글솜씨가 필요 없고, 빠르고 일관되게 판단하는 게 제일 중요해요. 그래서 모델이 작아도 되고, 오히려 작아야 유리한 경우가 많아요.
왜 0.8B이고 왜 30ms가 중요할까요
0.8B는 요즘 기준으로 아주 작은 모델이에요. 16비트로 저장해도 1.6GB 정도라서 일반 게이밍 GPU는 물론이고, 양자화하면 CPU에서도 충분히 돌아가요. 이 크기에서 특정 작업만 집중적으로 학습시키면 그 작업에 한해서는 범용 거대 모델에 근접한 성능을 내는 경우가 많다는 게 여러 연구에서 확인된 사실이에요.
30ms라는 숫자도 의미가 커요. 사람이 지연을 체감하기 시작하는 게 대략 100ms 전후거든요. 30ms면 요청 처리 파이프라인 중간에 판단 단계를 하나 끼워 넣어도 사용자는 거의 못 느껴요. 반면 외부 LLM API를 한 번 부르면 네트워크 왕복만으로 수백 ms가 기본이에요. 에이전트가 한 작업에 판단을 수십 번 반복한다고 생각하면 이 차이는 몇 초에서 몇십 초로 벌어져요.
집에서 학습한다는 것의 의미
이 프로젝트가 흥미로운 또 다른 이유는 학습 장벽이 낮다는 점이에요. 작은 모델을 특정 작업에 맞춰 파인튜닝하는 건 이제 소비자용 GPU 한두 장으로도 충분히 가능해졌어요. 보통은 큰 모델로 정답 라벨을 대량으로 만들고, 그걸로 작은 모델을 가르치는 증류(distillation) 방식을 많이 써요. 선생님(큰 모델)의 판단을 학생(작은 모델)이 따라 배우는 거죠.
이 방식이면 회사 내부 데이터로 우리 도메인에 딱 맞는 판단 모델을 직접 만들 수 있어요. 데이터가 외부로 나가지 않으니 보안 측면에서도 유리하고요.
업계 흐름에서 보면
최근 흐름은 확실히 작고 특화된 모델로 가고 있어요. 구글의 Gemma 소형 버전, 마이크로소프트의 Phi 시리즈, Qwen의 1B 미만 모델들이 다 이쪽이에요. 또 LLM 라우터처럼 요청을 보고 어떤 모델로 보낼지 결정하는 가벼운 모델, 안전성 판단 전용인 Llama Guard 같은 분류기도 같은 맥락이에요.
Jeff는 여기서 한 발 더 나아가 판단이라는 역할 자체를 표준화된 인터페이스로 묶으려는 시도로 볼 수 있어요. 호환 규격을 맞춰두면 판단 모델을 부품처럼 갈아 끼울 수 있거든요. 오늘은 큰 API로 판단하다가 내일은 로컬 0.8B 모델로 바꾸는 게 쉬워지는 거죠.
한국 개발자에게 주는 시사점
LLM 비용이나 지연 때문에 고민하는 팀이라면 바로 검토해볼 만해요. 특히 이런 경우에 잘 맞아요.
마무리
한 줄 정리: 모든 판단을 거대 모델에 맡길 필요는 없어요. 잘 훈련된 0.8B 모델 하나가 30ms 만에 같은 일을 할 수 있어요.
여러분 서비스에서 지금 거대 LLM이 하고 있는 일 중에 작은 판단 모델로 대체할 수 있는 건 뭐가 있을까요? 직접 소형 모델을 파인튜닝해 보신 분들은 어떤 경험이었는지도 궁금해요.
🔗 출처: Hacker News