TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 25 READS

토큰 40% 줄인 'Ember-1': 추론 모델의 낭비를 학습으로 걷어내다

토큰 40% 줄인 'Ember-1': 추론 모델의 낭비를 학습으로 걷어내다
SOURCE IMAGE · HACKER NEWS

파이어웍스(Fireworks) 리서치가 새 특화 모델 'Ember-1'을 공개했다. 핵심 주장은 단순하다. 기반 모델인 Kimi K3와 사실상 같은 품질을 유지하면서 토큰은 40%가량 덜 쓴다는 것이다. 파이어웍스는 이 모델을 자체 서버리스(Serverless) 환경에서 리서치 프리뷰 형태로 오늘부터 제공한다고 밝혔다. 개발자에게는 2주간 서버리스 접근을 열어주고, 커뮤니티 수요에 따라 정식 서비스로 전환하는 방식이다.

왜 '적게 생각하기'로는 안 됐나

이 프로젝트의 출발점은 비용 문제였다. Kimi K3 같은 추론(reasoning) 모델은 생성하는 토큰의 대부분, 때로는 90% 이상을 정작 답변이 아니라 내부 추론에 쓴다. 단일 요청에서도 부담이지만, 여러 턴이 오가는 에이전트형 작업에서는 상황이 훨씬 나빠진다. 매 턴마다 이전의 모든 추론을 모델에 다시 넣어야 하므로, 문맥은 턴 수에 대해 대략 제곱으로 늘어난다. 초기 턴에서 나온 긴 추론이 이후 호출마다 다시 읽히고 다시 과금되는 구조다.

파이어웍스에 따르면 사용자들은 K3의 코딩 능력을 더 낮은 비용에 쓰고 싶어 했다. 그런데 단순히 모델의 '추론 강도(reasoning effort)' 설정을 낮추는 방식은 답이 아니었다. 강도를 내리면 품질이 지나치게 떨어졌기 때문이다. 결국 품질은 지키면서 토큰만 줄이려면, 모델이 스스로 더 효율적으로 추론하도록 '학습'시키는 수밖에 없다는 결론에 도달했다. 이것이 Ember-1을 별도로 훈련한 이유다.

낭비는 걷어내되 자기교정은 남긴다

흥미로운 지점은 파이어웍스가 K3의 추론을 무조건 잘라내지 않았다는 데 있다. K3가 뱉는 추론은 과제가 요구하는 것보다 훨씬 길고, 그 초과분은 답을 건드리지 않고도 제거할 수 있다는 게 실험 결과였다. 다만 추론 중 일부는 가정을 다시 점검하거나 피드백에 반응하고 앞선 결정으로 결과를 거슬러 추적하는 자기성찰(self-reflection)이며, 이는 모델이 실수에서 회복하는 데 도움이 된다. 목표는 이 능력은 보존하면서 불필요한 추론과 비생산적인 반복 루프만 줄이는 것이었다.

이를 위해 파이어웍스는 수학, 코딩, 지시 따르기, 대화, 검색, 도구 사용, 소프트웨어 엔지니어링에 이르는 폭넓은 과제 묶음으로 훈련했다. 단발성 문제뿐 아니라 관찰과 결과에 적응해야 하는 긴 상호작용까지 포함했다. 이 과정에서 50번이 넘는 훈련 실험과 200회 이상의 평가를 돌렸고, 정확도를 잃지 않으면서 추론을 짧게 만드는 새 훈련 알고리즘도 개발했다고 한다. GPU를 직접 준비·관리할 필요가 없는 서버리스 트레이닝 덕분에 아이디어가 떠오르는 즉시 실험을 띄우고 실행한 만큼만 지불하며 연구에서 출시까지 시간과 비용을 크게 줄일 수 있었다는 설명이다.

벤치마크와 실제 트래픽에서의 결과

공개 벤치마크와 라이브 A/B 테스트 결과는 이 방향을 뒷받침한다. 7개 벤치마크와 두 고객사의 프로덕션 트래픽에서, K3의 추론은 정확도 손실 없이 35~50% 짧아질 수 있었다. 학습된 습성은 실패하는 시도에서도 토큰 사용을 절제하게 만들어, 길고 소득 없는 추론을 줄이는 효과도 나타났다. 파이어웍스는 K3의 공개 API 가격(비캐시 입력 100만 토큰당 3달러, 캐시 입력 0.30달러, 출력 15달러)을 기준으로 비용을 계산했을 때, 표본이 50개를 넘는 모든 벤치마크에서 Ember-1이 파레토 프론티어(비용 대비 품질의 최적 경계) 위 또는 근처에 위치했다고 밝혔다. 최고 강도의 K3에 준하는 품질을 훨씬 낮은 비용에 내고, 저강도 K3는 완전히 압도했다는 것이다.

특히 의사 검증을 거친 임상 벤치마크 'Bedside Bench'(10개 전문 분야 500개 임상 사례)에서 Ember-1은 GPT-5.6 Sol, GPT-6 Astra, Claude Opus 5 같은 공개·비공개 모델을 아우르는 새 파레토 프론티어를 과제당 비용 기준으로 세웠다고 회사는 주장한다. 두 고객사의 실제 코딩 워크로드 A/B 테스트에서는 과제당 토큰을 약 35% 줄이면서도 완료율과 성공 점수, 실패율 같은 후속 지표가 대부분 유지되거나 개선됐고, 한 고객사는 테스트 이후 Ember-1을 실제 프로덕션에 투입해 기반 모델을 완전히 대체하는 방향으로 확대하고 있다고 한다. 파이어웍스는 자사 내부 코딩 트래픽에도 먼저 적용했는데, 개발자들이 모델이 바뀐 사실조차 눈치채지 못한 채 토큰만 덜 쓴 점을 가장 강한 신호로 꼽았다.

실무자가 눈여겨볼 지점과 한계

실무 관점에서 Ember-1의 메시지는 명확하다. K3를 가장 저렴하게 돌리는 방법은 이제 '덜 생각하게' 설정을 낮추는 것이 아니라, 효율적으로 생각하도록 학습된 모델을 쓰는 것이라는 주장이다. 추론 토큰이 비용의 대부분을 차지하는 에이전트형 코딩 워크로드라면, 같은 품질을 대략 절반의 토큰 비용으로 낼 수 있다는 계산이 선다. 여기에 파이어웍스는 기업이 자사 데이터로 Ember-1을 자기 워크로드에 맞춰 재훈련할 수 있는 훈련 지원도 함께 내놨다.

다만 아직 검증되지 않은 부분도 분명하다. 제시된 성능·비용 수치는 대부분 파이어웍스 자체 측정과 두 고객사 사례에 기반하며, 비교에 동원된 일부 모델명은 외부에서 독립적으로 확인하기 어렵다. 품질 유지를 뒷받침하는 지표도 '대부분 유지되거나 개선'이라는 서술이어서, 특정 워크로드에서 어떤 지표가 어느 정도 움직였는지는 공개된 범위 밖이다. 리서치 프리뷰라는 성격상 2주 접근 이후의 지속성도 커뮤니티 수요에 달려 있다. 결국 자신의 파이프라인에서 직접 A/B로 토큰 절감과 품질을 재보는 것이, 이 모델을 도입 판단하는 가장 확실한 방법이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://fireworks.ai/blog/ember-1
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...