1차 공개일 · 8월 18일1차 강의가 모두 공개됩니다
TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 29 READS

Qwen3.8-27B 공개: FP8 양자화와 100만 토큰이 여는 실무 배치

Qwen3.8-27B 공개: FP8 양자화와 100만 토큰이 여는 실무 배치
SOURCE IMAGE · HACKER NEWS

Qwen 팀이 오픈 모델 계열의 최신 세대인 Qwen3.8을 내놓으면서, 그중에서도 27B 규모의 dense 모델인 Qwen3.8-27B가 실무자 관점에서 눈여겨볼 만한 후보로 떠올랐다. Qwen 측은 이 모델을 앞선 Qwen3.5와 Qwen3.6 계열의 폭넓은 채택 위에 서 있는, 오픈 모델 가운데 가장 강력한 세대로 소개한다. 구조적으로는 Qwen3.5의 아키텍처를 토대로 삼되 코딩, 전문 업무, 리서치, 그리고 여러 단계를 오래 이어가는 에이전트형 작업에서 개선을 겪었다는 설명이다. 특히 27B라는 비교적 작은 크기는 배치 부담을 낮추면서도 이미지와 영상을 이해하는 네이티브 비전-언어 모델이라는 점, 그리고 사고 과정을 유연하게 제어할 수 있다는 점을 함께 갖췄다는 데 의미가 있다.

FP8 양자화와 배치 호환성

이번에 공개된 저장소는 사후 학습을 마친 모델의 FP8 양자화 가중치와 설정 파일을 Hugging Face Transformers 형식으로 담고 있다. 양자화 방식은 블록 크기 128의 세분화된 FP8 방식이며, 원본 모델과 거의 동일한 성능 지표를 낸다고 명시돼 있다. 산출물은 Transformers는 물론 vLLM, SGLang, TokenSpeed 같은 서빙 엔진과 호환된다. 다시 말해 메모리 예산이 빠듯한 환경에서 정밀도를 크게 희생하지 않고 모델을 올릴 수 있는 선택지가 기본 제공되는 셈이다. 다만 프레임워크마다 추론 효율과 처리량 편차가 크다는 점, 그리고 프로덕션이나 고처리량 상황에서는 전용 서빙 엔진을 권장한다는 안내는 실제 도입 전 벤치마크가 필요하다는 신호이기도 하다.

사고 모드와 추론 노력 조절

Qwen3.8은 기본적으로 사고 모드로 동작해, 최종 응답에 앞서 로 감싼 사고 내용을 먼저 생성한다. 여기에 reasoning_effort 파라미터를 공식 지원해 추론 깊이와 그에 따른 비용을 조절할 수 있다. 눈여겨볼 대목은 멀티턴 에이전트 작업에서 추론 노력을 낮춘다고 해서 전체 완료 시간이 반드시 줄지는 않는다는 경고다. 턴별 응답은 빨라질 수 있으나 분석이 부실해지면 실패와 재시도가 늘어 총 지연과 토큰 소비가 오히려 커질 수 있다는 것이다. 비용 절감을 위해 무작정 추론을 줄이는 접근이 역효과를 낼 수 있음을 실무에서 염두에 둘 필요가 있다.

또한 모든 워크로드에서 preserve_thinking이 기본 활성화돼, 대화 전체의 사고 블록을 유지하는 이른바 보존형 사고가 적용된다. 과거 메시지의 추론 흔적을 이어감으로써 에이전트 시나리오에서 결정의 일관성을 지키고 중복 추론을 줄이며, KV 캐시 활용도를 높여 사고·비사고 모드 모두에서 추론 효율을 개선한다는 설명이다. 최신 사용자 메시지의 사고만 남기고 싶다면 이 값을 끌 수 있다. Qwen Cloud API를 쓸 때는 enable_thinking이나 preserve_thinking을 chat_template_kwargs로 감싸지 않고 직접 지정해야 한다는 사용상의 차이도 명시돼 있다.

컨텍스트 길이와 장문·영상 처리

Qwen3.8-27B는 262,144 토큰의 컨텍스트를 네이티브로 지원한다. 입력과 출력 총합이 이 한계를 넘는 장기 과제에서는 YaRN 같은 RoPE 스케일링 기법을 권장하는데, vLLM·SGLang·TokenSpeed 등이 이를 지원한다. 다만 이들 프레임워크가 구현한 정적 YaRN은 입력 길이와 무관하게 스케일링 계수가 고정돼 짧은 텍스트 성능에 영향을 줄 수 있으므로, 장문 처리가 필요할 때만 설정을 바꾸고 계수도 상황에 맞게 조정하라는 조언이 붙는다. 예컨대 통상 컨텍스트가 524,288 토큰이라면 factor를 2.0으로 두는 편이 낫다. 시간 단위 장편 영상 이해가 목표라면 video_preprocessor 설정의 longest_edge 값을 높여 더 높은 프레임 샘플링을 허용하는 방법도 안내된다.

샘플링 측면에서는 반복을 억제하기 위해 presence_penalty를 0에서 2 사이로 조정할 수 있으나, 값을 높이면 간혹 언어 혼용이나 성능 저하가 생길 수 있다는 절충이 존재한다. 에이전트 작업에서는 상세하고 완결적인 응답을 위해 충분한 출력 길이를 확보하라는 권고도 함께 제시된다. 한편 100만 토큰 컨텍스트를 기본값으로 하고 공식 내장 도구를 갖춘 호스팅 버전은 Qwen Cloud를 통해 곧 제공될 예정이라고 밝혀, 대용량 컨텍스트는 현재 셀프 호스팅과 관리형 서비스 사이에 차이가 있는 상태다.

종합하면 Qwen3.8-27B는 FP8 배치 편의성, 사고 제어, 넓은 컨텍스트, 영상 이해를 하나의 컴팩트 dense 모델에 묶었다는 점에서 실무 도입을 고려할 만하다. 다만 공개 자료에는 코딩·에이전트 성능 향상이 정성적 표현으로만 기술돼 있고 구체적 벤치마크 수치나 비교 대상이 제시되지 않았으며, 100만 토큰 호스팅과 내장 도구는 아직 출시 전이라는 점은 분명한 한계다. 자사 환경에서 프레임워크별 처리량과 정확도를 직접 측정한 뒤 판단하는 절차가 여전히 필요하다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://huggingface.co/Qwen/Qwen3.8-27B-FP8
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...