TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 21 READS

리플렉션의 오픈웨이트 모델 '빔'(Beam): 추론 효율에 승부를 건 5010억 파라미터 MoE

리플렉션의 오픈웨이트 모델 '빔'(Beam): 추론 효율에 승부를 건 5010억 파라미터 MoE
SOURCE IMAGE · HACKER NEWS

리플렉션(Reflection)이 자사 첫 오픈웨이트 모델 '빔(Beam)'을 공개하겠다고 밝혔다. 빔은 총 5010억 개 파라미터 가운데 추론 시 230억 개만 활성화되는 희소 전문가 혼합(sparse Mixture-of-Experts, MoE) 구조로, 코딩과 추론, 그리고 에이전트성 작업을 겨냥해 설계됐다. 현재는 최종 레드티밍과 평가 단계에 있으며, 가중치와 기술 보고서, 모델 카드, 개발자 자료는 이달 안에 공개될 예정이다. 사전 접근 신청도 함께 받고 있다.

오픈웨이트 모델이 쏟아지는 상황에서 빔의 차별점은 '규모'보다 '토큰당 효율'에 있다. 리플렉션은 빔이 서구권 오픈웨이트 모델의 최전선을 끌어올렸다고 주장하며, 코딩·에이전트 과제에서 더 큰 오픈 모델인 GLM 5.2와 경쟁하고 Qwen 3.8-Max에 근접한다고 설명한다. Kimi K3 같은 프런티어 오픈 모델이 순수 성능에서 여전히 앞서지만, 빔의 강점은 추론 시점의 연산 효율이라는 것이다. 회사 측 설명에 따르면 고난도 추론 벤치마크에서 GLM 5.2에 필적하는 점수를 내면서도 추론 연산량은 3~4배 적게 쓰며, 2조 파라미터급 모델과 비교하면 격차가 더 벌어진다.

연산을 능력으로 바꾸는 축, 강화학습

빔의 성능은 사전학습과 강화학습(RL)이라는 두 축에서 나온다. 사전학습은 웹과 라이선스를 확보한 독점 데이터에서 추린 23조 8000억 개의 고품질 토큰으로 이뤄졌다. 주목할 대목은 강화학습을 핵심 스케일링 축으로 삼았다는 점이다. 리플렉션은 1만 500개의 엔비디아 GB300 GPU를 4주간 투입해 최대 256K 토큰 길이의 롤아웃을 1억 회 이상 생성했고, 학습과 채점에 약 13억 개의 샌드박스를 사용했다. 평가 전반에서 RL 연산을 늘릴수록 성능이 계속 향상됐으며 아직 포화 조짐은 없었다고 한다. 회사는 이를 오픈 랩이 수행한 가장 큰 규모의 RL 실행 중 하나로 보고 있다.

이 규모의 RL은 기술적으로 간단하지 않다. 빔은 비동기 정책 경사(asynchronous policy gradient) 방식으로 학습됐는데, 롤아웃이 길어질수록 초기 토큰이 현재 정책 대비 오래된(stale) 상태가 되고 학습 엔진과 추론 엔진 사이의 수치 불일치가 겹쳐 불안정성이 커진다. 리플렉션은 하루 이상 전에 생성된 상호작용에서 배우더라도 안정적으로 학습이 유지되는 새 알고리즘을 개발했다고 밝혔다. 운영 측면에서도 평균 11만 개의 동시 롤아웃을 유지했고, 새 가중치가 추론 클러스터에 도달하는 데 중앙값 약 12초가 걸렸으며, 71건의 추론 장애를 학습 중단 없이 처리했다고 설명한다.

길이 페널티와 추론 노력 조절

효율을 끌어올린 장치 중 하나는 조절 가능한 길이 페널티다. 성공한 풀이에는 보상을 주되 불필요한 토큰은 억제하는 방식이다. RL 초기에는 완성 길이가 줄어드는데도 성능이 올랐고, 이후 에이전트 능력이 강해지면서 길이가 다시 늘었지만 그 추가 토큰이 성능 향상으로 이어졌다. 실무자 입장에서 더 유용한 것은 '추론 노력(reasoning effort)' 파라미터다. 낮게 설정하면 짧은 응답을, 높게 설정하면 더 긴 추론을 허용해, 작업 난이도와 연산 예산에 맞춰 품질과 비용의 균형을 직접 맞출 수 있다.

흥미로운 관찰은 능력의 전이(transfer)다. 추론·소프트웨어 엔지니어링·터미널 작업을 학습하는 단계에서, 학습 혼합에 포함되지 않은 웹 브라우징 능력까지 꾸준히 향상됐다. 웹 접근 권한을 주자 빔은 스스로 다른 대형 언어 모델을 검색·질의하거나 OCR API로 문서를 읽는 방식을 익혔다고 한다. 리플렉션은 뉴욕 지하철 실시간 대시보드 구축, 소형 Gemma-4 모델의 Text2SQL 파인튜닝 노트북 작성 같은 사례를 공개했다. 다만 빔은 텍스트 전용 모델로, 다른 모달리티 정보는 텍스트로 표현된 경우에만 다룰 수 있다.

데이터 품질이라는 병목

프런티어급 RL에는 충분히 어렵고 품질 높은 과제가 대량으로 필요하다. 리플렉션은 주로 합성 데이터 파이프라인을 통해, 벤더 데이터와 오픈소스를 보태 약 100만 개의 환경을 구축했다. 핵심은 반복적 선별이었다. 모델이 매번 풀거나 아예 못 푸는 과제를 걸러 난이도를 맞추고, 명세가 부실하거나 추측·해킹이 가능한 '깨진' 과제를 제거한 뒤, 실제 RL로 돌려 보며 다음 선별에 반영했다. 데이터 품질에서 타협하면 능력이 정체됐고, 체계적인 품질 개선이 포화 없는 성능 향상을 지탱했다는 설명이다.

정리하면 빔의 메시지는 분명하다. 절대 성능의 정점을 노리기보다, 토큰당 더 많은 지능을 더 낮은 비용으로 제공하는 '일하는 말(workhorse)'을 지향한다는 것이다. 다만 아직 가중치가 공개되지 않았고 성능 수치 상당수가 자체 벤치마크에 기반한다는 점, 비교 대상으로 든 모델명 일부가 일반에 널리 알려진 명칭과 달라 외부 검증이 필요하다는 점은 감안해야 한다. 기업에서 코딩·에이전트 워크로드에 오픈 모델 도입을 검토 중이라면, 이달 공개될 기술 보고서와 실제 추론 비용 측정치를 확인한 뒤 판단하는 편이 안전하다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://reflection.ai/blog/introducing-beam
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...