
무슨 일이 있었냐면요
Reflection AI가 Beam이라는 오픈 웨이트 언어 모델을 공개했어요. 크기는 무려 5,010억(501B) 파라미터예요. Reflection AI는 구글 딥마인드에서 AlphaGo와 Gemini 관련 연구를 하던 Misha Laskin과 Ioannis Antonoglou가 세운 회사예요. 2025년 가을 엔비디아가 참여한 20억 달러 규모 투자를 받으면서 “미국의 오픈 프런티어 AI 연구소가 되겠다”고 선언한 곳이기도 하고요.
이 선언이 왜 중요하냐면, 지금 오픈 웨이트 모델 최상위권을 DeepSeek, Qwen, Kimi, GLM 같은 중국 모델들이 거의 차지하고 있거든요. 미국 쪽에서는 Meta의 Llama 이후 눈에 띄는 대형 모델이 드물었고, OpenAI가 gpt-oss를 내놓긴 했지만 120B 수준이었어요. Beam은 그 빈자리를 미국 스타트업이 직접 채워 보겠다는 시도라고 보시면 돼요.
오픈 웨이트, 정확히 뭐예요?
'오픈 소스'랑 헷갈리기 쉬운데 살짝 달라요. 오픈 웨이트는 학습을 마친 모델의 가중치(모델 안에 들어 있는 수천억 개의 숫자)를 공개한다는 뜻이에요. 내려받아서 내 서버에서 돌릴 수도 있고 파인튜닝도 할 수 있어요. 다만 어떤 데이터로 어떻게 학습했는지까지 전부 공개하지는 않는 경우가 많아요. 비유하자면 완성된 요리는 통째로 주는데 레시피와 재료 출처는 알려주지 않는 셈이에요. 그래서 실무에 쓰기 전에는 라이선스 조건(상업적 이용이 되는지, 사용자 수 제한이 있는지 등)을 꼭 확인해야 해요.
501B면 얼마나 큰 건가요?
메모리로 계산해 보면 감이 와요. 파라미터 하나를 16비트(BF16)로 저장하면 2바이트니까, 501B 모델은 가중치만 약 1TB예요. 8비트(FP8)로 줄이면 약 500GB, 4비트로 양자화하면 약 250GB 정도고요. H100(80GB) 8장을 합치면 640GB라서 FP8 가중치는 겨우 올라가요. 그런데 대화가 길어질수록 커지는 KV 캐시까지 생각하면 빠듯해요. H200(141GB) 8장 정도는 돼야 여유가 생기고요. 정리하면 개인 PC로는 어렵지만, 기업이 GPU 서버 한 노드로 운영하기에는 현실적인 크기예요.
여기서 같이 알아두면 좋은 개념이 MoE(Mixture of Experts)예요. 쉽게 말하면 모델 안에 '전문가' 네트워크를 여러 개 두고, 토큰이 들어올 때마다 그중 몇 개만 골라서 계산하는 구조예요. DeepSeek-V3는 전체 671B 중 토큰마다 약 37B만, Kimi K2는 1T 중 32B만 써요. 요즘 이 정도 규모의 모델은 대부분 MoE 구조이고, Reflection도 앞서 프런티어 규모의 MoE 학습 인프라를 구축했다고 밝혔어요. 주의할 점은 MoE라도 전체 가중치를 메모리에 다 올려야 한다는 거예요. 속도는 활성 파라미터 수에, 필요한 메모리는 전체 파라미터 수에 비례한다고 기억하시면 돼요. Beam의 활성 파라미터 수, 컨텍스트 길이, 벤치마크 수치는 원문 블로그에 정리돼 있으니 도입을 검토한다면 직접 확인해 보세요.
업계 흐름에서 보면
크기만 보면 Beam은 Llama 4 Maverick(400B)보다 크고 DeepSeek-V3(671B)보다는 작아요. 그런데 숫자보다 더 중요한 건 '누가 만들었느냐'예요. 미국 공공기관이나 규제가 까다로운 기업 중에는 중국산 모델을 도입할 때 컴플라이언스 부담을 느끼는 곳이 많거든요. 성능이 비슷하다면 미국에서 만든 모델을 고르려는 수요가 분명히 있고, Reflection은 바로 그 시장을 노리고 있어요. 엔비디아의 투자도 같은 맥락이에요. 오픈 모델 생태계가 커질수록 GPU를 사서 모델을 직접 돌리려는 곳도 늘어나니까요.
오픈 웨이트 시장은 이제 중국, 미국, 유럽(Mistral)의 대표 주자들이 경쟁하는 구도로 가고 있어요. 사용자 입장에서는 그만큼 고를 수 있는 모델이 많아지는 거고요.
한국 개발자에게는 어떤 의미일까요?
첫째, 망분리·온프레미스 환경에서 일하는 분들에게 반가운 소식이에요. 금융, 공공, 의료처럼 외부 API를 쓰기 어려운 곳에서는 오픈 웨이트 모델이 사실상 유일한 선택지예요. 그런데 중국산 모델은 보안 심사에서 막히는 경우가 있거든요. 미국산 대형 오픈 모델이 하나 더 생긴 건 그래서 의미가 있어요.
둘째, 한국어 성능은 직접 검증해야 해요. 글로벌 모델은 영어와 코드 위주로 최적화되는 경우가 많아요. 국내 서비스에 쓸 거라면 자체 평가셋으로 꼭 비교해 보세요. 국내 독자 AI 파운데이션 모델들과 나란히 놓고 보는 것도 좋은 기준이 될 거예요.
셋째, 지금 배워두면 좋은 기술은 MoE 모델 서빙이에요. vLLM이나 SGLang 같은 추론 엔진에서 전문가 병렬화(expert parallelism)나 FP8·4비트 양자화를 다뤄 봤다면, 앞으로 어떤 오픈 모델이 나와도 그 경험을 그대로 쓸 수 있어요.
마무리
한 줄 정리: Beam은 오픈 웨이트 최상위권이 더 이상 한 나라만의 무대가 아니라는 신호예요.
여러분 회사에서 오픈 웨이트 모델을 도입한다면 성능, 라이선스, 모델을 만든 나라 중 무엇부터 따지실 건가요? 사내 서버에 대형 모델을 직접 올려본 경험이 있다면 뭐가 제일 힘들었는지도 궁금해요.
🔗 출처: Hacker News