TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 21 READS

샤오미 MiMo v2.6: 스마트폰 회사가 오픈 웨이트 LLM 경쟁에 본격 합류한 이유

스마트폰 회사가 LLM을 만든다고요?

샤오미 하면 보통 가성비 스마트폰이나 로봇청소기, 요즘은 전기차 SU7 정도를 떠올리실 텐데요. 이 회사가 2025년부터 “MiMo”라는 이름으로 자체 대형 언어 모델을 꾸준히 내놓고 있어요. 처음엔 7B짜리 작은 추론 모델로 시작했고, 이미지 인식용 MiMo-VL, 음성용 MiMo-Audio를 거쳐서 2025년 말에는 MiMo-V2-Flash라는 꽤 큰 모델을 오픈 웨이트로 공개했거든요. 이번에 나온 v2.6는 그 V2 계보의 최신 버전이에요.

왜 하드웨어 회사가 이 비싼 게임에 뛰어드느냐면, 샤오미는 전 세계에 깔린 수억 대의 폰과 IoT 기기, 그리고 자동차까지 갖고 있어요. 이 기기들 위에서 돌아갈 AI 비서를 남의 모델에 계속 의존하면 비용도 비용이지만 주도권을 잃게 되죠. 실제로 샤오미는 2025년 초 DeepSeek-V2의 핵심 개발자였던 뤄푸리를 영입하면서 “우리 진심이다”라는 신호를 보냈고, 그 뒤로 모델이 꾸준히 나오고 있어요.

MiMo V2 계열은 뭐가 다른가

v2.6를 이해하려면 그 뿌리인 MiMo-V2-Flash의 구조를 알아두는 게 좋아요. 이 모델은 전체 파라미터가 약 3,090억 개인데 실제로 한 토큰을 처리할 때 활성화되는 건 150억 개 정도예요. 이게 뭐냐면 MoE(Mixture of Experts, 전문가 혼합) 구조인데요, 모델 안에 “전문가” 역할을 하는 작은 신경망 여러 개를 두고 입력마다 그중 몇 개만 골라서 쓰는 방식이에요. 병원에 가면 모든 과 의사가 다 나오는 게 아니라 내 증상에 맞는 과 의사만 진료하는 것과 비슷하죠. 그래서 덩치는 큰데 실제 연산 비용은 15B짜리 모델 수준으로 낮아요.

또 하나 눈여겨볼 점은 하이브리드 어텐션이에요. 트랜스포머는 원래 모든 토큰이 모든 토큰을 쳐다보는(전역 어텐션) 구조라 문맥이 길어지면 비용이 제곱으로 늘어나거든요. V2 계열은 대부분의 레이어에서 가까운 토큰만 보는 슬라이딩 윈도우 어텐션을 쓰고, 일부 레이어에서만 전체를 보게 해서 긴 문맥을 싸게 처리해요. 여기에 MTP(Multi-Token Prediction)라고 해서 다음 토큰 하나가 아니라 여러 개를 한 번에 예측하는 기법도 들어가 있어서 추론 속도를 끌어올려요. 이런 설계는 DeepSeek-V3가 대중화시킨 흐름이고, 샤오미가 그 노하우를 꽤 빠르게 흡수했다는 걸 보여줘요.

v2.6에서 샤오미가 강조하는 방향은 결국 에이전트 코딩과 도구 사용이에요. 요즘 중국 랩들이 전부 이 방향으로 달리고 있는데, 벤치마크 점수보다 “실제로 Claude Code나 Cursor 같은 도구에 꽂아서 쓸 만한가”가 승부처가 됐기 때문이에요. 정확한 수치는 공식 페이지에서 확인하시는 게 좋지만, 핵심 메시지는 “이전 버전보다 코딩 에이전트로 쓸 때 훨씬 안정적이다”라는 거예요.

업계 맥락: 중국 오픈 웨이트 전쟁의 새 선수

2025년 이후 오픈 웨이트 모델 판은 사실상 중국 랩들이 주도하고 있어요. DeepSeek V3와 R1, 알리바바의 Qwen3, 문샷의 Kimi K2, 즈푸의 GLM 시리즈, MiniMax의 M2까지. 여기에 샤오미가 끼어든 건데, 다른 회사들과 결정적으로 다른 점은 모델을 돌릴 기기를 직접 만든다는 거예요. 애플이 온디바이스 AI를 하면서도 모델은 꽁꽁 닫아두는 것과 정반대로, 샤오미는 모델을 오픈 라이선스로 풀면서 생태계를 키우는 전략을 택했어요.

이건 미국 빅테크의 흐름과도 대비돼요. OpenAI나 Anthropic은 API로만 서비스하고, 메타는 Llama 4 이후 오픈 웨이트에 대한 열의가 눈에 띄게 식었거든요. 그 빈자리를 중국 회사들이 채우면서 “쓸 만한 오픈 모델 = 중국 모델”이라는 공식이 굳어지고 있어요.

한국 개발자에게 주는 시사점

첫째, 자체 호스팅 선택지가 하나 더 늘었어요. 활성 파라미터가 15B 수준이면 vLLM이나 SGLang으로 서빙할 때 추론 비용이 꽤 착해요. 다만 전체 파라미터를 메모리에 다 올려야 하니 FP8 기준으로도 300GB 넘는 GPU 메모리가 필요해서, 개인이 집에서 돌리긴 어렵고 회사 단위에서 H100 몇 장 묶어 쓰는 시나리오에 맞아요.

둘째, 데이터 거버넌스 관점에서 볼 필요가 있어요. 중국 회사의 API를 직접 쓰는 건 보안팀이 반대할 가능성이 높지만, 오픈 웨이트를 받아서 내 인프라에서 돌리면 데이터가 밖으로 나가지 않으니 이 문제를 우회할 수 있어요. 라이선스가 MIT 계열이라면 상업적 이용에도 걸림돌이 없고요.

셋째, 국내 소버린 AI 프로젝트들(네이버 HyperCLOVA X, LG 엑사원, 업스테이지 솔라, SKT A.X 등)에게는 꽤 부담스러운 뉴스예요. 스마트폰 회사가 이 정도 모델을 오픈으로 푸는 시대에, 국산 모델은 “한국어 잘함” 외에 어떤 차별점을 가져갈지 더 치열하게 고민해야 하니까요.

마무리

한 줄로 정리하면, 샤오미가 DeepSeek식 MoE 설계를 빠르게 소화해서 코딩 에이전트용 오픈 모델 경쟁에 본격 합류했다는 이야기예요.

여러분은 실무에서 중국 오픈 웨이트 모델을 써보신 적 있으신가요? 성능은 좋은데 보안팀 설득이 어렵다는 이야기를 많이 듣는데, 여러분 회사는 어떻게 결론 냈는지 궁금해요.


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://mimo.xiaomi.com/mimo-v2-6
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...