TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 23 READS

독일 알레프 알파의 '주권형' 오픈웨이트 모델 콜리브리, 실무 관점에서 뜯어보기

독일 알레프 알파의 '주권형' 오픈웨이트 모델 콜리브리, 실무 관점에서 뜯어보기
SOURCE IMAGE · HACKER NEWS

독일 AI 기업 알레프 알파가 독일 통일의 날에 맞춰 신규 언어모델 콜리브리(Kolibri)를 공개했다. 영어와 독일어를 함께 다루는 전문가 혼합(Mixture-of-Experts) 구조로, 전체 파라미터는 780억 개지만 토큰당 실제로 활성화되는 파라미터는 약 30억 개에 불과하다. 최대 100만 토큰의 컨텍스트를 지원하며, 전체 가중치를 허깅페이스에서 내려받아 아파치 2.0 라이선스로 쓸 수 있다. 공공 행정, 산업, 항공우주처럼 규제가 강하고 실패가 용납되지 않는 영역을 겨냥했다는 점이 이 모델의 성격을 규정한다.

콜리브리는 갑자기 등장한 것이 아니라 앞서 공개된 콜리브리 오리진의 후속작이다. 오리진은 전체 300억·활성 30억 파라미터에 6만 5천 토큰 컨텍스트를 가진 모델로, 알레프 알파가 자체 학습 파이프라인을 검증하기 위해 만든 일종의 시험작이었다. 데이터 수집과 정제, 수백 건의 소규모 실험(ablation), 사전학습과 사후학습, 평가까지 같은 파이프라인을 두 모델이 그대로 통과했다. 1월에 파이프라인 작업을 시작해 오리진은 6월 11일, 콜리브리는 9월 11일에 사전학습을 마쳤다. 석 달 사이에 파라미터는 300억에서 780억으로, 컨텍스트는 6만 5천에서 100만 토큰으로, 학습 토큰은 7.5조에서 20조로 늘었다. 20조 토큰을 얻기 위해 가공한 원시 데이터는 200조 토큰이 넘는다.

작지만 효율적인 설계

주목할 점은 성능보다 '성능 대비 비용'을 설계의 중심에 놓았다는 것이다. 회사의 실험에서는 320억에서 1230억까지 모델을 키울수록 성능이 계속 좋아졌지만, 서빙 비용이 함께 커졌다. 1230억 모델은 H100 두 장에서 25만 6천 토큰짜리 긴 질의를 3개밖에 처리하지 못한 반면, 780억 모델은 동시 요청 18개를 소화하며 디코딩 속도도 28% 빨랐다. 이 차이가 중간 규모를 택한 결정적 이유였다. 구조적으로도 적은 수의 넓은 전문가 대신 384개의 작은 전문가를 썼고, 전체 50개 층 가운데 10개만 전체 컨텍스트를 처리하고 나머지 40개는 512토큰의 좁은 창만 본다. 덕분에 컨텍스트가 길어져도 그 층들의 연산과 메모리가 일정하게 유지된다. 실무 관점에서 이 설계는 작은 크기로 온프레미스 운영이 가능하다는 의미이며, 내부 데이터를 외부 추론 서비스로 보내지 않아도 된다는 점이 규제 산업에서는 특히 중요하다.

성능 면에서 알레프 알파는 콜리브리가 수학, 코딩, 근거 기반 응답, 장문 처리에서 활성 파라미터가 최대 네 배 많은 Nemotron 3 Super급 모델과 견줄 수준이라고 밝혔다. 다만 회사는 공개 벤치마크가 특정 산업의 실제 요구를 담지 못한다고 보고, 독일 공공부문·항공·제조·자동차 같은 분야별 자체 평가 세트를 만들었다. 합성 학습 환경을 짝지어 고객 데이터를 전혀 쓰지 않고도 이 평가에 맞춰 모델을 개선했다는 설명이다.

주권과 신뢰, 그리고 '모름'을 말하는 모델

이 모델의 핵심 서사는 '주권(sovereignty)'이다. 알레프 알파는 독일에서 모델을 만들고 독일과 핀란드의 인프라에서 학습했으며, 유럽·독일 법의 적용을 받고 외국의 통제가 없다고 강조한다. 데이터 정제부터 사전·사후학습, 최적화까지 전 과정을 자사가 소유하며, EU AI법과 범용 AI 행동강령, GDPR, 저작권을 처음부터 고려했다고 밝혔다. 작은 크기 덕분에 고객은 배포 자유도와 지식재산 안전성을 얻고, 추론 노력 수준을 조절해 비용·지연과 답변 품질을 맞바꿀 수 있다.

신뢰성 측면에서 눈에 띄는 기능은 '모른다고 말하는' 능력이다. 콜리브리는 abstention 데이터와 자체 멀린-아서(Merlin-Arthur) 프로토콜로 학습돼, 주어진 문맥에 답의 근거가 없으면 답을 삼가도록 훈련됐다. 환각을 줄이려는 고객 요구를 반영한 것으로, 회사는 이 abstention 정확도를 지속적으로 추적한다고 한다. 언어 측면에서도 전체 사전학습 토큰의 21.3%가 독일어이며, 번역 텍스트는 원어의 문화적 색채가 묻어난다는 이유로 6%만 썼다. 영어 모델에 독일어를 덧붙인 것이 아니라 설계 단계부터 이중언어라는 점을 내세운다.

학습 운영의 안정성도 강조할 만하다. 콜리브리는 B200 GPU 768장에서 세 단계로 학습됐다. 16k 시퀀스 길이로 20조 토큰을 21일간 사전학습하고, 64k에서 3.44조 토큰의 중간학습, 256k에서 2천억 토큰의 장문 적응을 거쳐 총 24조 토큰에 육박한다. 21일간 하드웨어 고장이나 연결 끊김으로 38번의 예기치 않은 중단이 있었지만, GPU 시간 1만 시간당 한 번꼴인 이 중단은 파이프라인이 자동으로 처리해 최대 250스텝 이전 체크포인트에서 학습을 재개했다. 다만 알레프 알파 스스로 지적하듯, 오리진에서 콜리브리로의 개선은 파라미터·데이터를 늘리고 잘 알려진 구조를 쓴 '쉬운 방향'이며 여전히 작은 규모다. 데이터 셔플링 버그로 오리진 사전학습을 처음부터 다시 돌린 일화처럼 과정이 매끄럽지만은 않았다. 결국 이들이 내세우는 가장 지속적인 성과는 특정 모델 하나가 아니라, 원시 데이터에서 출발해 빠르게 모델을 만들고 출시하는 팀의 역량이라는 점을 읽을 필요가 있다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://aleph-alpha.com/en/blog/kolibri-has-landed-a-soverei...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...