TECH 으로 돌아가기
TECH HACKER NEWS 오늘 5분 읽기 45 READS

레디스 아버지 안티레즈의 새 프로젝트 — 맥에서 도는 MiniMax H3 전용 C 추론 엔진 'h3.c'

레디스 아버지 안티레즈의 새 프로젝트 — 맥에서 도는 MiniMax H3 전용 C 추론 엔진 'h3.c'
SOURCE IMAGE · HACKER NEWS
레디스 아버지 안티레즈의 새 프로젝트 — 맥에서 도는 MiniMax H3 전용 C 추론 엔진 'h3.c'

레디스(Redis)를 만든 살바토레 산필리포, 닉네임 안티레즈(antirez)를 아시나요? 세계에서 가장 많이 쓰이는 인메모리 데이터베이스를 거의 혼자 힘으로 일궈낸 C 프로그래머인데요. 그가 이번에는 LLM 추론 엔진을 들고 나타났어요. 이름은 h3.c. 중국 AI 기업 MiniMax의 오픈 웨이트 모델인 H3를 맥에서 돌리기 위한 전용 엔진을 C로 작성한 프로젝트예요.

추론 엔진이 뭐냐면

먼저 용어부터 풀고 갈게요. LLM은 학습이 끝나면 수십억 개의 숫자(가중치) 파일로 남아요. 이 파일 자체는 아무것도 못 하고, 이걸 읽어서 실제로 토큰을 하나씩 생성해내는 프로그램이 따로 필요한데, 그게 바로 추론(inference) 엔진이에요. 이 분야의 대표 주자가 llama.cpp죠. 수백 종의 모델을 지원하는 범용 엔진인데, 그만큼 코드베이스가 거대하고 복잡해졌어요.

h3.c는 정반대 접근이에요. 딱 하나의 모델 계열에 집중해요. 대신 의존성 없이 읽을 수 있는 크기의 C 코드로, 모델이 어떻게 로드되고 토큰이 어떻게 생성되는지를 처음부터 끝까지 따라갈 수 있게 만들어졌죠. 카파시(Andrej Karpathy)가 라마 모델 추론을 C 파일 하나로 구현했던 llama2.c의 계보를 잇는 프로젝트라고 볼 수 있어요. 안티레즈는 레디스 시절부터 "의존성을 최소화한, 읽히는 C 코드"를 철학으로 삼아온 사람이라, 이런 프로젝트와 궁합이 잘 맞아요.

타깃이 맥이라는 점도 흥미로워요. 애플 실리콘 맥은 CPU와 GPU가 메모리를 공유하는 통합 메모리 구조라서, 큰 모델을 로컬에서 돌리기에 유리한 하드웨어거든요. 그래픽카드 메모리 8GB, 16GB에 갇히는 일반 PC와 달리, 램 64GB 맥이면 그 램을 통째로 모델에 쓸 수 있어요. 그래서 로컬 LLM 커뮤니티에서 맥이 사실상 표준 장비처럼 자리 잡았고, 맥을 겨냥한 최적화 엔진의 수요도 커지고 있는 거죠.

왜 '전용 엔진'이 의미가 있을까

범용 엔진이 이미 있는데 특정 모델 전용 엔진이 왜 필요하냐고 물을 수 있는데요. 두 가지 가치가 있어요. 하나는 교육이에요. llama.cpp에서 특정 모델의 추론 경로를 추적하는 건 미로 찾기에 가깝지만, 전용 엔진은 토크나이저(문장을 토큰 조각으로 쪼개는 부분), 어텐션 계산, KV 캐시, 샘플링까지 한 흐름으로 읽혀요. KV 캐시가 뭐냐면, 이미 처리한 앞부분 문맥의 계산 결과를 저장해뒀다가 재활용하는 메모리 구조예요. 이게 없으면 토큰 하나 만들 때마다 전체 문맥을 다시 계산해야 해서 속도가 수십 배 느려지죠. 이런 핵심 개념들을 실제 동작하는 코드로 배울 수 있는 거예요.

다른 하나는 뜯어고칠 수 있다는 점이에요. 코드가 작으면 샘플링 방식을 바꿔보거나, 양자화(가중치를 더 적은 비트로 압축해 메모리를 아끼는 기법)를 실험하거나, 내 용도에 맞게 개조하기가 쉬워요. 거대 프레임워크에서는 엄두가 안 나는 일들이죠.

업계 맥락과 시사점

로컬 LLM 생태계는 지금 llama.cpp(범용 엔진), 애플의 MLX(파이썬 친화적인 맥 전용 프레임워크), Ollama(사용성 중심 래퍼)가 큰 축을 이루고 있는데, h3.c 같은 프로젝트는 그 사이에서 "이해를 위한 최소 구현"이라는 또 하나의 축을 보여줘요. 그리고 레디스급 시스템 프로그래머가 AI 인프라를 직접 파고들기 시작했다는 것 자체가, LLM 추론이 더는 ML 연구자만의 영역이 아니라 시스템 프로그래밍의 영역이 됐다는 신호이기도 하고요.

한국 개발자에게는 특히 학습 자료로 추천하고 싶어요. LLM을 API로만 써왔다면, 이런 작은 엔진의 코드를 한번 읽어보는 것만으로 토큰 단가와 지연 시간이 왜 그렇게 책정되는지, 긴 컨텍스트가 왜 비싼지가 감으로 잡히거든요.

정리하면, h3.c는 "레디스의 아버지가 쓴, 읽으면서 배우는 LLM 추론 엔진"이에요. 여러분은 로컬에서 LLM을 돌려보신 적 있나요? 어떤 장비에 어떤 모델 조합을 쓰시는지 궁금해요.


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://github.com/antirez/h3.c
SHARE
처리 중...