TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 22 READS

레디스 창시자 antirez의 로컬 LLM 추론 엔진 'ds4' 살펴보기

레디스 창시자 antirez의 로컬 LLM 추론 엔진 'ds4' 살펴보기
SOURCE IMAGE · HACKER NEWS

오픈소스 인메모리 데이터베이스 레디스(Redis)의 창시자로 널리 알려진 안티레즈(antirez)가 로컬 환경에서 대형 언어 모델을 구동하기 위한 추론 엔진 'ds4'를 공개했다. ds4는 C 언어로 작성된 추론 엔진으로, 공식 사이트(dwarfstar.sh)는 문서와 벤치마크, 설치 노트를 함께 제공한다. 지원 대상으로는 딥시크(DeepSeek) V4/V4.1, Qwen3.8 Flash Next, GLM 5.x 계열이 명시돼 있으며, 하드웨어 가속 백엔드로는 애플 실리콘의 메탈(Metal), 엔비디아의 CUDA, AMD의 ROCm을 모두 아우른다. 특정 벤더에 종속되지 않고 주요 GPU·가속기 생태계를 폭넓게 커버하려는 설계 의도가 읽히는 대목이다.

MoE 모델을 로컬 머신에 맞추는 방식

ds4가 내세우는 핵심 전략 중 하나는 라우팅 기반 전문가 혼합(routed-MoE) 모델을 목표 머신의 자원에 맞춰 넣는 방법이다. 공식 설명은 이를 "라우팅되는 전문가(routed experts)는 압축하고, 결정적으로 중요한 공유 경로(shared paths)는 정밀하게 유지한다"는 원칙으로 요약한다. MoE 구조에서는 입력 토큰마다 일부 전문가만 활성화되기 때문에, 자주 쓰이지 않는 라우팅 전문가 쪽은 정밀도를 희생해 용량을 줄이고, 모든 토큰이 반드시 거치는 공유 계층은 정밀도를 보존하는 식으로 품질과 메모리 사용량의 균형을 맞추는 접근이다. ds4가 지원하는 routed-MoE 빌드들이 각자의 목표 하드웨어에 들어맞게 만들어지는 것도 이 선택적 압축 덕분이라는 설명이다.

이 방식은 실무적으로 의미가 있다. 최신 대형 모델은 전체 파라미터가 방대해 단일 워크스테이션이나 개인용 GPU에 그대로 올리기 어려운 경우가 많은데, 모든 가중치를 일률적으로 양자화하면 품질 저하가 두드러지기 쉽다. 반면 활성화 빈도와 중요도가 다른 구성 요소를 구분해 서로 다른 정밀도를 적용하면, 제한된 메모리 안에서도 품질 손실을 비교적 통제된 범위로 유지할 수 있다. 다만 공식 자료가 구체적인 압축률이나 정밀도 수준, 품질 저하 폭에 대한 수치를 공개 추출 내용에 담고 있지 않은 만큼, 실제 효과는 사이트가 제공한다고 밝힌 벤치마크를 직접 확인해 가늠해야 한다.

긴 프리픽스를 SSD에 저장해 재사용

또 하나 눈에 띄는 기능은 긴 프롬프트 프리픽스(prefix)를 SSD에 저장해 두었다가, 프롬프트 해시를 기준으로 다시 불러오는 방식이다. 이렇게 하면 엔진을 재시작하더라도 전체 프리필(pre-fill)을 처음부터 다시 수행할 필요가 없다. 프리필은 모델이 입력 프롬프트 전체를 읽어 내부 상태(KV 캐시 등)를 구성하는 단계로, 입력이 길수록 연산 비용과 대기 시간이 커진다. 반복적으로 동일하거나 유사한 긴 컨텍스트를 사용하는 작업이라면, 그 상태를 디스크에 보존했다가 해시가 일치할 때 되살리는 방식이 체감 응답 속도와 자원 소모를 줄이는 데 도움이 될 수 있다.

이 기능은 특히 시스템 프롬프트가 길거나, 동일한 코드베이스·문서를 반복해서 컨텍스트로 넣는 코딩·문서 작업에서 가치가 크다. 세션을 자주 끊었다 다시 여는 개발 워크플로에서도 매번 긴 컨텍스트를 재처리하는 비용을 피할 수 있기 때문이다. 다만 프롬프트가 조금만 달라져도 해시가 바뀌어 캐시가 무효화될 수 있다는 점, 그리고 SSD 저장 공간과 입출력 속도가 재사용 효율을 좌우한다는 점은 실제 운용에서 고려해야 할 한계다.

세 가지 실행 바이너리

ds4는 용도에 따라 세 개의 실행 파일을 제공한다. 대화형 사용에는 ./ds4를, 로컬 API 서버를 띄우려면 ./ds4-server를, 그리고 상태를 유지하는 지속적 코딩 세션에는 ./ds4-agent를 쓰도록 구성돼 있다. 대화·서버·에이전트라는 세 갈래 구성은 각각 단발성 질의응답, 다른 애플리케이션과의 연동, 그리고 긴 호흡의 개발 작업이라는 서로 다른 사용 맥락을 겨냥한 것으로 보인다. 앞서 언급한 프리픽스 재사용 기능은 특히 ds4-agent가 지향하는 지속적 코딩 세션과 자연스럽게 맞물린다.

정리하면 ds4는 로컬에서 최신 MoE 계열 모델을 실행하려는 실무자에게 현실적인 선택지를 제시하는 시도다. 선택적 전문가 압축으로 모델을 하드웨어에 맞추고, 프리픽스 캐싱으로 반복 비용을 줄이며, 세 종류의 바이너리로 사용 시나리오를 나눈 구성은 로컬 추론의 전형적인 병목을 겨냥하고 있다. 다만 지원 모델 상당수가 비교적 최신·대형 계열이라 실제로 어떤 하드웨어에서 어느 정도 성능과 품질이 나오는지는 공개된 벤치마크와 설치 노트를 직접 검증한 뒤에 판단하는 편이 안전하다. 도입을 검토한다면 보유한 GPU·메모리 환경과 지원 백엔드(Metal·CUDA·ROCm)의 궁합부터 확인하는 것이 출발점이 될 것이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://dwarfstar.sh/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...