TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 25 READS

브라우저에서 돌아가는 초소형 LLM, MicroLLM Lab이 던지는 질문

온디바이스 AI가 주목받으면서 '모델을 어디서 실행할 것인가'라는 물음이 점점 실무 설계의 앞단으로 옮겨오고 있다. MicroLLM Lab은 이 질문을 가장 극단적인 형태로 밀어붙인 실험 도구다. 서버도, API 키도 없이 웹 브라우저 안에서 WebGPU를 이용해 7종의 초소형 언어 모델을 직접 내려받아 실행하고, 채팅과 벤치마크, 모델 간 비교까지 한 화면에서 수행한다. 사용되는 모델은 Q4로 양자화된 경량 모델들로, PetitGPT와 SmolLM2 같은 계열이 포함된다. 핵심은 모든 연산이 사용자의 기기에서 일어나고, 측정된 수치도 그 기기 밖으로 나가지 않는다는 점이다.

성능이 아니라 '측정'을 보여주는 도구

이 프로젝트가 흥미로운 이유는 초소형 모델을 잘 포장해서 보여주려는 데 있지 않다는 것이다. 오히려 반대다. 평가 기준을 문장력이나 답변의 세련됨이 아니라, 정규식과 정확한 토큰 일치 같은 객관적 검사로 잡았다. 즉 모델이 특정 형식이나 정답 토큰을 실제로 뱉어내는지를 기계적으로 확인한다. 도구 설명은 135M 규모의 모델이 이런 검사를 통과하지 못하는 것을 실패가 아니라 '측정 결과 그 자체'라고 규정한다. 작은 모델은 원래 많은 것을 못한다는 사실을, 감추지 않고 숫자로 드러내는 태도다. 사용자는 모델을 고르고 실행하기만 하면 되며, 이전 실행에서 얻은 tok/s 값이 있으면 이를 근거로 다음 실행의 소요 시간을 추정해준다.

지표는 크게 두 축이다. 하나는 속도로, 지속 디코딩 상태에서의 초당 토큰 수와 테스트 묶음 전체를 도는 데 걸린 실제 시간을 잰다. 다른 하나는 정확도로, 앞서 말한 객관적 검사의 통과율이다. 이 수치들은 모두 지금 이 브라우저에서 실제로 돌린 결과이며, 차트는 모델별 최신 실행 묶음을 기준으로 그려진다. 여기에 더해 기기 하드웨어 정보와 최고·지속 초당 토큰 수를 담은 검증 가능한 성능 인증서를 생성해 내려받고 점수를 공유할 수 있게 했다. 같은 모델이라도 사용자의 GPU와 브라우저 환경에 따라 결과가 달라지므로, 이 인증서는 '이 모델이 이 기기에서 이만큼 나온다'는 국지적 증거에 가깝다.

실무자가 눈여겨볼 지점

한국의 개발자와 기획자 입장에서 이 도구가 주는 실용적 의미는 두 가지다. 첫째, 초소형 온디바이스 모델의 현실적인 성능 감각을 체감할 수 있다. 클라우드 호출 없이 브라우저에서 수백 MB 안팎의 모델을 돌렸을 때 어느 정도 속도가 나오고 어떤 과제에서 무너지는지를, 남의 벤치마크가 아니라 자기 노트북에서 직접 확인하는 경험은 스펙 표만 보는 것과 다르다. 둘째, 데이터가 기기를 벗어나지 않는 구조는 프라이버시 민감 서비스나 오프라인 기능을 설계할 때의 참고점이 된다. 입력과 측정치가 외부로 전송되지 않는다는 전제는, 개인정보 처리에 제약이 많은 국내 환경에서 특히 설득력이 있다.

다만 이 실험을 곧바로 제품 판단의 근거로 삼기에는 한계가 분명하다. 평가가 객관적 검사에 집중돼 있다는 것은 뒤집어 말하면 답변의 자연스러움, 맥락 유지, 한국어 처리 품질 같은 정성적 측면은 이 지표만으로 알 수 없다는 뜻이다. 또한 WebGPU 지원 여부와 기기 성능 편차가 커서, 한 사람의 인증서 점수를 일반화하기 어렵다. 초소형·Q4 양자화 모델은 애초에 좁은 과제를 빠르게 처리하는 용도이지 범용 어시스턴트를 대체하는 물건이 아니라는 점도 함께 기억해야 한다.

보안 관점의 주의

기술적으로 한 가지 짚어둘 대목이 있다. 도구 설명에 따르면 검사 로직 편집기는 해당 출처(origin) 안에서 eval() 방식으로 실행된 뒤, 각 검사가 모델이 디코딩한 텍스트에 대해 돌아간다. 즉 사용자가 작성하거나 불러온 검사 코드가 브라우저에서 그대로 실행되는 구조다. 개인 실험 용도라면 문제될 것이 적지만, 출처가 불분명한 검사 스크립트를 가져와 실행할 때는 임의 코드 실행 위험을 의식하는 편이 좋다. 개방적이고 투명한 설계가 주는 장점과, 그 개방성이 수반하는 책임은 늘 짝을 이룬다.

결국 MicroLLM Lab은 '작은 모델을 자랑하는 데모'가 아니라 '작은 모델의 한계를 정직하게 재는 자'에 가깝다. 온디바이스 추론이 기술 뉴스의 키워드에서 실제 아키텍처 선택지로 넘어가는 국면에서, 자기 기기로 직접 측정하고 그 숫자를 손에 쥐어보는 경험은 그 자체로 의미가 있다. 화려한 결과를 기대하기보다, 무엇이 되고 무엇이 안 되는지를 눈으로 확인하는 도구로 접근할 때 이 실험은 가장 쓸모 있다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://stateofutopia.com/experiments/microllmlab/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...