양자화와 로컬 추론 연구로 알려진 팀 데트머스가 자신의 대학 연구실이 '오픈소스 위크'를 통해 개별 논문이 아니라 서로 맞물리는 도구 묶음을 공개하겠다고 예고했다. 그의 출발점은 취업 불안에 시달리는 학생들과, 학계 연구가 무의미하다며 프론티어 랩행을 기다리는 박사과정생들이다. 두 부류 모두 '연구의 미래는 GPU를 가장 많이 가진 쪽의 것'이라고 가정하지만, 데트머스는 정반대라고 본다. 자원이 제한적이기 때문에 오히려 대학 연구실에서 향후 10년의 흥미로운 작업이 나올 것이라는 주장이다.
논문이 아니라 생태계가 어려워졌다
그가 제시하는 근거는 작업 방식의 변화다. 에이전트 덕분에 과거 1년치 엔지니어링과 실험이 필요하던 프로젝트가 수 주, 때로는 수 일로 줄었다. 개별 프로젝트가 쉬워지자 낱개의 논문을 찍어내는 방식은 더 이상 좋은 연구로 기능하지 못한다는 것이 핵심 논리다. 어려움이 사라진 게 아니라 옮겨갔을 뿐이며, 이제 어려운 일은 논문 한 편이 아니라 각 요소가 다음 요소를 더 유용하게 만드는 '일관된 생태계'를 내놓는 것이라고 그는 말한다. 그래서 이번 공개물은 추론 서빙 프레임워크, 에이전트 하네스, 그리고 이 둘을 결합한 자율 연구 시스템이라는 세 축의 교차점에 놓인다.
소비자 하드웨어로 내려온 대형 모델
실무자 입장에서 가장 눈길을 끄는 대목은 로컬 추론 성능이다. 데트머스는 자신들의 하네스에 'Mac·Metal 커널을 최적화하라'는 한 줄 명령을 내리고 방치하는 방식으로, 별도 피드백 없이 에이전트가 스스로 개선을 이어가게 했다고 설명한다. 그 결과 Qwen 3.6 35B-A3B 모델을 가중치당 1.5비트로 양자화해 초당 450토큰 수준으로 돌렸다고 한다. 16비트 반정밀도 대비 약 10분의 1 메모리로, 원격 서비스가 아니라 로컬 프로세스처럼 느껴지는 속도라는 것이다. 나아가 125B급 모델을 24GB GPU 한 장에서, 550B급 모델을 128GB 메모리의 맥북이나 DGX Spark 같은 장비에서 구동할 수 있으며 컨텍스트 압축과 관리가 자동으로 이뤄진다고 덧붙였다.
연구 자동화 쪽에서는 인터넷 접속 없이 로컬에서만 도는 정보 검색·연구 시스템을 소개했다. 그는 잘 모르는 분야인 생물정보학에서 '빠른 진척, 저렴한 평가, 최근 4주 내 활발히 연구되는 신선한 문제'라는 조건을 걸었고, 에이전트가 제시한 세 문제 중 첫 번째를 두 시간가량 파고들어 휴리스틱 기법의 새 하한을 세우고 기존 평가 데이터의 결함을 발견하는 등 네 가지 결과를 냈다고 전한다. 전체 문제의 최고 성능에는 도달하지 못했지만, 학생들이 중단하자 다시 써달라고 먼저 요청했다는 점을 그는 도구의 진짜 검증으로 든다.
비용을 반으로 줄인다는 압축 기법
실질적인 운영 이점으로 강조하는 것은 'CliffCompaction'이라는 자동 압축 기법이다. Claude Code나 Codex의 자동 압축보다 강력해 수백만 토큰, 일부는 1억 토큰을 넘는 세션도 유지되며 전체 비용을 약 50% 절감한다고 주장한다. 한 협력사는 사내 도입 후 전체 AI 예산의 45%를 줄였고, KernelBench에서 AlphaEvolve류나 계층적 메모리 시스템을 큰 격차로 앞섰다는 설명이다. 절감한 비용을 여러 롤아웃에 재투자하는 방식으로 테스트타임 스케일링에 활용할 수 있다는 구상도 함께 내놨다. 노동 시장에 대해서는 가장 먼저 대체될 것으로 예상됐던 소프트웨어 엔지니어 수요가 오히려 늘었다는 점을 들며, 강한 에이전트 활용 능력과 깊은 전문성으로 직무의 요구가 바뀌었을 뿐이라고 정리한다.
어떻게 읽어야 하나
다만 이 글은 공개 전 예고편 성격이 강하다는 점을 감안해야 한다. 성능 수치와 예산 절감 폭, 프론티어 랩 시스템을 앞섰다는 비교는 모두 저자 측 자체 발표일 뿐 독립적으로 검증된 벤치마크가 아니다. 언급된 일부 모델명은 아직 일반에 익숙하지 않은 것들이어서, 실제 코드와 재현 가능한 결과가 공개된 뒤에야 판단할 수 있는 영역이다. 그럼에도 '소수의 GPU와 노트북만으로 대형 모델을 로컬 구동하고, 자동 압축으로 장시간 에이전트를 저비용으로 운용한다'는 방향성은 사내 데이터를 외부로 내보내기 어려운 조직이나 예산이 빠듯한 팀에게 충분히 검토할 만한 흐름이다. 접근성의 두 축인 자원과 전문성 가운데 하드웨어만으로 해결되지 않는 '전문성' 부담을 설계로 걷어내겠다는 문제의식은, 결과물의 실제 공개 여부와 무관하게 로컬 AI 도입을 고민하는 실무자가 눈여겨볼 지점이다.