TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 26 READS

한 달간 저가 오픈 모델 하나로 코딩하기, 그 절반의 실패가 남긴 것

한 달간 저가 오픈 모델 하나로 코딩하기, 그 절반의 실패가 남긴 것
SOURCE IMAGE · HACKER NEWS

오픈소스 CMS 프로젝트 Wagtail 팀이 흥미로운 실험을 공개했다. 9월 한 달 동안 개발 업무에 쓰는 AI 모델을 효율적인 오픈 모델 하나, 즉 GLM 5.3 Flash로만 제한해 보기로 한 것이다. 결과적으로 한 달간 약 20억 토큰을 소비했는데, 목표 모델의 사용 비중은 절반인 10억 토큰에 그쳤다. 팀 스스로 "기술적으로는 실패한 도전"이라고 평가했지만, 그 실패 과정에서 드러난 교훈이 오히려 실무자에게 더 유용하다.

왜 저가 모델 하나로 몰아보려 했나

이 실험의 전제는 분명하다. 일상적인 개발 작업 대부분은 최고 성능의 대형 모델이 아니라 이른바 '플래시 등급'의 값싸고 효율적인 모델로도 충분히 처리된다는 가설이다. 팀은 AI 사용량을 추적하기 위해 AgentsView라는 도구를 활용했고, 이를 통해 모델별 토큰 분포를 들여다봤다. 핵심 목표는 비용과 에너지 소비를 통제 가능한 수준으로 낮추는 것이었다. 실제로 팀은 성과 지표를 '토큰 수'가 아니라 비용(달러)과 에너지(kWh)로 환산해 바라본다는 점이 눈에 띈다. 토큰 자체는 모델마다 효율이 달라 비교 기준으로 큰 의미가 없기 때문이다.

실패를 부른 두 가지 변수

계획이 틀어진 첫 번째 이유는 모델 선택 실수였다. Wagtail 팀은 실험적으로 운영 중인 MCP 서버를 이른바 '바이브 코딩' 방식으로 빠르게 만든 프로토타입이라고 솔직하게 밝혔다. 문제는 이 프로토타입 작업에 '잘못된' 모델을 골랐다는 데 있다. 그 결과 거의 하룻밤 사이에 4억 5천만 토큰, 150달러, 5kWh의 에너지가 소모됐다. 팀은 적절한 모델과 에이전트 패턴을 택했다면 큰 수고 없이도 약 5분의 1 비용으로 비슷한 결과를 얻을 수 있었을 것이라고 돌아봤다. 결과물인 MCP 서버 자체는 잘 작동해 좋은 데모가 됐지만, 모델 선택과 에이전트 설계에 대한 사전 예산 책정과 주의가 필요하다는 교훈을 남겼다.

두 번째 변수는 인프라 가용성 문제였다. 대형 연구소들이 GPU를 대량으로 확보해 둔 것과 달리, Wagtail이 선택한 추론 제공업체들은 같은 수준의 용량을 갖추지 못했다. 특히 GLM 5.3 Flash에서 성능 저하가 두드러졌는데, 팀은 이 모델이 자신들의 업무에 유의미한 모델군 중 파레토 최전선(가성비 경계)에 위치해 그만큼 수요가 몰린 탓으로 추정했다. 결국 팀은 DeepSeek V4.1 Flash, Qwen 3.8 Flash 같은 유사 모델로 전환해야 했다. 전환 자체는 매우 간단했지만 예상치 못한 번거로움이었다.

여러 모델을 계속 시험해야 하는 이유

세 번째로, 일상 작업을 한두 모델로 좁히더라도 다양한 모델을 지속적으로 실험하는 일은 포기할 수 없었다. 제공업체들이 쏟아내는 신규 모델을 따라잡아야 하고, 무엇보다 팀이 Wagtail 관련 작업에 대한 모델 성능 벤치마크를 구축하기 시작하면서 폭넓은 모델에 걸친 데이터가 필요해졌기 때문이다. 이런 구체적인 데이터가 있어야 개발자들에게 더 가벼운 선택지를 설득력 있게 권할 수 있다는 것이 팀의 판단이다. 여기에 에이전트용 스킬이나, 에이전트와 잘 맞물리도록 설계한 새 CLI 프로토타입이 그 선택지를 더 현실적으로 만들어 준다.

숫자로 보면 도전은 분명 미달이었다. 목표 모델 사용률 50%, 20억 토큰 중 10억 토큰, 에너지 소비는 목표했던 10kWh가 아닌 약 35kWh였다. 그럼에도 팀이 이 실험을 긍정적으로 결산하는 이유는 '지금 이 시점에 필요한 학습'을 얻었다고 보기 때문이다.

한국 실무자가 가져갈 지점

이 사례가 한국의 IT 실무자에게 주는 시사점은 두 갈래다. 하나는 비용과 에너지를 1급 운영 지표로 끌어올리라는 것이다. AI 코딩 도구를 팀 단위로 도입할 때 토큰 소비는 체감이 어렵지만, 달러와 전력량으로 환산하면 모델 선택 하나가 하룻밤 사이에 수백 달러 차이를 만든다는 사실이 분명해진다. 특히 프로토타입이나 에이전트 자동화처럼 반복 호출이 폭증하는 패턴에서는 사전 예산 책정이 필수다.

다른 하나는 특정 모델이나 제공업체에 고정되지 않는 전환 가능성을 설계 단계에서 확보하라는 점이다. Wagtail 팀이 성능 저하에 부딪혔을 때 다른 플래시급 모델로 쉽게 갈아탈 수 있었던 것은 그만큼 교체를 염두에 둔 구조였기 때문이다. 다만 유의할 한계도 있다. 이 보고는 Wagtail이라는 특정 오픈소스 프로젝트의 한 달 경험담이며, 언급된 모델들의 상대적 우열이나 벤치마크 수치는 아직 공개되지 않았다. 따라서 '저가 모델만으로 대부분의 작업이 가능하다'는 결론은 각 팀이 자기 업무에 맞춰 직접 검증해야 할 가설로 받아들이는 편이 안전하다. 팀은 10월에는 효율적인 모델이 전체 추론 작업의 과반을 담당하도록 만드는 것을 새 목표로 삼았고, 그 결과는 11월 Wagtail Space 2026에서 공유할 예정이라고 밝혔다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://wagtail.org/blog/one-month-on-glm-53-flash/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...