TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 21 READS

내 예산에 맞는 최고의 LLM은? 매일 다시 그려지는 가성비 곡선 읽는 법

무슨 일이 있었냐면

'지금 이 가격대에서 가장 똑똑한 모델은 뭐지?'라는 질문, 요즘 LLM으로 뭔가 만드는 개발자라면 매주 한 번씩은 하게 되죠. 문제는 답이 계속 바뀐다는 거예요. 새 모델이 몇 주에 하나씩 나오고, 기존 모델은 갑자기 가격을 반으로 내리고, 오픈 웨이트 모델은 호스팅 업체마다 값이 다르거든요. 그래서 한 개발자가 '예산별 최고의 LLM(Best LLM for every budget)'이라는 사이트를 만들었어요. 여러 예산 구간을 잡고, 각 구간에서 벤치마크 점수가 가장 높은 모델을 골라서 보여주는데, 이걸 매일 자동으로 갱신하는 게 핵심이에요.

사이트 자체는 단순해요. 하지만 이 단순한 표 뒤에 있는 개념, 그러니까 '비용 대비 성능 프런티어'라는 사고방식은 LLM을 제품에 넣는 사람이라면 꼭 알아둘 가치가 있어요. 오늘은 그 얘기를 해볼게요.

파레토 프런티어가 뭐냐면

모델을 가로축은 가격, 세로축은 성능인 그래프에 점으로 찍어 보세요. 그러면 어떤 모델은 '더 싸면서 더 똑똑한' 다른 모델에게 완전히 밀려요. 이런 모델은 고를 이유가 없죠. 반대로 '이 가격에서는 이보다 나은 게 없는' 모델들을 이으면 하나의 곡선이 나오는데, 이걸 파레토 프런티어(Pareto frontier)라고 불러요. 합리적인 선택지는 전부 이 곡선 위에 있어요. 예산별 최고 모델 사이트가 하는 일이 바로 이 곡선을 매일 다시 그리고, 곡선 위의 점들만 보여주는 거예요.

왜 매일 다시 그려야 하냐면, 이 곡선이 정말 빨리 움직이거든요. 2025년 초 딥시크(DeepSeek) R1이 나왔을 때 최상위 성능 구간의 가격이 하루아침에 수십 분의 1 수준으로 내려앉았고, 그 뒤로 각 회사가 플래시·미니·나노 급 소형 모델을 경쟁적으로 내놓으면서 저가 구간도 몇 달마다 뒤집혔어요. 작년에 '가성비 최고'였던 모델이 지금은 프런티어 밖으로 밀려나 있는 경우가 흔해요.

가격표를 읽을 때 조심할 것들

LLM 가격은 보통 '100만 토큰당 몇 달러'로 표시되는데, 여기에 함정이 몇 개 있어요.

먼저 입력과 출력 가격이 달라요. 대부분 출력 토큰이 입력보다 여러 배 비싸요. 그래서 긴 문서를 넣고 짧은 답을 받는 요약·분류 작업과, 짧은 질문에 긴 코드를 받는 생성 작업은 같은 모델이라도 실제 비용이 완전히 달라요.

다음으로 추론 모델의 '숨은 토큰'이에요. 요즘 대부분의 최신 모델이 지원하는 '생각하기(thinking)' 모드는 답을 내기 전에 내부적으로 긴 사고 과정을 생성하는데, 이게 전부 출력 토큰으로 과금돼요. 표면 가격은 싸 보이는데 실제 청구서는 몇 배가 나오는 이유가 이거예요. 벤치마크 점수만 보고 고르면 이 부분에서 크게 당할 수 있어요.

그리고 프롬프트 캐싱과 배치 할인이 있어요. 같은 시스템 프롬프트나 문서를 반복해서 넣는 구조라면 캐시된 입력은 정가의 10분의 1에서 절반 수준까지 싸지고, 실시간 응답이 필요 없는 작업은 배치 API로 절반 값에 돌릴 수 있어요. 이런 걸 감안하면 표에서 2위였던 모델이 실제로는 1위가 되기도 해요.

마지막으로 오픈 웨이트 모델은 '누가 서빙하느냐'에 따라 가격이 달라요. 같은 라마(Llama)나 큐원(Qwen) 모델도 그로크(Groq), 투게더(Together), 파이어웍스(Fireworks) 같은 업체마다 값과 속도가 다르고, 직접 GPU를 빌려 돌리면 또 다른 계산이 돼요.

벤치마크는 어디까지 믿어야 하나

이런 사이트가 '성능'이라고 부르는 건 결국 공개 벤치마크 점수예요. 아티피셜 애널리시스(Artificial Analysis) 같은 곳이 여러 시험을 합쳐 만든 종합 지수, 사람들의 블라인드 투표로 순위를 매기는 LM아레나(LMArena), 실제 깃허브 이슈를 고치게 하는 SWE-bench 같은 것들이죠. 이 점수들은 방향은 맞지만, 여러분의 작업과는 다를 수 있어요. 수학 문제를 잘 푸는 모델이 고객 상담 톤을 잘 맞추는 건 아니고, 영어 코딩 벤치마크 1위가 한국어 문서 분류에서도 1위란 보장은 없거든요.

그래서 실무에서는 이런 사이트를 '후보 목록을 줄이는 도구'로 쓰는 게 맞아요. 프런티어 위의 모델 서너 개를 고른 뒤, 여러분 서비스의 실제 입력 100~200개로 직접 평가 세트를 만들어 돌려보는 거죠. 이 과정을 자동화해 두면 새 모델이 나올 때마다 30분이면 갈아탈지 판단할 수 있어요.

한국 개발자에게 주는 시사점

한국어를 다루는 서비스라면 한 가지를 더 신경 써야 해요. 바로 토큰 효율이에요. 같은 내용을 담은 문장이라도 한국어는 영어보다 토큰 수가 더 많이 나오는 경우가 흔해요. 모델의 토크나이저(문장을 토큰 단위로 쪼개는 방식)가 영어 중심으로 만들어졌기 때문인데, 그러면 '100만 토큰당 가격'이 같아도 한국어 처리 비용은 더 비싸지는 거예요. 최근 나온 모델들은 다국어 토크나이저가 많이 좋아졌지만, 모델별로 여러분의 한국어 데이터를 실제로 토큰화해서 개수를 비교해 보는 게 좋아요.

또 하나, 예산별 비교 사이트에는 보통 해외 모델만 올라와요. 업스테이지 솔라, 네이버 하이퍼클로바X, LG 엑사원, 카카오 카나나 같은 국내 모델은 한국어 성능이나 국내 리전 데이터 처리 같은 별도의 장점이 있는데, 이런 건 글로벌 벤치마크 표에 잡히지 않아요. 여러분만의 평가 세트에 이 모델들도 같이 넣어 보세요.

실무 팁으로 하나 더 드리자면, 모델을 하나만 고르려 하지 마세요. 분류·추출·간단한 요약처럼 쉬운 작업은 저가 구간 모델로, 복잡한 추론이나 코드 생성은 상위 모델로 나눠 보내는 '모델 라우팅' 구조를 처음부터 잡아 두면, 프런티어가 움직일 때 설정값 하나만 바꾸면 되거든요.

정리하면

LLM 선택은 한 번 하고 끝나는 결정이 아니라, 매주 다시 봐야 하는 살아 있는 비용·성능 곡선 위의 위치 선택이에요. 예산별 최고 모델 같은 사이트로 후보를 줄이고, 여러분의 데이터로 직접 검증하고, 갈아타기 쉬운 구조를 만들어 두는 게 핵심이에요.

여러분 팀은 지금 어떤 기준으로 모델을 고르고 있나요? 그리고 마지막으로 모델을 바꾼 게 언제였는지, 그때 뭘 보고 결정하셨는지 궁금해요.


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://bestmodelforyourbudget.terrydjony.com/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...