TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 28 READS

초당 770토큰 찍은 머큐리 2.5, 속도와 지능의 맞교환을 다시 묻다

초당 770토큰 찍은 머큐리 2.5, 속도와 지능의 맞교환을 다시 묻다
SOURCE IMAGE · HACKER NEWS

인셉션(Inception)이 2026년 9월 8일 공개한 언어모델 머큐리(Mercury) 2.5가 초당 770토큰이라는 출력 속도로 눈길을 끌고 있다. 벤치마크 분석 기관 아티피셜 애널리시스(Artificial Analysis)의 측정에 따르면 이 모델은 인셉션의 자체 API 기준으로 초당 770.4토큰을 생성하는데, 이는 비슷한 가격대의 추론 모델 중앙값인 108.6토큰의 일곱 배에 달하는 수치다. 흥미로운 점은 머큐리 2.5가 답을 내기 전에 사고 과정을 거치는 이른바 추론(reasoning) 모델이라는 사실이다. 통상 추론 모델은 내부적으로 생각을 길게 이어가느라 응답이 느린 편인데, 머큐리 2.5는 그 범주에 속하면서도 압도적인 처리 속도를 보였다.

지능은 평균 이하, 속도는 압도적

다만 속도가 모든 것을 말해주지는 않는다. 머큐리 2.5의 아티피셜 애널리시스 지능 지수(Intelligence Index) 점수는 12점으로, 유사 가격대 모델의 중앙값인 13점에 못 미치는 평균 이하 수준이다. 이 지수는 v4.3.2 기준으로 추론, 지식, 수학, 코딩을 아우르는 복합 벤치마크로, AA-Briefcase, Terminal-Bench 4.0, SciCode, Humanity's Last Exam 등 여러 평가를 가중 합산해 산출한다. 즉 머큐리 2.5는 지능 자체로는 경쟁 모델 대비 특출나지 않지만, 같은 답을 훨씬 빨리 내놓는 데 강점이 있는 모델이라고 이해하는 편이 정확하다.

주목할 만한 또 다른 특성은 간결함이다. 지능 지수 평가를 수행하는 과정에서 머큐리 2.5가 생성한 출력 토큰은 35M(3,500만)에 그쳤는데, 이는 중앙값인 85M(8,500만)을 크게 밑돈다. 추론 모델이면서도 사고 과정과 답변에 불필요하게 많은 토큰을 소모하지 않았다는 뜻이다. 토큰 단위로 과금되는 실무 환경에서 이런 간결함은 곧 비용 절감으로 직결된다.

가격 구조와 실제 부담

가격은 100만 입력 토큰당 0.25달러, 100만 출력 토큰당 0.75달러로 책정됐다. 입력 가격은 중앙값(0.25달러)과 같고 출력 가격은 중앙값(0.90달러)보다 낮아 전반적으로 무난하거나 유리한 편이다. 캐시 적중, 입력, 출력을 7 대 2 대 1 비율로 섞은 혼합 단가로 환산하면 100만 토큰당 약 0.14달러 수준이다. 지능 지수 평가 한 작업을 돌리는 데 드는 평균 비용은 0.06달러로 계산됐다. 앞서 언급한 낮은 토큰 소모량과 맞물려, 대량 처리 시 실제 청구 금액을 억제하는 데 유리한 조합이다.

한편 첫 토큰이 나오기까지 걸리는 시간(TTFT)은 2.95초로, 유사 가격대 추론 모델 중앙값인 2.23초보다 다소 길다. 추론 모델의 TTFT에는 답을 내기 전의 사고 시간이 포함되므로, 응답이 시작되기까지의 초기 지연은 경쟁 모델보다 약간 크다는 의미다. 그러나 일단 생성이 시작되면 초당 770토큰의 속도로 빠르게 결과를 쏟아내기 때문에, 500토큰 안팎의 실질적인 응답을 받는 총 소요 시간 관점에서는 초기 지연을 상쇄하고도 남을 가능성이 크다.

스펙과 한계

머큐리 2.5의 컨텍스트 윈도는 26만 토큰이다. 입력과 출력을 합친 한 번의 요청에서 이만큼의 텍스트와 대화 이력을 처리할 수 있어, 대규모 문서를 다루는 검색 증강 생성(RAG) 워크플로에 활용할 여지가 있다. 다만 입력과 출력이 모두 텍스트로 한정되며, 이미지 입력은 지원하지 않는 순수 텍스트 모델이다. 멀티모달을 전제로 한 파이프라인에는 그대로 적용하기 어렵다는 점을 염두에 둬야 한다.

모델의 성격상 명확한 제약도 있다. 머큐리 2.5는 가중치가 공개되지 않은 독점(proprietary) 모델이며, 인셉션은 파라미터 규모나 모델 크기를 밝히지 않았다. 또한 현재 API로 제공하는 사업자가 한 곳뿐이어서, 다중 공급자를 통한 가격 협상이나 장애 대비 이중화 같은 운영 전략을 짜기에는 선택지가 좁다. 결국 머큐리 2.5는 최고 수준의 지능이 필요한 작업보다는, 적당한 품질을 매우 빠르고 저렴하게 대량으로 처리해야 하는 실무 시나리오에서 진가를 발휘할 후보로 보인다. 속도와 비용을 우선순위에 둔 팀이라면 실제 워크로드로 직접 검증해 볼 만하다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://artificialanalysis.ai/models/mercury-2-5
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...