TECH 으로 돌아가기
TECH HACKER NEWS 오늘 5분 읽기 21 READS

클로드 오퍼스 5.5, 지능 지수 58점… 성능 대가로 비용·토큰 부담 커졌다

클로드 오퍼스 5.5, 지능 지수 58점… 성능 대가로 비용·토큰 부담 커졌다
SOURCE IMAGE · HACKER NEWS

인공지능 모델 벤치마크 기관 아티피셜 애널리시스(Artificial Analysis)가 앤스로픽의 신형 모델 '클로드 오퍼스 5.5'에 대한 분석을 공개했다. 2026년 9월 22일 출시된 이 모델은 확장된 추론(chain-of-thought)을 활용해 답을 내기 전에 문제를 단계적으로 풀어나가는 이른바 추론형(reasoning) 모델이며, 이번 분석은 '적응형 추론·최대 노력(Max Effort)' 설정을 기준으로 삼았다. 텍스트와 이미지를 입력받아 텍스트를 출력하는 멀티모달 구조이고, 컨텍스트 윈도우는 100만 토큰에 이른다.

핵심 지표인 아티피셜 애널리시스 인텔리전스 인덱스(v4.3.2)에서 오퍼스 5.5는 58점을 기록했다. 비슷한 가격대 추론 모델의 중앙값이 25점인 점을 감안하면 상당히 높은 수준이다. 이 지수는 단일 시험이 아니라 실무형 에이전트 과제(AA-Briefcase), 전문 문서 추론(GDPval-AA), 스프레드시트·문서 정량 분석, 터미널 작업(Terminal-Bench 4.0), 과학 코딩(SciCode), 고난도 지식 문제(Humanity's Last Exam), 지식 신뢰도·환각 측정(AA-Omniscience) 등 여러 평가를 가중 합산한 복합 점수다. 따라서 58점이라는 숫자는 특정 기능이 아니라 추론·지식·수학·코딩 전반에 걸친 종합 능력으로 해석하는 편이 타당하다.

성능은 상위권, 가격은 평균 이상

가격 측면에서는 부담이 늘었다. 오퍼스 5.5의 API 요금은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로, 각각 중앙값(2달러, 10달러)의 두 배다. 캐시 적중·입력·출력을 7:2:1 비율로 섞은 혼합 단가는 100만 토큰당 2.94달러로 계산된다. 이미 처리한 프롬프트를 재사용하는 캐시 적중 가격은 일반 입력가보다 크게 저렴하지만, 캐시 쓰기와 저장은 별도로 과금되고 공급사마다 조건이 다르다는 점은 실제 비용 산정에서 놓치기 쉬운 대목이다.

주목할 부분은 토큰 소모량이다. 오퍼스 5.5는 인텔리전스 인덱스 평가를 수행하면서 2억 6천만 개의 출력 토큰을 생성했는데, 이는 유사 가격대 모델 중앙값인 8천8백만 개를 크게 웃도는 수치다. 추론 모델 특성상 답을 내기까지 생각 과정을 길게 펼치기 때문인데, 이런 장황함은 곧바로 비용으로 이어진다. 실제로 이 벤치마크 한 번을 돌리는 데만 8,708.20달러가 들었다고 아티피셜 애널리시스는 밝혔다. 높은 출력 단가와 많은 토큰 생성이 겹치면서 비용 부담이 배가된 셈이다.

실무 도입 시 따져야 할 지점

국내 실무자 관점에서 이 분석이 시사하는 바는 분명하다. 오퍼스 5.5는 대량 문서를 다루는 RAG 워크플로나 복잡한 에이전트 작업처럼 지능이 결과 품질을 좌우하는 영역에서 유리하다. 100만 토큰 컨텍스트는 방대한 사내 문서나 코드베이스를 한 번에 밀어 넣고 검색·추론시키는 용도에 적합하다. 다만 단순 분류나 요약처럼 난도가 낮은 반복 작업에까지 이 모델을 쓰면 토큰 소모와 출력 단가가 그대로 청구서로 돌아온다. 응답당 토큰이 평균보다 많다는 점을 감안해, 추론 강도(effort) 설정을 조정하거나 저비용 모델과 역할을 나누는 계층적 구성이 현실적인 대안이 될 수 있다.

비용 최적화 측면에서는 캐시 적중 활용이 관건이다. 시스템 프롬프트나 반복 참조 문서처럼 고정된 입력이 많은 서비스라면 캐시 설계만으로도 실효 단가를 눈에 띄게 낮출 수 있다. 다만 모델은 API로만 제공되는 독점 모델로, 가중치나 파라미터 규모는 공개되지 않았다. 온프레미스 배포나 파인튜닝이 필요한 조직에는 선택지가 되기 어렵다는 뜻이다. 현재 5개 API 공급사를 통해 제공되므로, 도입 전 공급사별 성능과 캐시 과금 정책을 비교해 두는 편이 좋다.

정리하면 오퍼스 5.5는 '지능은 확실히 상위권이지만 값은 그만큼 치른다'는 전형적인 고성능 추론 모델의 위치에 있다. 벤치마크 점수 자체보다, 자사 워크로드에서 이 지능이 실제로 비용을 정당화하는지를 파일럿으로 검증하는 절차가 도입 판단의 핵심이 될 것이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://artificialanalysis.ai/models/claude-opus-5-5
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...