TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 18 READS

클로드 오퍼스 5.5, 성능은 올리고 운영비는 40% 낮췄다

클로드 오퍼스 5.5, 성능은 올리고 운영비는 40% 낮췄다
SOURCE IMAGE · HACKER NEWS

앤스로픽이 새로운 클로드 5.5 계열의 첫 모델인 클로드 오퍼스 5.5를 공개했다. 회사가 강조하는 핵심은 두 가지다. 에이전트형 코딩과 지식 노동에서 기존 오퍼스 5를 앞서는 성능을 내면서도, 일반적인 워크로드 기준으로 운영 비용은 40% 낮췄다는 점이다. 입력·출력 토큰 가격은 100만 토큰당 각각 4달러와 20달러로 오퍼스 5보다 20% 저렴하고, 에이전트·코딩 작업 비용의 대부분을 차지하는 캐시 읽기는 100만 토큰당 0.20달러로 60% 낮아졌다. 토큰당 단가가 내려간 데다 같은 작업을 더 적은 토큰으로 처리하기 때문에, 두 요소가 합쳐져 40%의 비용 절감으로 이어진다는 설명이다. 출력 속도도 오퍼스 5보다 30% 이상 빨라졌다.

긴 작업에서 드러나는 효율

오퍼스 5.5가 특히 강점을 보이는 영역은 코드베이스 전체를 훑는 대규모 마이그레이션과 감사처럼 길고 산만하게 이어지는 작업이다. 한 초기 테스터는 68만 줄 규모의 코드 마이그레이션을 하루도 안 되는 시간에 끝냈는데, 이는 엔지니어링 팀이 몇 주를 들여야 할 분량이라고 한다. 또 다른 테스터는 20만 줄 코드베이스를 3시간 이내에 감사하고 수정했으며, 같은 작업에 오퍼스 5는 20시간 넘게 걸리고 토큰도 2.5배 더 소비했다. 앤스로픽 내부 테스트에서는 웹 트래픽 부하 분산 소프트웨어인 HAProxy를 C에서 러스트로 다시 작성하도록 시켰는데, 오퍼스 5.5는 9.5시간 만에 끝내 12시간이 걸린 비교 모델보다 빠르고 비용은 51% 저렴했다. 두 결과 모두 HAProxy 자체 회귀 테스트를 거의 통과했다.

벤치마크 수치도 이런 방향을 뒷받침한다. 커맨드라인 작업을 다루는 터미널벤치 4.0에서 기본 설정의 오퍼스 5.5는 최대 설정의 오퍼스 5를 약 5분의 1 비용으로 앞섰다. 코드 변경이 실제로 병합될 만한 수준인지 평가하는 프론티어코드에서는 기본(중간) 설정으로 54.6%를 기록해 모든 모델 중 가장 높았다. 실제 커서 세션에서 뽑은 모호하고 다중 파일에 걸친 과제를 다루는 커서벤치에서도 52.5%로 오퍼스 5(46.6%)를 웃돌았다. 다만 앤스로픽은 이 정도 성능 구간에서는 벤치마크 격차가 실제 체감 차이를 그대로 반영하지 않는다는 점을 스스로 인정하며, 자사 최상위 모델과의 실사용 격차는 점수가 시사하는 것보다 좁다고 덧붙였다.

안전성과 방어력 강화

오퍼스 5.5는 앤스로픽이 '프런티어 속도 조절'을 요청한 이후 처음 내놓은 모델로, 출시 전 프런티어 디자인과 METR 같은 외부 평가 기관의 검증을 거쳤다. 회사가 운영하는 가장 포괄적인 정렬 테스트인 자동화 행동 감사에서 지금까지 시험한 모델 중 가장 좋은 점수를 받았다고 한다. 되돌리기 어려운 행동을 취하거나 주어진 경계 밖으로 벗어날 가능성이 최근 모델들보다 낮고, 프롬프트 인젝션 저항성도 오퍼스 5보다 높다. AI 보안 기업 그레이 스완이 진행한 벤치마크에서는 프롬프트 인젝션 성공률이 가장 낮은 수준을 기록했다. 앤스로픽은 정렬 테스트를 긴 작업, 불가능한 작업, 실제 사고를 본뜬 시나리오까지 넓혔지만 여전히 한계가 있다고 밝혔다.

생물학과 사이버보안 영역에서의 역량이 높아진 만큼, 앤스로픽은 자사 최상위 모델에 적용하던 수준의 안전장치를 함께 배포한다. 검증된 조직은 생명과학 검증 프로그램을 통해 생물학 연구용으로 신청할 수 있고, 사이버 검증 프로그램도 수 주 내로 확대해 검증된 실무자가 사용할 수 있게 할 계획이다. 주목할 만한 점은 벤치마크 평가 당시 안전장치가 개입한 경우 사이버보안 과제는 오퍼스 4.8이, 생물학·프런티어 LLM 개발 과제는 오퍼스 5가 대신 수행했다는 것이다. 앤스로픽은 이 조치가 오퍼스 5.5의 벤치마크 점수를 다소 낮췄을 것이라고 설명했다.

실무 적용의 의미와 한계

초기 도입 기업들의 후기는 대체로 토큰 효율과 단계 축소에 집중된다. 한 기업은 기존에 나흘간 38번의 프롬프트가 필요했던 복잡한 코딩 작업이 3시간에 11번으로 줄었다고 전했고, 또 다른 투자사는 에이전트형 코딩 과제에서 오퍼스 5와 비슷한 품질을 절반가량의 시간·토큰으로 달성해 비용을 40~50% 절감했다고 밝혔다. 여섯 개 저장소에 걸친 대형 엔지니어링 작업을 18시간 넘게 무인으로 수행했다는 사례, 하위 에이전트에 위임하고 스스로 결과를 검증하는 능력이 향상됐다는 평가도 나왔다. 조사·분석 영역에서도, 실적 자료를 찾기 어렵게 만든 웹 사본에서 보고서를 작성하게 한 내부 테스트에서 18건 중 16건이 품질 기준을 통과했다.

다만 이런 수치를 실무에 그대로 대입하기 전에 맥락을 살필 필요가 있다. 상당수 성능·효율 비교는 앤스로픽 내부 평가이거나 자피어, 월아이 캐피털 같은 초기 접근 파트너가 자체 조건에서 측정한 값이다. 터미널벤치 4.0은 표준오차가 ±2.6포인트 수준이라 근소한 점수 차는 노이즈 범위 안에 들 수 있고, 자피어의 자동화 벤치마크는 폴백 모델 없이 돌려 안전장치 개입을 실패로 처리했기 때문에 실제 성능보다 점수가 낮게 나왔다. 클로드 코드와 클로드 플랫폼에서는 최대 2.5배 속도의 패스트 모드도 제공되지만, 이는 100만 토큰당 입력 8달러·출력 40달러로 별도 가격이 붙는다. 한국 실무자 입장에서는 홍보성 수치보다 자신의 워크로드에서 캐시 적중률과 반복 단계가 실제로 얼마나 줄어드는지를 직접 측정해 비용 대비 효과를 판단하는 편이 합리적이다. 소넷 5.5와 하이쿠 5.5는 수 주 내로 뒤이어 공개될 예정이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.anthropic.com/claude-opus-5-5
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...