TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 25 READS

클로드 소넷 5.5, 더 빠르고 저렴해진 '일상 업무용' 모델의 등장

클로드 소넷 5.5, 더 빠르고 저렴해진 '일상 업무용' 모델의 등장
SOURCE IMAGE · HACKER NEWS

앤트로픽이 클로드 5.5 제품군의 두 번째 모델로 클로드 소넷 5.5를 공개했다. 회사 설명에 따르면 이 모델은 이전 세대인 소넷 5를 전반적으로 개선했고, 생성 속도는 30% 이상 빨라졌으며 대부분의 작업에서 작업당 비용은 최대 30%까지 낮아졌다. 함께 발표된 상위 모델 오퍼스 5.5가 신중한 판단이 필요한 복잡한 업무를 겨냥한다면, 소넷 5.5는 범위가 명확한 일상적 작업, 버그 수정, 문서·슬라이드·스프레드시트 제작 같은 실무형 과제에 강점을 두도록 자리매김됐다. 대량·비용 민감형 애플리케이션을 위한 클로드 하이쿠 5.5는 몇 주 안에 합류할 예정이다.

주목할 점은 성능과 비용의 관계다. 소넷 5.5는 가격 구조 자체는 소넷 5와 동일하다. 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러, 캐시 읽기 100만 개당 0.20달러다. 그런데도 작업당 비용이 낮아진 이유는 같은 일을 처리하는 데 훨씬 적은 토큰을 쓰기 때문이다. 즉 단가가 아니라 효율에서 절감이 발생한다. 이는 API 비용을 토큰 단위로 계산해 온 실무자에게 중요한 구분이다. 벤치마크 이름값보다 '작업당 총 토큰'과 '작업당 비용'을 기준으로 모델을 비교해야 실제 청구서에 가까운 판단을 할 수 있다는 뜻이기 때문이다.

코딩에서 두드러지는 도약

성능 개선은 코딩 영역에서 특히 두드러진다. 에이전트형 코딩 평가인 터미널-벤치 4.0에서 소넷 5.5는 70.6%를 기록해 소넷 5의 10.3%를 크게 앞섰다. 코드 변경이 실제로 병합될 만한지 측정하는 프론티어코드에서는 같은 노력 설정 기준으로 소넷 5보다 10점 높은 점수를 약 15분의 1 수준의 작업당 비용으로 달성했다고 한다. 실제 커서 세션에서 뽑은 모호한 다중 파일 과제를 다루는 커서벤치에서는 최고 점수가 오퍼스 5.5와 약 2점 차이까지 좁혀졌다. 초기 테스터들은 소넷 5.5가 코드베이스를 빠르게 파악하고, 도구 호출을 묶어서 처리해 단계 수와 비용을 줄였다는 점을 공통적으로 언급했다.

이런 효율은 여러 파트너사의 실측 수치로도 뒷받침된다. 한 금융 분야 테스트에서는 답변당 약 12만1000 토큰을 사용해 소넷 5의 49만7000 토큰과 큰 차이를 보였고, 다른 고객 지원 사례에서는 티켓 처리 속도가 20% 빨라졌다. 유니티는 런타임에서 실제 동작 여부까지 검증하는 까다로운 기준에서 다단계 과제의 90%를 완료했다고 밝혔다. 118개 실제 앱 빌드 테스트에서는 소넷 5.5가 빌드당 평균 3.6회 반복으로 오퍼스 5와 대등한 결과를 냈는데, 오퍼스 5는 같은 수준에 7.7회가 걸렸다는 비교도 제시됐다.

지식 업무와 협업 능력

코딩 밖의 지식 업무에서도 진전이 보인다. 44개 직업군과 9개 주요 산업의 실제 과제를 다루는 GDPval-AA에서 소넷 5.5는 오퍼스 5.5에 거의 근접한 점수를 냈고 소넷 5보다 약 400점 높았다. 컴퓨터 사용과 차트 인식에서 상위 모델에 가까웠으며, 화면 스크린샷만으로 포켓몬 레드를 클리어한 첫 소넷 모델이라는 점도 장기 과제 수행 능력을 보여주는 사례로 소개됐다. 초기 테스터들은 수치화하기 어려운 개선, 즉 더 자연스러운 대화와 UI 디자인 감각, 슬라이드 템플릿을 따라 손질이 거의 필요 없는 자료를 만드는 능력을 강조했다. 실제로 공개 기업의 분기 실적 자료와 콜 녹취록에 템플릿을 주고 10장짜리 운영 리뷰를 요청했을 때, 두 전문가가 첫 초안을 그대로 보낼 수 있는 수준으로 판단했다는 내부 테스트도 공개됐다.

노력(effort) 설정은 이 모델을 실무에 붙일 때 핵심 조정 손잡이다. 클로드 코드와 앱에서는 기본값이 미디엄, 클로드 플랫폼에서는 하이로 설정돼 있다. 낮은 설정에서는 더 빠르게 답하고 토큰을 적게 써 정형 업무에 적합하고, 높은 설정에서는 더 오래 추론하며 결과를 더 꼼꼼히 점검한다. 여러 벤치마크에서 소넷 5.5는 로우나 미디엄 설정만으로도 소넷 5의 최고 점수를 약 10분의 1 비용에 넘어섰다. 반대로 높은 설정에서는 오퍼스 5.5와 비슷한 수준의 성능을 비슷한 비용에 낼 수 있다고 한다. 결국 같은 모델을 두고도 설정에 따라 비용과 품질의 균형점을 옮길 수 있는 셈이다.

안전장치와 한계

안전 측면에서 눈에 띄는 변화는 사이버보안이다. 소넷 5.5의 사이버 역량이 크게 향상돼 오퍼스 5.5에 준하는 안전장치를 달고 출시됐다. 일상적 소프트웨어 개발에서 버그를 찾고 고치는 작업은 그대로 가능하지만, 위험도가 높은 사이버보안 과제는 눈에 보이게 소넷 5로 폴백된다. 생물학 관련 안전장치는 소넷 5와 동일하며, 두 안전장치 모두 좁은 범위의 고위험 요청만 겨냥하므로 일반적인 개발과 대부분의 생명과학 업무에는 영향이 없다는 설명이다. 약 1850개 시나리오를 다루는 자동 행동 감사에서는 대부분의 정렬 지표에서 소넷 5를 개선하거나 동등한 결과를 보였다.

다만 회사 스스로 밝히듯 소넷 5.5는 모델 역량의 프론티어를 밀어 올리는 모델은 아니다. 여러 평가에서 최대 노력 설정 시 오퍼스 5.5에 필적하는 결과가 나오지만, 앤트로픽과 외부 테스터 모두 지속적 판단이 필요한 복잡하고 열린 과제에서는 오퍼스 5.5가 여전히 뚜렷하게 앞선다고 평가했다. 벤치마크 점수가 모델의 한 단면만 보여준다는 단서도 함께 달렸다. 실무자 입장에서 현실적인 결론은 분업이다. 아키텍처 설계나 판단이 무거운 작업은 상위 모델에 맡기고, 그 틀 안에서의 구현·수정·문서화처럼 범위가 분명한 반복 작업에는 빠르고 저렴한 소넷 5.5를 배치하는 조합이 비용과 속도 면에서 합리적인 선택이 될 것으로 보인다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.anthropic.com/claude-sonnet-5-5
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...