단가 그대로 작업당 최대 30% 저렴
Claude Sonnet 5.5가 토큰을 덜 쓰는 쪽으로 갔다
Anthropic이 9월 28일 Claude Sonnet 5.5를 내놨다. 100만 토큰당 입력 2달러, 출력 10달러로 Sonnet 5와 같다. 출력은 30% 이상 빨라졌고 같은 작업에 드는 비용은 최대 30% 줄었다.
Anthropic이 9월 28일 Claude Sonnet 5.5를 공개했다. 모델 ID는 claude-sonnet-5-5다. 100만 토큰당 가격은 입력 2달러, 출력 10달러, 캐시 읽기 0.20달러로 Sonnet 5와 똑같다. 단가는 안 움직였고 움직인 건 한 작업에 쓰는 토큰의 양이다.
Anthropic은 출력 속도가 Sonnet 5보다 30% 이상 빨라졌고 같은 작업에 드는 비용이 최대 30% 줄었다고 밝혔다. 가격표를 내리지 않고 청구서를 내린 셈이다. Claude Platform과 AWS, Google Cloud, Microsoft Azure에서 바로 쓸 수 있고 데이터를 저장하지 않는 옵션도 있다. Claude Haiku 5.5는 "몇 주 안에" 나온다고 예고됐다.
한 줄 정리
Sonnet 5.5는 단가를 그대로 두고 토큰 사용량을 줄여 실제 작업 비용을 깎았고, 그 덕에 월말 청구서를 예측하기가 쉬워진다.
한눈에 보기
| 항목 | Sonnet 5 | Sonnet 5.5 |
|---|---|---|
| 입력 (100만 토큰) | 2달러 | 2달러 |
| 출력 (100만 토큰) | 10달러 | 10달러 |
| 출력 속도 | 기준 | 30% 이상 빠름 |
| 작업당 비용 | 기준 | 최대 30% 저렴 |
| 컴퓨터 사용 (OSWorld 2.1) | 57.0% | 80.1% |
| 지식노동 (GDPval-AA v2.1) | 1449 | 1844 |
단가표에서 작업표로
모델 가격을 비교할 때 다들 100만 토큰당 단가를 본다. 팀에서 실제로 내는 돈은 단가에 토큰 수를 곱한 값이다. 같은 보고서를 만드는 데 모델 A가 5만 토큰을 쓰고 모델 B가 3만 토큰을 쓰면 단가가 같아도 B가 싸다. Sonnet 5.5는 이 곱셈의 뒤쪽을 줄였다.
이 차이는 에이전트처럼 여러 단계를 돌리는 작업에서 커진다. 단계마다 생각하고 도구를 부르고 결과를 다시 읽는 구조라 토큰이 눈덩이처럼 붙는다. 한 단계에서 10% 아낀 게 열 단계를 거치면 훨씬 큰 폭이 된다.
컴퓨터 사용이 실무 수치에 가까워졌다
눈에 띄는 건 컴퓨터 사용 벤치마크다. OSWorld 2.1이 57.0%에서 80.1%로 올랐다. 화면을 보고 클릭하고 입력해서 실제 업무를 처리하는 능력을 재는 지표다. 사람이 하던 스프레드시트 정리, 관리자 화면 입력, 슬라이드 수정 같은 일을 맡길 수 있는 문턱에 가까워졌다는 뜻이다.
지식노동 지표인 GDPval-AA는 1449에서 1844로 올랐다. 문서와 슬라이드, 시트를 만드는 일에서 이전 세대보다 눈에 띄게 좋아졌다는 Anthropic의 주장이다. 벤치마크는 제작사가 고른 조건이라 우리 업무에서 같은 폭으로 오른다고 볼 수는 없다. 다만 방향은 분명하다.
안전장치도 함께 왔다
Sonnet 5.5는 Opus 5.5와 비슷한 사이버 보안 안전장치를 처음으로 탑재한 Sonnet이다. 추론 과정을 빼내는 시도를 막는 분류기도 처음 붙었다. 팀에 코딩 에이전트를 붙일 때 가장 마음에 걸리는 부분이 보안 사고인데 중급 모델에도 그 방어선이 내려왔다.
anyAX 관점
이번 발표에서 챙길 숫자는 벤치마크가 아니라 "단가 동일, 작업당 최대 30% 절감"이다. 월 500달러를 Sonnet 계열 API에 쓰는 콘텐츠 에이전시라면 모델 교체만으로 이론상 150달러가 남는다. 프롬프트도 워크플로도 안 건드리고 모델 ID 한 줄을 바꾼 대가다.
그래서 이번 주에 할 일은 새 기능 탐색이 아니다. 지금 돌리는 자동화 중 토큰을 가장 많이 먹는 것 하나를 골라 5.5로 바꿔 돌려 보고 작업당 비용을 재 보는 것이다. 청구서 화면에서 모델별 사용량을 처음 열어 보는 팀이 많다. 절감폭은 팀마다 다르게 나오고 그 숫자가 다음 예산 회의의 근거가 된다.
반대편 위험도 있다. 모델이 싸고 빨라지면 쓸 필요 없던 곳에도 붙이게 된다. 분류나 단순 요약까지 중급 모델에 맡기던 습관은 5.5에서도 그대로 낭비다. 작업마다 어느 등급이 맞는지 정해 두는 쪽이 모델 교체보다 큰 절약이다.