본문으로 건너뛰기
CoderRed Blog

Article

Claude Sonnet 5.5 출시: 가격은 그대로인데 작업당 비용은 왜 갈릴까

오늘 아침 트롤링의 Sonnet 5.5 출시 소식을 보다가 숫자 두 개에서 멈췄습니다. 출력은 30% 이상 빨라지고, 작업당 비용은 최대 30% 줄었다고 하더라고요. “그럼 이제 일상 코딩은 Sonnet으로 돌리면 되는 건가?”

그런데 Anthropic의 발표와 Artificial Analysis의 독립 평가를 나란히 놓으니 답이 조금 달라졌습니다. 토큰 단가는 Sonnet 5와 같고, 추론 강도를 max까지 올린 평가에서는 오히려 작업당 토큰 사용량이 컸거든요. 저는 이번 모델을 속도와 비용을 함께 조절할 수 있는 Sonnet으로 봤습니다.

핵심은 세 가지예요.

  • Anthropic이 말한 30% 이상은 출력 생성 속도이고, 최대 30% 절감은 회사 자체 테스트의 작업당 비용입니다. API 토큰 단가는 Sonnet 5와 같습니다.
  • 공식 Terminal-Bench 4.0에서는 Sonnet 5.5가 Opus 5.5보다 높지만, 추론 강도·안전장치 전환·표본 오차를 함께 봐야 합니다.
  • 독립 평가에서 max는 강력한 대신 비쌌습니다. 같은 Sonnet 5.5도 medium과 max의 과제당 비용 차이가 큽니다.
지구가 보이는 창 위에 Claude Sonnet 5.5 이름이 놓인 Anthropic 공식 출시 이미지
Anthropic의 Claude Sonnet 5.5 출시 이미지
Sonnet 5.5는 2026년 9월 28일 공개됐습니다. 이미지 출처: https://www.anthropic.com/claude-sonnet-5-5

30% 저렴하다는데 가격표는 왜 그대로일까요?

공식 가격표에서 Sonnet 5.5는 Sonnet 5와 같은 입력 $2, 출력 $10, 캐시 읽기 $0.20입니다. 모두 100만 토큰당 API 요금이에요. 비교 대상인 Opus 5.5는 입력 $4·출력 $20이지만 캐시 읽기는 $0.20으로 같습니다. 캐시 쓰기는 Sonnet 5.5가 $2.50, Opus 5.5가 $5입니다.

Anthropic이 말한 “최대 30% 저렴"은 같은 일을 할 때 Sonnet 5보다 토큰을 덜 쓰는 자체 테스트의 작업당 비용입니다. “30% 이상 빠르다"는 수치도 출력 생성 속도를 Sonnet 5와 비교한 결과예요. 대기 시간이나 모든 프로젝트의 청구액이 똑같이 그만큼 줄어든다는 뜻으로 읽으면 계산이 달라집니다.

제 기준에서 더 중요한 건 어떤 추론 강도로 일을 끝냈느냐입니다. Artificial Analysis가 공개한 Sonnet 5.5 평가에서는 동일한 Intelligence Index 평가 묶음의 가중 평균 과제당 비용이 이렇게 갈립니다.

추론 강도AA 점수AA 과제당 비용
medium41$0.59
high47$1.08
xhigh52$2.74
max56$7.60

이 비용은 AA가 평가 과제의 입력·캐시·추론·답변 토큰을 합산한 벤치마크 과제당 비용입니다. 일반적인 코드 수정 한 건의 요금은 작업과 설정에 따라 달라져요. medium에서 max로 올리면 점수는 15점 높아졌지만, 이 평가의 과제당 비용은 약 13배였습니다.

Artificial Analysis 평가의 과제당 출력 토큰 비교. Sonnet 5.5 max 19만 3천 개, Opus 5.5 max 11만 9천 개, Sonnet 5 max 11만 8천 개
AA 평가에서 Sonnet 5.5 max의 출력 토큰이 가장 많았습니다
AA 원본 그래프의 오른쪽 구간을 발췌했습니다. Intelligence Index 과제당 출력량의 가중 평균이며, 일반적인 개발 작업의 사용량은 작업마다 달라져요. 원본 그래프: https://artificialanalysis.ai/articles/claude-sonnet-5-5

AA의 독립 측정에서 Sonnet 5.5 max는 평가 과제당 출력 토큰을 약 19만 3천 개 썼습니다. Opus 5.5 max의 약 11만 9천 개보다도 많았어요. AA는 Sonnet 5.5의 점수 56이 Opus 5.5의 58에 근접했지만, 높은 추론 강도에서는 비용 대비 점수가 뒤처진다고 정리했습니다. 이 수치는 여러 평가 과제의 가중 평균으로, 개별 응답의 출력 길이와 구분해야 합니다.

Terminal-Bench에서 Opus를 넘었다는 말은 어디까지 맞을까요?

Anthropic의 공식 Terminal-Bench 4.0 점수는 Sonnet 5.5 70.6%, Opus 5.5 66.4%입니다. Sonnet 5는 10.3%였고요. CursorBench 4.0은 Sonnet 5.5 55.5%, Opus 5.5 57.8%로 순서가 바뀝니다. 지식 업무 평가인 GDPval-AA도 1844 대 1846으로 Opus가 근소하게 앞섭니다. 평가 항목에 따라 결과가 달라져요.

특히 Sonnet 5.5 시스템 카드의 Terminal-Bench 설명을 읽어볼 만합니다. 공식 점수는 안전장치를 켠 66개 과제, 모델당 330회 시도의 평균입니다. Sonnet 5.5는 전체 API 요청의 1.2%가 안전장치에 걸려 전체 시도의 1.5%에 대체 모델 답변이 섞였고, Opus 5.5는 요청의 2.5%가 걸려 전체 시도의 10%에 영향을 줬습니다. Sonnet 5.5는 max, Opus 5.5는 xhigh 설정의 최고 점수를 실었습니다. 회사가 제시한 표준오차도 각각 ±2.5, ±2.6%포인트예요.

그래서 4.2%포인트 차이만 보고 기본 능력의 순위가 뒤집혔다고 단정하기는 어렵습니다. 안전장치 전환이 격차에 얼마나 기여했는지는 해당 수치만으로 계산할 수 없습니다. 다만 제품에서 실제로 안전장치가 작동하는 경로라면 전환이 포함된 점수도 의미가 있습니다.

독립 측정에서는 숫자가 또 달라집니다. AA가 별도로 실행한 Terminal-Bench 4.0은 Sonnet 5.5 max 63.6%, Opus 5.5 max 59.6%였습니다. 공식 측정과 AA 측정은 실행 환경과 설정이 다른 결과라 점수를 한 줄에 섞어 비교하지 않았습니다. AA는 사전 공개 배포본으로 평가했고, Anthropic은 이 배포본의 구조화 출력 오류가 일부 결과에 영향을 줄 수 있었다고 밝혔습니다. 공개 버전에서는 해당 오류를 수정했습니다.

추론을 최대로 올리면 오히려 일이 안 끝날 수도 있어요

Simon Willison은 같은 펠리컨 SVG 프롬프트를 추론 강도별로 돌려봤습니다. xhigh에서는 약 41초와 5.74센트에 결과를 받았지만, max에서는 15분 넘게 추론 토큰 12만 8천 개를 쓴 뒤 SVG를 내놓지 못했다고 해요. 이 한 번의 그림 실험으로 코딩 작업 전체를 평가할 수는 없지만, 높은 강도가 완료를 보장하지는 않는다는 사례로 남습니다.

안전장치도 사용 경로의 일부입니다. Anthropic은 시스템 카드에서 일반적인 버그 수정은 계속 지원하고, 위험도가 높은 사이버보안 요청은 Sonnet 5로 전환한다고 설명했습니다. 이 전환은 자사 제품에서는 자동이며 API 개발자는 전환을 선택해야 합니다. 다른 제공사에서는 동작이 다를 수 있어요. 보안 작업에 Sonnet 5.5를 쓸 때는 모델 이름뿐 아니라 어떤 모델이 실제 요청에 답하는지도 중요하겠죠.

누구에게 맞을까요?

  • 범위가 분명한 버그 수정·문서 작성·반복 작업을 빠르게 돌린다면 Sonnet 5.5의 medium부터 비교해볼 만합니다. Anthropic도 이 영역을 Sonnet의 주된 용도로 소개합니다.
  • 여러 파일에 걸친 모호한 설계 판단이나 오래 이어지는 복잡한 작업에서는 Opus 5.5를 비교군으로 두는 게 좋겠습니다. Anthropic은 이런 작업에서 Opus가 더 강하다고 밝혔고, AA의 max 종합 점수도 Opus 58, Sonnet 56이었습니다.
  • API에서 Sonnet 5를 옮겨 쓴다면 마이그레이션 가이드를 확인할 필요가 있습니다. 모델 ID는 claude-sonnet-5-5이고, 기존 thinking: {"type": "disabled"}는 새 모델에서 400 오류가 납니다. 앞부분 추론을 줄이려면 between_tools로 바꿔야 합니다.

정리하면

Sonnet 5.5는 Sonnet 5와 같은 토큰 가격으로 더 빠른 출력을 제공하고, 여러 코딩 평가에서 점수가 크게 올랐습니다. 공식 Terminal-Bench에서는 Opus 5.5를 앞섰지만, 그 한 항목을 전체 모델 순위로 옮기기에는 안전장치 전환 비율과 추론 강도 차이가 남습니다.

저는 토큰 단가보다 실제로 끝낸 작업의 비용이 더 눈에 들어왔습니다. medium으로 충분한 작업이라면 Sonnet의 개선이 반갑고, max를 계속 써야 한다면 Opus와 작업당 비용·완료율을 같이 비교해보겠습니다. 같은 모델 이름 아래에서도 설정 하나가 비용을 크게 바꾸니까요.

참고 자료

댓글