Anthropic은 Claude Opus 5.5를 9월 22일 출시했다고 밝혔다. Anthropic은 대부분의 작업에서 Fable 5.1에 가까운 성능을 내면서 Opus 5보다 낮은 가격을 제시한다고 설명한다.
이미 Opus 5를 사용 중인 팀에게 이번 업데이트는 더 저렴한 모델 ID만 바꾸는 일이 아니다. Opus 5.5는 항상 적응형 사고를 사용하고 기본 추론 강도는 중간으로 설정되며, Opus 5가 허용했던 여러 요청 형식을 거부한다. 또한 감독을 받는 작업에서 Anthropic이 일상적으로 사용할 모델로 권하는 모델이며, 가장 어렵고 장시간 자율적으로 수행하는 작업은 상위 모델인 Fable에 맡긴다.
큰 변화
- 무엇이 바뀌었나: Opus 5.5는 입력·출력 요금을 20%, 캐시 읽기 요금을 60% 낮춘다. 항상 활성화된 적응형 사고도 기존 API 고객이 작업을 요청하고 예산을 책정하는 방식을 바꾼다.
- 왜 중요한가: 장시간 실행되는 에이전트 작업은 앞서 주어진 지침과 도구 결과를 반복해서 읽는다. 가장 큰 요금 인하가 재사용되는 컨텍스트에 적용되므로, 전체 작업 비용을 이해하려면 캐시 사용량이 핵심이다.
- 지켜볼 점: Sonnet 5.5와 Haiku 5.5도 몇 주 안에 공개될 예정이라고 발표됐으며 현재 이용 가능한 모델은 Opus가 먼저다. 기본 모델을 고를 때는 작업 완료까지의 비용과 각 등급에 필요한 검토 수준을 비교해야 한다.
Opus 5.5는 Fable 등급보다 낮은 가격대의 프로덕션 업무를 겨냥한다
Anthropic의 파트너 대상 권고는 프로덕션 코딩, 금융·법률 지식 업무, 에이전트용 기본 기업 모델로 Opus 5.5를 추천한다. 이 모델의 공개 모델 선택 가이드는 대부분의 워크로드를 Opus 5.5부터 시작하도록 안내하고 복잡한 에이전트 코딩 및 기업 업무에 이 모델을 배정한다. 별도의 비용 안내서는 감독을 받는 기능 개발, 디버깅, 코드 검토에 적합한 ‘일상 업무용 모델’로 소개한다. 두 안내서는 토큰 가격보다 최고 수준의 성능이나 길고 어려운 실행이 더 중요할 때 Fable 5.1을 Opus 5.5보다 상위에 둔다.
Anthropic의 프롬프트 작성 가이드는 근본 원인 분석, 코드 검사, 병렬 하위 에이전트, 조사, 스프레드시트, 보고서, 프레젠테이션에 관한 회사 자체 테스트 결과로 폭넓은 성능 주장을 뒷받침한다. 진행 상황을 더 명확히 알리고 최종 요약을 개선한 점, 비전과 컴퓨터 사용 기능의 개선도 설명한다. 이는 Anthropic이 자체적으로 실시한 평가이지 BIG CHANGE가 진행한 테스트는 아니다.
Opus와 Fable의 구분은 중요하다. Fable 5.1은 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러이며, Opus 5.5는 각각 4달러와 20달러다. 캐시 읽기 요금은 각각 0.25달러와 0.20달러로 차이가 훨씬 작다. 따라서 캐시된 세션이 길면 입력·출력 요금의 표면적인 차이보다 실제 가격 격차가 좁을 수 있다.
Claude Opus 5.5, API 요금 네 가지 변경
아래 표준 API 요금은 토큰 100만 개당 가격이다. Anthropic의 모델 사양에는 Opus 5.5의 컨텍스트 창이 100만 토큰, 최대 출력이 12만 8,000토큰으로 기재돼 있다. 요금 안내에 따르면 전체 컨텍스트 창에도 표준 요금이 적용된다.
API 요금 | Opus 5.5 | Opus 5 | 변경 |
|---|---|---|---|
입력 | 4달러 | 5달러 | 20% 인하 |
출력 | 20달러 | 25달러 | 20% 인하 |
5분 캐시 쓰기 | 5달러 | 6.25달러 | 20% 인하 |
캐시 읽기 | 0.20달러 | 0.50달러 | 60% 인하 |
Anthropic은 기본 설정에서 전형적인 작업의 비용이 40% 낮아진다고 보고한다. 요금과 토큰 효율성을 함께 반영한 결과다. 이 작업 비용 설명은 요금 구성의 중요성을 보여 준다. 장시간 에이전트 세션에서는 늘어나는 컨텍스트를 반복해서 읽고, 출력에는 사고 토큰이 포함되며, 작업은 여러 차례 이어질 수 있다. 캐시 읽기 요금이 60% 낮아지면 캐시 의존도가 높은 세션에서는 그 효과가 클 수 있다. 반면 캐시를 쓰지 않고 긴 답변을 생성하는 짧은 요청은 출력 요금 20% 인하에 더 가깝게 비용이 줄어든다.
프롬프트 작성 가이드에 따르면 보고된 30% 초과 개선은 출력 생성 속도에 관한 것이다. 도구, 테스트, 외부 서비스 또는 검토자를 기다리는 시간은 측정하지 않는다. Anthropic은 입력 100만 토큰당 8달러, 출력 100만 토큰당 40달러인 고속 API 모드도 제공한다. 이 기능은 파트너 클라우드 플랫폼이 아니라 Claude API에서 연구 미리 보기로 제공된다.
Anthropic은 Pro, Max, Team 및 좌석 수 기준 Enterprise 요금제의 5시간 한도도 늘리고 이월 가능한 한도 초기화를 제공했다. 구독 용량은 API 청구와 별개다.
회사 벤치마크가 보여 주는 강점과 한계
Anthropic은 Terminal-Bench 4.0에서 Opus 5.5의 추론 강도 xhigh 점수는 66.4%, Opus 5는 52.3%, Fable 5.1은 55.8%라고 보고한다. 그 밖의 주요 결과는 대부분 최고 추론 강도 설정을 사용한다.
표시된 AutomationBench 및 Terminal-Bench-Science 항목에서는 GPT-6 Astra가 앞선다. 안전장치를 적용한 사이버 작업에는 Opus 4.8을, 생물학 및 프런티어 모델 개발 작업에는 Opus 5를 사용했다. AutomationBench에는 대체 모델 경로를 사용하지 않았다.
Anthropic은 자사 행동 감사에서 되돌릴 수 없거나 범위를 벗어나는 행동이 줄었다고 보고한다. 해당 프롬프트 작성 가이드는 이전 Opus 모델보다 간접 프롬프트 인젝션에 대한 저항력도 높아졌다고 보고한다. 두 결과 모두 회사가 진행한 테스트이며 일반적인 안전성 인증은 아니다.
기존 API 고객은 명시적으로 마이그레이션해야 한다
API 고객은 claude-opus-5-5를 요청해야 하며, 기존 Opus 5 호출의 모델이 자동으로 바뀌지는 않는다. 마이그레이션 참고 자료에는 그렇지 않으면 오류를 반환하거나 애플리케이션의 출력 스트림을 바꿀 수 있는 요청 변경 사항이 여러 가지 정리돼 있다.
마이그레이션 항목 | Opus 5.5 동작 |
|---|---|
모델 선택 | 다음 모델 ID를 지정해 |
사고 | 적응형 사고는 항상 켜져 있다. 사고 기능을 끄거나 토큰 예산을 수동으로 설정하면 HTTP 400 오류가 반환된다. |
추론 강도 | 사용 가능한 수준은 |
강제 도구 | |
컴퓨터 사용 | 기존 |
진행 상황 텍스트 | 도구 호출 사이의 텍스트는 사고 블록으로 전달되므로 기본적으로 해당 내용을 생략하도록 설정한 클라이언트는 호출 사이에 응답이 없는 것처럼 보일 수 있다. |
사고 블록을 보존하는 방식은 장시간 실행되는 클라이언트에 또 다른 제약을 만든다. 사고 블록은 특정 모델과 대화 접두부에 연결된다. 2026년 8월 31일 이후에 생성된 API 및 클라우드 플랫폼 계정에서는 블록을 다시 재생하기 전에 이전 지침, 도구 또는 메시지를 바꾸면 기본적으로 400 오류가 반환된다. Anthropic의 사고 블록 보존 문서는 대화 내용을 추가만 하는 방식과 호환되지 않는 블록을 통제된 방식으로 제거하는 선택지를 설명한다.
안전성 라우팅에 따라 응답 모델이 바뀔 수 있다
해당 프롬프트 작성 가이드는 Fable 5.1 수준의 생물학 안전장치와 사이버 보안 및 추론 추출을 위한 분류기를 설명한다. 소스 코드의 취약점 탐지는 계속 허용되며, 조직은 생명과학 분야 검증을 신청할 수 있다. 사이버 분야 검증 확대도 몇 주 안에 제공될 예정이라고 발표됐다.
거부 응답은 HTTP 200과 stop_reason: "refusal"을 함께 반환할 수 있다. 대체 동작 문서는 서버 측 대체 경로, SDK 미들웨어, 클라이언트가 관리하는 재시도를 설명한다. 대체 동작은 지원되는 경로 중 하나를 설정한 경우에만 발생한다. 모든 Opus 5.5 요청에 자동으로 보장되는 것은 아니다. 권장 대체 모델이 없는 범주의 요청은 여전히 거부될 수 있다.
따라서 실제로 응답을 제공한 모델도 결과의 일부다. Opus 5.5로 옮기는 애플리케이션은 특히 안전장치가 적용되는 분야의 작업에서 거부 응답과 대체 모델이 처리한 응답을 구분해 기록해야 한다. 더 낮은 요금과 폭넓은 성능 주장은 Opus 5.5에 관한 것이다. 다른 모델로 전달된 요청은 실제 응답을 제공한 모델의 동작과 한계를 따른다.



