Anthropic merilis Claude Sonnet 5.5 pada 28 September dengan harga token API yang sama seperti Sonnet 5. Perusahaan menyebut model ini menghasilkan output lebih dari 30% lebih cepat dan dapat mengurangi biaya per tugas hingga 30% karena menggunakan lebih sedikit token. Itu adalah dua klaim terpisah: harga yang tercantum tidak turun, dan tagihan suatu tugas tetap bergantung pada prompt, output, alat, dan pengaturan upaya.
Bagi pengembang, rilis ini memadukan potensi peningkatan efisiensi yang berguna dengan perubahan yang dapat merusak integrasi Sonnet 5. Dokumentasi Anthropic mencantumkan model ini sebagai claude-sonnet-5-5 pada Claude API, Google Cloud, dan Microsoft Foundry, serta anthropic.claude-sonnet-5-5 di Amazon Bedrock. Halaman modelnya mencantumkan jendela konteks satu juta token dan batas output maksimum 128.000 token. Akses juga tercantum melalui Claude Platform di AWS. Penagihan penyedia cloud dan pengaturan wilayah dapat berbeda dari tarif yang tercantum untuk Claude API.
Apa yang ditunjukkan evaluasi
Dalam pengujian Terminal-Bench 4.0 oleh Anthropic, Sonnet 5.5 menyelesaikan 70,6% dari 66 tugas terminal, dibandingkan 10,3% untuk Sonnet 5 dalam tabel rilis. Kartu sistem menggambarkan serangkaian tugas sains dan teknik yang menantang dalam lingkungan baris perintah terkontainerisasi. Anthropic menjalankan Claude Code dalam mode bare dengan upaya berpikir maksimum, memblokir akses internet, dan menyimpan sumber daya yang dibutuhkan untuk tugas-tugas tersebut dalam cache. Perlindungan mengirim 1,2% permintaan Sonnet 5.5 ke model fallback, sehingga memengaruhi 1,5% uji coba. Anthropic melaporkan galat baku 2,5 poin persentase untuk hasil Sonnet 5.5. Skor ini mengukur konfigurasi tersebut; hasil itu tidak membuktikan peningkatan yang sama pada repositori milik pengembang.
Menurut kartu sistem Anthropic, Cognition menjalankan FrontierCode di Claude Code pada 150 tugas repositori dan melaporkan skor Sonnet 5.5 sebesar 52,1% pada set Main dengan tingkat upaya xhigh. Skornya turun menjadi 46,2% pada upaya maksimum, sebagian karena tinjauan dan penyuntingan tambahan oleh agen melampaui cakupan atau batas waktu tolok ukur dalam sejumlah kasus yang ditelaah Cognition. Cursor menjalankan CursorBench 4.0 dalam harness agen produksinya pada tugas-tugas yang diambil dari sesi Cursor. Hasil Sonnet 5.5 sebesar 55,5% pada upaya maksimum tercantum dalam tabel hasil yang dikirim kepada Anthropic; Anthropic memperkirakan biaya per tugas model tersebut dari jumlah token yang diberikan Cursor. Evaluasi eksternal ini menggunakan tugas dan harness berbeda, dan angka Sonnet 5.5 di sini berasal dari kartu sistem Anthropic.
Artificial Analysis juga menguji model prarilis pada GDPval-AA, yang membandingkan hasil kerja dalam 220 tugas dari 44 pekerjaan, serta AA-Briefcase, kumpulan proyek kerja pengetahuan yang saling terhubung. Kartu tersebut melaporkan skor Elo masing-masing 1844 dan 1811 pada upaya maksimum, mendekati Opus 5.5 dalam pengujian itu. Anthropic mengatakan penerapan prarilis memiliki bug keluaran terstruktur yang mungkin memengaruhi hasil dan kini telah diperbaiki. Perbandingan ini menilai hasil tolok ukur dalam kondisi tersebut; hasil itu tidak menunjukkan bahwa Sonnet 5.5 akan menyamai Opus dalam pekerjaan terbuka milik pembaca. Anthropic sendiri mengatakan Opus tetap lebih kuat dalam pekerjaan kompleks yang menuntut pertimbangan berkelanjutan.
Kutipan pelanggan awal dalam pengumuman Anthropic menggambarkan alur kerja yang lebih cepat dan penggunaan token lebih sedikit dalam pengujian mereka sendiri. Pelanggan yang dikutip menggunakan tugas dan metode masing-masing, sehingga pengalaman mereka tidak dapat menetapkan ukuran produktivitas yang sama untuk semua. BIG CHANGE belum menjalankan Sonnet 5.5 atau memeriksa angka kecepatan dan biaya per tugas dari vendor dalam alur kerja langsung.
Harga dan migrasi
Tarif daftar Claude API adalah $2 per sejuta token input dan $10 per sejuta token output, tidak berubah dari Sonnet 5. Penulisan cache lima menit berbiaya $2,50 per sejuta token dan pembacaan cache $0,20. Grafik biaya per tugas Anthropic menggabungkan tarif daftar dengan token yang dikonsumsi pada tingkat upaya tertentu. Grafik itu tidak membuktikan penghematan universal sebesar 30%. Tim yang membandingkan model sebaiknya menjalankan tugas representatifnya sendiri pada ambang kualitas yang dibutuhkan, serta mencatat penggunaan token dan waktu pengerjaan selain keberhasilan.
Mengganti ID model saja dapat membuat kode Messages API yang sudah ada gagal. Pengaturan Sonnet 5 thinking: {"type": "disabled"} menghasilkan galat pada versi 5.5; pengganti terdokumentasi untuk menghindari proses berpikir di awal adalah thinking: {"type": "between_tools"}, yang diterima pada tingkat upaya rendah, sedang, dan tinggi. Adaptive thinking aktif jika kolom ini dihilangkan, sedangkan Claude API menetapkan upaya tinggi sebagai bawaan. Pemaksaan tool_choice dengan nilai any dan tool juga menghasilkan galat; Anthropic mengarahkan pengembang ke auto serta skema alat ketat jika didukung. Untuk Sonnet 5.5 di Amazon Bedrock, penggunaan alat ketat tidak tersedia: gunakan auto tanpa strict dan validasi masukan alat dalam kode aplikasi. Kode yang menampilkan teks di antara pemanggilan alat mungkin perlu menangani pembaruan progres yang dikembalikan dalam blok thinking. Integrasi penggunaan komputer pada Claude API dan Google Cloud memerlukan toolset yang lebih baru: computer_toolset_20260801, sementara Bedrock tetap menggunakan computer_20251124 sebagai versi terdahulu. Panduan migrasi menjelaskan perubahan kompatibilitas lainnya.
Perubahan besar
Sonnet 5.5 memberi tim yang sensitif terhadap biaya model baru dengan tarif token Sonnet 5, disertai hasil lebih tinggi dalam beberapa evaluasi yang ditentukan serta klaim Anthropic bahwa output lebih cepat. Nilai praktisnya bergantung pada komposisi tugas dan pengaturan upaya. Integrasi yang ada juga perlu meninjau pengaturan. Perbandingan lanjutan paling jelas adalah mengukur hasil benar, penggunaan token, dan waktu pengerjaan pada beban kerja organisasi sendiri.
Sumber & bacaan lebih lanjut
- Pengumuman Anthropic tentang Sonnet 5.5 memuat tanggal rilis, klaim kecepatan dan biaya per tugas dari perusahaan, ringkasan tolok ukur, serta pengalaman pelanggan awal. Klaim kinerja tersebut perlu diuji pada beban kerja tertentu.
- Kartu sistem Anthropic untuk Sonnet 5.5 mendokumentasikan tugas tolok ukur, harness, pengaturan upaya, perilaku fallback, dan asal evaluasi eksternal. Ini adalah pengungkapan utama dari vendor model, termasuk hasil yang dijalankan pihak luar dan diberikan kepadanya.
- Halaman model Claude Platform mencantumkan ID API, ketersediaan, batas, dan harga token. Halaman harga lengkap mengonfirmasi tarif dasar Sonnet 5 dan 5.5 sama serta menjelaskan perbedaan harga cloud.
- Panduan migrasi Sonnet 5.5 mencatat pengaturan permintaan yang berubah atau menghasilkan galat. Gunakan panduan ini untuk daftar periksa lengkap integrasi yang sudah ada.



