Google mengumumkan Gemini 4 Argon pada 30 September, dengan skor kuat untuk pekerjaan pengetahuan dan pemrograman, klaim batas keluaran satu juta token, serta harga untuk peluncuran API mendatang. Google memperkenalkan model ini kepada kelompok awal pembela dan penguji keamanan siber tepercaya. Google belum memberikan ID model publik untuk pengembang maupun tanggal akses bagi pelanggan API berbayar atau pelanggan Google AI Ultra. pengumuman Google dan katalog model Gemini API menunjukkan jarak antara peluncuran dan akses bagi sebagian besar pembaca.
Perubahan utama
- Apa yang berubah: Google telah memberikan model mutakhir baru kepada sejumlah pembela keamanan siber terpilih, sementara sebagian besar pengembang dan pelanggan masih belum bisa mengaksesnya. Klaim utama tentang kemampuan dan harga sudah diumumkan, tetapi API publik belum tersedia.
- Mengapa penting: Evaluasi independen Vals AI menempatkan Argon di urutan pertama untuk pekerjaan pengetahuan umum dan satu pengujian agen keuangan. Tim yang membandingkan model kini memiliki kandidat baru yang patut dipertimbangkan. Hasil yang beragam antar tugas dan peluncuran terbatas membuat kinerja serta biaya dalam alur kerja mereka sendiri tetap belum diketahui.
- Hal yang perlu dipantau: Google menyebut pelanggan API berbayar dan pelanggan AI Ultra sebagai kelompok berikutnya, tetapi tanpa tanggal. ID model yang terdokumentasi dan batas layanan akan memungkinkan pengembang menguji pekerjaan yang mereka butuhkan, termasuk apakah keluaran satu juta token yang diklaim dapat digunakan dalam praktik.
Siapa yang bisa menggunakan Gemini 4 sekarang
Google mengatakan penerima pertama adalah pembela dan penguji keamanan siber tepercaya dalam program Fairwind. Fairwind adalah program akses terbatas bagi pelanggan Google Cloud terpilih, lembaga pemerintah, dan mitra keamanan. Google mengatakan Argon diberikan kepada pembela tepercaya tanpa pengamanan siber yang biasanya diterapkan agar mereka dapat menggunakan kemampuan defensifnya. Peluncuran awal ini merupakan uji terkendali untuk kasus penggunaan yang sangat sensitif.
Google berencana memperluas akses ke pengembang, perusahaan, dan konsumen, dimulai dari pelanggan API berbayar serta pelanggan Google AI Ultra. Belum ada tanggal untuk langkah tersebut. Per 1 Oktober, direktori model Gemini API Google mencantumkan model Gemini 3, tetapi tidak mencantumkan ID Gemini 4 Argon. Halaman harga API juga tidak memiliki entri Argon. Karena itu, panduan pemanggilan API harus mengarang nama model dan jalur akses yang belum didokumentasikan Google.
Meski begitu, Google menyebutkan tarif token mendatang dalam tulisan peluncurannya. Harga pengenalan adalah $2 per satu juta token input dan $10 per satu juta token output; input yang tersimpan dalam cache dihargai 95% lebih murah daripada tarif input. Setelah periode pengenalan, Google mengatakan tarif naik menjadi $4 dan $20. Google tidak menyebutkan kapan periode pengenalan berakhir. Ini adalah tarif yang diumumkan, bukan harga API layanan mandiri yang tersedia saat ini. Harga per token juga belum cukup untuk memperkirakan biaya tugas agen yang panjang sebelum jumlah penalaran, penggunaan alat, dan keluarannya diketahui.
Skor kuat dengan kelemahan yang terlihat
Catatan independen Vals AI tentang Argon mencatat 68.90% ± 0.97 pada Vals Index, peringkat pertama di antara 41 model dalam tabelnya. Argon berada di urutan pertama dari 73 model pada Finance Agent v2 dengan skor 65.40% ± 0.32. Pada Vibe Code Bench, Argon berada di urutan kedua dari 106 dengan 91.91% ± 1.90; pada Code Migration, kedua dari 71 dengan 68.17% ± 4.35; dan pada CyberBench v1.1, kedua dari 43 dengan 77.86% ± 5.30. Hasil ini menunjukkan performa awal yang kuat di beberapa tugas, tetapi tidak menjadikan Argon model terbaik untuk semuanya.
Evaluator yang sama menempatkan Argon di urutan kelima dari 42 pada Terminal-Bench 4.0 dengan 57.58% ± 2.31, kelima belas dari 106 pada MedScribe, dan ketujuh dari delapan pada uji penggunaan komputer CUA-bench dengan 4.83%. Biaya per pengujian yang diukur juga sangat bervariasi: $15.68 untuk uji Vals Index dan $193.78 untuk CUA-bench. Ini adalah biaya tugas evaluator, terpisah dari tarif Google yang diumumkan per satu juta token. Vals mengatakan sebagian evaluasi agen memakai perangkat uji tetap, sementara sebagian lainnya memakai agen bawaan model; galat baku yang dilaporkan tidak mencakup variasi prompt, seed, atau setelan penerapan. Selisih skor kecil perlu dibaca dalam konteks itu.
Tabel perbandingan Google DeepMind sendiri memberikan contoh lain yang membantah klaim bahwa Argon unggul di semua bidang. Tabel itu menunjukkan Argon mengungguli GPT-6 Astra pada DeepSWE v1.1, 77.9% to 74.1%, tetapi tertinggal dari Astra pada FrontierSWE v2, 55.0% to 65.5% dan Terminal-Bench Science, 57.6% to 68.1%. Claude Opus 5.5 mengungguli Argon pada Terminal-Bench 4.0, 66.4% to 57.4% serta PostTrainBench, 49.3% to 45.3%. Pada subset OSWorld-2.0 luring dalam tabel, Astra meraih 72.6% sementara Argon 69.2%. Perbandingan tersebut memakai tabel pilihan Google dan konfigurasi tolok ukur yang disebutkan; hasilnya tidak menggantikan pengujian pelanggan pada layanan publik dengan dokumentasi yang jelas.
Google mengatakan Argon dapat menghasilkan hingga satu juta token keluaran dalam satu rangkaian, naik dari batas sebelumnya 64.000 token. Vals mencantumkan jendela konteks satu juta token, tetapi mengatur evaluasi Argon dengan keluaran maksimum 262.144 token. Pengaturan itu tidak menetapkan batas pasti bagi produk Google mendatang. Namun, hasil publik Vals tidak menunjukkan generasi penuh satu juta token, dan Google belum menerbitkan entri API publik yang menjelaskan batas keluaran bagi pengembang pada umumnya.
Penggunaan internal dan klaim keamanan memerlukan bukti tersendiri
Google menjelaskan bahwa agen Argon membantu migrasi kode C/C++ ke Rust, pembuatan subrutin komputasi kuantum, dan optimalisasi memori pusat data. Google mengatakan satu rangkaian perubahan memori membebaskan lebih dari 300 TiB setelah diterapkan. Google juga menyebut mitranya, Wiz, menemukan kerentanan kritis pada perangkat lunak layanan kesehatan dengan Argon. Ini adalah laporan Google tentang pekerjaan internal atau mitra; materi peluncuran tidak memberikan cukup detail independen untuk memverifikasi atau mengulang hasil tersebut. Google mengatakan penulisan ulang Rust berskala besar tetap melalui tinjauan otomatis dan manual sebelum masuk produksi.
Untuk keamanan, Google menjelaskan pelatihan penolakan permintaan berbahaya, pertahanan terhadap injeksi prompt tidak langsung, pemantauan penalaran dan tindakan model untuk mendeteksi perilaku di luar maksud pengguna, serta isolasi lingkungan evaluasi yang lebih kuat. Pernyataan bahwa Argon adalah model Google yang paling tangguh terhadap injeksi prompt tidak langsung merupakan klaim vendor. Menurut Google, kelompok siber awal juga mendapat akses tanpa pengamanan siber standar, sehingga cakupan akses dan pemantauan menjadi sangat penting saat ketersediaan diperluas.
Bukti awal mengenai kegunaan sehari-hari masih bertentangan. Axios melaporkan bahwa Bloomberg, dengan mengutip sumber anonim, menyebut sejumlah karyawan Google menilai kinerja internal Argon kurang memuaskan; Axios juga melaporkan Google mengatakan kepada Bloomberg bahwa kabar itu tidak akurat. Google mengatakan kepada Axios bahwa karyawannya telah menggunakan model tersebut untuk pekerjaan pemrograman dan riset yang sulit. Tidak satu pun laporan itu memastikan kinerja versi publik. Bukti berikutnya yang berguna adalah akses dengan setelan terdokumentasi, disertai hasil tugas dan biaya yang dapat diperiksa pihak lain.



