Inanunsyo ng Google ang Gemini 4 Argon noong Setyembre 30, kasama ang matataas na iskor sa kaalamang trabaho at coding, pahayag na hanggang isang milyong output token ang limitasyon, at mga presyo para sa susunod na API release. Ipinamamahagi muna ng Google ang modelo sa piling pinagkakatiwalaang tagapagtanggol at tagasubok sa cybersecurity. Wala pa itong pampublikong model ID para sa mga developer o petsa kung kailan ito magagamit ng mga bayad na API customer o subscriber ng Google AI Ultra. anunsyo ng Google at ang catalog ng mga modelo ng Gemini API ay nagpapakita ng agwat sa pagitan ng paglulunsad at access para sa karamihan ng mambabasa.
Ang malaking pagbabago
- Ano ang nagbago: Ipinagamit ng Google ang bagong makabagong modelo sa piling tagapagtanggol ng cybersecurity, habang hindi pa rin ito ma-access ng karamihan sa mga developer at subscriber. Pampubliko na ang mahahalagang pahayag tungkol sa kakayahan at presyo, pero wala pang pampublikong API.
- Bakit mahalaga: Nangunguna ang Argon sa malawak na gawaing pangkaalaman at isang pagsubok ng financial agent sa mga independiyenteng pagsusuri ng Vals AI. May seryosong bagong kandidato tuloy ang mga team na naghahambing ng mga modelo. Dahil iba-iba ang resulta ayon sa gawain at limitado ang rollout, hindi pa alam ang performance at gastos sa sarili nilang workflow.
- Ano ang dapat subaybayan: Pinangalanan ng Google ang mga bayad na API customer at AI Ultra subscriber bilang susunod na mga grupo, pero walang petsa. Kapag may dokumentadong model ID at service limit, masusubukan ng mga developer ang mahahalagang gawain at kung magagamit talaga ang sinasabing isang milyong output token.
Sino ang makakagamit ng Gemini 4 ngayon
Ayon sa Google, ang mga unang makakatanggap ay mga pinagkakatiwalaang tagapagtanggol at tagasubok sa cybersecurity sa programang Fairwind. Limitadong access ang Fairwind para sa piling customer ng Google Cloud, ahensiya ng pamahalaan, at security partner. Sabi ng Google, ibinibigay ang Argon sa mga pinagkakatiwalaang tagapagtanggol nang walang karaniwang cybersecurity guardrail para magamit nila ang mga kakayahang pandepensa nito. Kontroladong pagsubok ito para sa partikular na sensitibong gamit.
Plano ng Google na palawakin ang access sa mga developer, negosyo, at consumer, simula sa bayad na API customer at subscriber ng Google AI Ultra. Wala pang petsa ang hakbang na iyon. Noong Oktubre 1, nakalista sa direktoryo ng mga modelo ng Gemini API ng Google ang mga modelong Gemini 3 ngunit walang identifier para sa Gemini 4 Argon. Wala ring Argon sa pahina ng presyo ng API . Kaya kailangang mag-imbento ang gabay sa API ng pangalan ng modelo at paraan ng access na hindi idinokumento ng Google.
Gayunman, inilathala ng kumpanya ang mga susunod na singil kada token. Ang panimulang presyo ay $2 kada milyong input token at $10 kada milyong output token; 95% na mas mura sa input rate ang naka-cache na input. Pagkatapos ng panimulang panahon, tataas daw ang singil sa $4 at $20. Hindi sinabi kung kailan matatapos ang panimulang panahon. Mga inihayag na singil ito, hindi presyo ng self-service API na mabibili ngayon. Hindi rin sapat ang presyo kada token para tantiyahin ang gastos ng mahabang agent task hangga't hindi alam ang pangangatwiran, paggamit ng tool, at dami ng output.
Matataas na iskor, kapansin-pansing kahinaan
Sa independiyenteng tala ng Vals AI tungkol sa Argon , nakakuha ito ng 68.90% ± 0.97 sa Vals Index at nanguna sa 41 modelong nasa talahanayan. Nanguna rin ito sa 73 modelo sa Finance Agent v2 na may 65.40% ± 0.32. Pumangalawa ito sa 106 sa Vibe Code Bench na may 91.91% ± 1.90; pumangalawa sa 71 sa Code Migration na may 68.17% ± 4.35; at pumangalawa sa 43 sa CyberBench v1.1 na may 77.86% ± 5.30. Maganda ang unang resulta nito sa ilang gawain, pero hindi ibig sabihin na pinakamahusay ito sa lahat.
Inilagay rin ng evaluator ang Argon sa ikalima sa 42 modelo sa Terminal-Bench 4.0 na may 57.58% ± 2.31, ikalabinlima sa 106 sa MedScribe, at ikapito sa walo sa computer-use test na CUA-bench na may 4.83%. Malaki rin ang pagkakaiba ng nasukat na gastos bawat test: $15.68 para sa Vals Index at $193.78 para sa CUA-bench. Gastos ito ng mga gawaing sinuri, hiwalay sa inihayag na presyo ng Google kada milyong token. Sabi ng Vals, may ilang agent evaluation na gumagamit ng nakapirming harness at ang iba nama’y sariling agent ng modelo; hindi saklaw ng naiulat na standard error ang pagkakaiba ng prompt, seed, o deployment setting. Dapat unawain sa ganitong konteksto ang maliit na agwat sa iskor.
May iba pang kontra-halimbawa sa sariling talahanayan ng paghahambing ng Google DeepMind laban sa pahayag na nangunguna ang Argon sa lahat. Mas mataas ang Argon kaysa GPT-6 Astra sa DeepSWE v1.1, 77.9% to 74.1%, pero mas mababa kaysa Astra sa FrontierSWE v2, 55.0% to 65.5%at Terminal-Bench Science, 57.6% to 68.1%. Nangunguna ang Claude Opus 5.5 sa Argon sa Terminal-Bench 4.0, 66.4% to 57.4%at PostTrainBench, 49.3% to 45.3%. Sa offline na subset ng OSWorld-2.0 sa talahanayan, nakakuha ang Astra ng 72.6% kumpara sa 69.2%ng Argon. Batay ang mga paghahambing sa piniling talahanayan at benchmark setup ng Google; hindi kapalit ang mga ito ng pagsubok ng customer sa dokumentadong pampublikong serbisyo.
Sabi ng Google, kayang gumawa ng Argon ng hanggang isang milyong output token sa iisang trajectorymula sa dating limitasyong 64,000 token. Nakatala sa Vals ang isang milyong token na context window, pero itinakda nito sa 262,144 tokenang pinakamataas na output sa pagsusuri nito sa Argon. Hindi nito pinatutunayan ang mahigpit na limitasyon ng susunod na produkto ng Google. Ipinapakita lamang nito na walang buong isang milyong token na output sa pampublikong resulta ng Vals at wala pang pampublikong API entry ang Google na naglilinaw sa limitasyong magagamit ng karaniwang developer.
Kailangan ng sariling ebidensiya ang mga panloob na gamit at pahayag tungkol sa kaligtasan
Inilalarawan ng Google ang mga Argon agent na tumulong sa paglipat ng code mula C/C++ patungong Rust, paggawa ng quantum-computing subroutine, at pag-optimize ng memorya sa data center. Sabi nito, mahigit 300 TiB ang nabakanteng memorya matapos ilunsad ang isang hanay ng pagbabago. Sinabi rin ng Google na nakakita ang partner nitong Wiz, gamit ang Argon, ng kritikal na kahinaan sa software pangkalusugan. Mga salaysay ito ng Google tungkol sa panloob o gawaing kasama ang partner; kulang ang mga materyal sa paglulunsad sa independiyenteng detalye para mapatunayan o maulit ang mga resulta. Sabi ng Google, susuriin pa rin nang awtomatiko at mano-mano ang malalaking Rust rewrite bago i-deploy sa produksyon.
Para sa kaligtasan, inilalarawan ng Google ang pagsasanay na tumanggi sa mapaminsalang kahilingan, depensa laban sa indirect prompt injection, pagsubaybay sa pangangatwiran at kilos ng modelo upang makita ang asal na labag sa layunin ng user, at mas mahigpit na paghihiwalay ng evaluation environment. Pahayag ng vendor ang sinasabi nitong pinakamatatag ang Argon laban sa indirect prompt injection. Ayon sa Google, nakakakuha rin ng access ang unang cyber cohort nang walang karaniwang cybersecurity guardrail, kaya lalong mahalaga ang saklaw ng access at pagsubaybay habang lumalawak ito.
Hindi magkakatugma ang unang ebidensiya tungkol sa gamit nito sa araw-araw. Iniulat ng Axios na sinabi ng Bloomberg, batay sa mga hindi pinangalanang sanggunian, na mahina raw ang panloob na performance ng Argon para sa ilang empleyado ng Google; iniulat din ng Axios na sinabi ng Google sa Bloomberg na hindi tama ang ulat. Sinabi ng Google sa Axios na gumamit ang mga empleyado ng modelo sa mahihirap na coding at research task. Walang ulat na nakapagtatakda kung paano gagana ang pampublikong bersyon. Ang susunod na kapaki-pakinabang na ebidensiya ay access sa dokumentadong setting, kasama ang resulta ng gawain at gastos na masusuri ng iba.



