Google ने Gemini 4 Argon 30 सितंबर को इसकी घोषणा की। ज्ञान-आधारित काम और कोडिंग में अच्छे स्कोर, 1 मिलियन आउटपुट टोकन की बताई गई सीमा और भावी API के दाम भी बताए गए। Google पहले भरोसेमंद साइबर रक्षा विशेषज्ञों और परीक्षकों के छोटे समूह को मॉडल दे रहा है। डेवलपरों के लिए सार्वजनिक मॉडल ID या सशुल्क API ग्राहकों और Google AI Ultra सदस्यों के लिए उपलब्धता की तारीख नहीं बताई गई। Google की घोषणा और Gemini API मॉडल सूची अधिकांश पाठकों के लिए लॉन्च और पहुंच के बीच का अंतर दिखाते हैं।

बड़ा बदलाव

  • क्या बदला: Google ने नया अग्रणी मॉडल चुनिंदा साइबर रक्षा विशेषज्ञों को दिया है, जबकि अधिकांश डेवलपर और सदस्य अभी इसे इस्तेमाल नहीं कर सकते। क्षमता और कीमत के मुख्य दावे सार्वजनिक हैं, लेकिन सार्वजनिक API अब तक जारी नहीं हुई।
  • यह क्यों मायने रखता है: Vals AI के स्वतंत्र मूल्यांकन में Argon व्यापक ज्ञान-आधारित कामों और वित्तीय एजेंट की एक परीक्षा में पहले स्थान पर है। मॉडल की तुलना करने वाली टीमों के पास अब एक गंभीर नया विकल्प है। कामों के बीच अलग-अलग नतीजे और सीमित पहुंच के कारण अपनी कार्यप्रणाली में प्रदर्शन और लागत अभी स्पष्ट नहीं हैं।
  • क्या देखना है: Google ने अगले समूह के तौर पर सशुल्क API ग्राहकों और AI Ultra सदस्यों का नाम लिया, लेकिन तारीख नहीं दी। दर्ज किया हुआ मॉडल ID और सेवा की सीमाएं मिलने पर डेवलपर जरूरी कामों को जांच पाएंगे और यह भी कि बताए गए 1 मिलियन आउटपुट टोकन व्यवहार में इस्तेमाल किए जा सकते हैं या नहीं।

अभी Gemini 4 कौन इस्तेमाल कर सकता है

Google के मुताबिक शुरुआती उपयोगकर्ता उसके Fairwind कार्यक्रमके भरोसेमंद साइबर रक्षा विशेषज्ञ और परीक्षक हैं। Fairwind चुनिंदा Google Cloud ग्राहकों, सरकारी एजेंसियों और सुरक्षा साझेदारों के लिए सीमित पहुंच वाला कार्यक्रम है। Google का कहना है कि भरोसेमंद रक्षकों को Argon सामान्य साइबर सुरक्षा रोकों के बिना दिया जा रहा है, ताकि वे इसकी रक्षात्मक क्षमताएं इस्तेमाल कर सकें। यह शुरुआती जारीकरण खास तौर पर संवेदनशील उपयोग का नियंत्रित परीक्षण है।

Google डेवलपरों, कंपनियों और उपभोक्ताओं तक पहुंच बढ़ाने की योजना बना रहा है; शुरुआत सशुल्क API ग्राहकों और Google AI Ultra सदस्यों से होगी। इसकी तारीख नहीं दी गई। 1 अक्टूबर को Google की Gemini API मॉडल निर्देशिका में Gemini 3 मॉडल थे, पर Gemini 4 Argon की पहचान नहीं थी। उसके API कीमत पृष्ठ पर भी Argon का कोई उल्लेख नहीं था। इसलिए API कॉल की मार्गदर्शिका में मॉडल का नाम और पहुंच का रास्ता गढ़ना पड़ेगा, जिन्हें Google ने दर्ज नहीं किया है।

फिर भी कंपनी ने लॉन्च पोस्ट में भविष्य की टोकन दरें बताईं। शुरुआती कीमत है प्रति 1 मिलियन इनपुट टोकन $2 और प्रति 1 मिलियन आउटपुट टोकन $10; कैश किए इनपुट की कीमत इनपुट दर से 95% कम है। शुरुआती अवधि के बाद Google के मुताबिक दरें बढ़कर $4 और $20हो जाएंगी। शुरुआती अवधि कब समाप्त होगी, यह नहीं बताया। ये घोषित दरें हैं, आज उपलब्ध स्व-सेवा API की कीमत नहीं। लंबे एजेंट कार्य में तर्क, टूल के उपयोग और आउटपुट की मात्रा जाने बिना प्रति टोकन कीमत से कुल लागत भी पता नहीं चलती।

अच्छे स्कोर, साथ में साफ कमजोरियां

Argon पर Vals AI का स्वतंत्र रिकॉर्ड Vals Index पर 68.90% ± 0.97 है, और तालिका के 41 मॉडलों में यह पहले स्थान पर है। Finance Agent v2 में 73 में पहला, स्कोर 65.40% ± 0.32। Vibe Code Bench में 106 में दूसरा, 91.91% ± 1.90; Code Migration में 71 में दूसरा, 68.17% ± 4.35; और CyberBench v1.1 में 43 में दूसरा, 77.86% ± 5.30। ये नतीजे कई कामों में अच्छी शुरुआत दिखाते हैं, पर हर काम में Argon को सर्वश्रेष्ठ नहीं बनाते।

उसी मूल्यांकन में Terminal-Bench 4.0 के 42 मॉडलों में Argon पांचवें स्थान पर, स्कोर 57.58% ± 2.31; MedScribe में 106 में पंद्रहवें और कंप्यूटर उपयोग CUA-bench में आठ में सातवें स्थान पर, स्कोर 4.83%। प्रति परीक्षण मापी गई लागत भी काफी बदलती है: $15.68 Vals Index परीक्षण के लिए और $193.78 CUA-bench के लिए। ये मूल्यांकन कार्यों की लागत है, Google की घोषित प्रति 1 मिलियन टोकन कीमत से अलग। Vals के अनुसार कुछ एजेंट मूल्यांकन तय हर्नेस और कुछ मॉडल के अपने एजेंट का उपयोग करते हैं; प्रकाशित मानक त्रुटियां प्रॉम्प्ट, सीड या तैनाती सेटिंग में अंतर नहीं समेटतीं। स्कोर का छोटा अंतर इसी संदर्भ में समझना चाहिए।

Google DeepMind की अपनी तुलना तालिका भी हर क्षेत्र में बढ़त के दावे के विरुद्ध उदाहरण देती है। DeepSWE v1.1 में Argon, GPT-6 Astra से आगे है, 77.9% to 74.1%; लेकिन FrontierSWE v2 में Astra से पीछे, 55.0% to 65.5%और Terminal-Bench Science में भी पीछे, 57.6% to 68.1%। Terminal-Bench 4.0 में Claude Opus 5.5, Argon से आगे है, 66.4% to 57.4%और PostTrainBench में भी, 49.3% to 45.3%। तालिका के ऑफलाइन OSWorld-2.0 उपसमूह में Astra का स्कोर 72.6% और Argon का 69.2%है। ये तुलना Google की चुनी हुई तालिका और बताए गए बेंचमार्क सेटअप पर आधारित हैं; दर्ज विवरण वाली सार्वजनिक सेवा में ग्राहक परीक्षण का विकल्प नहीं।

Google का कहना है कि Argon एक ही क्रम में अधिकतम 1 मिलियन आउटपुट टोकनबना सकता है, जबकि पहले सीमा 64,000 टोकन थी। Vals 1 मिलियन टोकन की कॉन्टेक्स्ट विंडो बताता है, लेकिन Argon मूल्यांकन में अधिकतम आउटपुट 262,144 टोकनरखा गया। इससे Google के भावी उत्पाद की पक्की सीमा तय नहीं होती। मगर Vals के सार्वजनिक नतीजे पूरे 1 मिलियन टोकन जनरेशन को नहीं दिखाते, और सामान्य डेवलपरों के लिए आउटपुट सीमा स्पष्ट करने वाला सार्वजनिक API विवरण Google ने अभी तक नहीं दिया।

आंतरिक उपयोग और सुरक्षा दावों के लिए अलग सबूत चाहिए

Google के अनुसार Argon एजेंटों ने C/C++ से Rust में कोड स्थानांतरित करने, क्वांटम कंप्यूटिंग सबरूटीन और डेटा-सेंटर मेमोरी के अनुकूलन में मदद की। कंपनी कहती है कि मेमोरी बदलावों का एक समूह लागू करने के बाद 300 TiB से अधिक जगह मिली। Google यह भी कहता है कि उसके साझेदार Wiz ने Argon की मदद से स्वास्थ्य सॉफ्टवेयर में गंभीर कमजोरी खोजी। ये आंतरिक या साझेदार काम पर Google के विवरण हैं; लॉन्च सामग्री में इन नतीजों को जांचने या दोहराने लायक स्वतंत्र जानकारी नहीं है। Google कहता है कि बड़े Rust पुनर्लेखनों को प्रोडक्शन से पहले स्वचालित और मानवीय समीक्षा से गुजरना होता है।

सुरक्षा के लिए Google हानिकारक अनुरोधों को अस्वीकार करने का प्रशिक्षण, अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन से बचाव, उपयोगकर्ता की मंशा से बाहर व्यवहार पकड़ने हेतु मॉडल के तर्क और कार्रवाई की निगरानी, तथा मूल्यांकन परिवेश का मजबूत अलगाव बताता है। अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन के विरुद्ध Argon अपना सबसे मजबूत मॉडल है—यह विक्रेता का दावा है। Google के मुताबिक शुरुआती साइबर समूह को भी सामान्य साइबर सुरक्षा रोकों के बिना पहुंच मिलती है, इसलिए विस्तार के साथ पहुंच का दायरा और निगरानी खास तौर पर अहम हैं।

रोजमर्रा की उपयोगिता पर शुरुआती जानकारी एक-दूसरे से मेल नहीं खाती। Axios ने बताया कि Bloomberg ने अनाम स्रोतों के हवाले से कहा कुछ Google कर्मचारियों को Argon का आंतरिक प्रदर्शन कमजोर लगा; Axios ने यह भी बताया कि Google ने Bloomberg से कहा कि बात सही नहीं है। Google ने Axios को बताया कि कर्मचारियों ने कठिन कोडिंग और शोध कार्यों में मॉडल इस्तेमाल किया। इनमें से कोई भी विवरण सार्वजनिक संस्करण का प्रदर्शन तय नहीं करता। आगे उपयोगी प्रमाण होगा दस्तावेजीकृत सेटिंग के साथ पहुंच, तथा ऐसे कार्य परिणाम और लागत जिन्हें दूसरे जांच सकें।