Google نے Gemini 4 Argon 30 ستمبر کو اعلان کیا۔ اس نے علمی کام اور کوڈنگ میں اچھے اسکور، دس لاکھ آؤٹ پٹ ٹوکن کی دعویٰ کردہ حد اور مستقبل کی API قیمتیں بتائیں۔ Google ابتدا میں یہ ماڈل قابلِ اعتماد سائبر دفاعی ماہرین اور ٹیسٹرز کے ایک چھوٹے گروپ کو دے رہا ہے۔ ڈویلپرز کے لیے عوامی ماڈل ID یا بامعاوضہ API صارفین اور Google AI Ultra کے سبسکرائبرز کے لیے دستیابی کی تاریخ نہیں دی گئی۔ Google کا اعلان اور Gemini API ماڈل کیٹلاگ زیادہ تر قارئین کے لیے اجرا اور رسائی کے درمیان فرق دکھاتے ہیں۔

بڑی تبدیلی

  • کیا بدلا: Google نے ایک نیا جدید ماڈل منتخب سائبر دفاعی ماہرین کے حوالے کیا ہے، مگر زیادہ تر ڈویلپرز اور سبسکرائبرز ابھی اس تک رسائی نہیں رکھتے۔ صلاحیت اور قیمت کے اہم دعوے عوامی ہو گئے ہیں، لیکن عوامی API ابھی جاری نہیں ہوئی۔
  • یہ کیوں اہم ہے: Vals AI کے آزادانہ جائزوں میں Argon عمومی علمی کام اور مالیاتی ایجنٹ کے ایک ٹیسٹ میں پہلے نمبر پر ہے۔ اس لیے ماڈلز کا موازنہ کرنے والی ٹیموں کے پاس ایک سنجیدہ نیا امیدوار ہے۔ مختلف کاموں میں مختلف نتائج اور محدود اجرا کے باعث اپنی عملی ضروریات میں کارکردگی اور لاگت ابھی غیر واضح ہیں۔
  • کیا دیکھنا ہے: Google نے اگلے گروپ کے طور پر بامعاوضہ API صارفین اور AI Ultra سبسکرائبرز کا نام لیا ہے، مگر تاریخ نہیں دی۔ دستاویزی ماڈل ID اور سروس کی حدود ڈویلپرز کو اہم کام آزمانے دیں گی، اور یہ بھی جانچنے دیں گی کہ دعویٰ کردہ دس لاکھ آؤٹ پٹ ٹوکن عملی طور پر استعمال ہو سکتے ہیں یا نہیں۔

اب Gemini 4 کون استعمال کر سکتا ہے

Google کے مطابق پہلے صارفین اس کے Fairwind پروگرامکے قابلِ اعتماد سائبر دفاعی ماہرین اور ٹیسٹرز ہیں۔ Fairwind منتخب Google Cloud صارفین، سرکاری اداروں اور سکیورٹی شراکت داروں کے لیے محدود رسائی کا پروگرام ہے۔ Google کا کہنا ہے کہ قابلِ اعتماد دفاعی ماہرین کو Argon معمول کی سائبر حفاظتی پابندیوں کے بغیر دیا جا رہا ہے تاکہ وہ اس کی دفاعی صلاحیتیں استعمال کریں۔ یہ ابتدائی اجرا ایک نہایت حساس استعمال کی قابو شدہ آزمائش ہے۔

Google ڈویلپرز، کاروباری اداروں اور صارفین تک رسائی بڑھانے کا ارادہ رکھتا ہے، ابتدا بامعاوضہ API صارفین اور Google AI Ultra سبسکرائبرز سے ہوگی۔ اس مرحلے کی کوئی تاریخ نہیں۔ 1 اکتوبر کو دیکھی گئی Google کی Gemini API ماڈل ڈائریکٹری میں Gemini 3 ماڈل درج تھے مگر Gemini 4 Argon کی شناخت نہیں تھی۔ اس کے API قیمتوں کے صفحے پر بھی Argon کی کوئی مد نہیں تھی۔ لہٰذا API کال کی ہدایات میں ایسا ماڈل نام اور رسائی کا طریقہ گھڑنا پڑے گا جسے Google نے دستاویز نہیں کیا۔

اس کے باوجود Google نے اجرا کی پوسٹ میں مستقبل کے ٹوکن نرخ دیے۔ ابتدائی قیمت ہر دس لاکھ اِن پٹ ٹوکن کے لیے 2 ڈالر اور ہر دس لاکھ آؤٹ پٹ ٹوکن کے لیے 10 ڈالرہے؛ کیش کیے گئے اِن پٹ کی قیمت عام اِن پٹ نرخ سے 95% کم ہے۔ ابتدائی مدت کے بعد Google کے مطابق نرخ بڑھ کر 4 اور 20 ڈالرہو جائیں گے۔ اس نے ابتدائی مدت کے اختتام کی تاریخ نہیں بتائی۔ یہ اعلان کردہ نرخ ہیں، آج دستیاب خودکار API کی قیمت نہیں۔ طویل ایجنٹ کام میں کتنی استدلالی کارروائی، ٹولز کا استعمال اور آؤٹ پٹ درکار ہے، یہ جانے بغیر فی ٹوکن نرخ سے لاگت کا اندازہ بھی نہیں ہوتا۔

اچھے اسکور، مگر نمایاں کمزوریاں

Argon سے متعلق Vals AI کا آزادانہ ریکارڈ Vals Index پر 68.90% ± 0.97 اسکور دکھاتا ہے؛ اس کی فہرست کے 41 ماڈلز میں یہ پہلے نمبر پر ہے۔ Finance Agent v2 میں 73 میں سے پہلے نمبر پر، اسکور 65.40% ± 0.32۔ Vibe Code Bench میں 106 میں سے دوسرے نمبر پر، 91.91% ± 1.90؛ Code Migration میں 71 میں سے دوسرے نمبر پر، 68.17% ± 4.35؛ اور CyberBench v1.1 میں 43 میں سے دوسرے نمبر پر، 77.86% ± 5.30۔ یہ نتائج کئی کاموں میں مضبوط ابتدائی کارکردگی دکھاتے ہیں، مگر ہر کام میں Argon کو بہترین ثابت نہیں کرتے۔

اسی جائزہ کار نے Terminal-Bench 4.0 میں Argon کو 42 میں سے پانچویں نمبر پر رکھا، اسکور 57.58% ± 2.31؛ MedScribe میں 106 میں سے پندرھویں اور کمپیوٹر استعمال کے CUA-bench میں آٹھ میں سے ساتویں نمبر پر، اسکور 4.83%۔ فی ٹیسٹ ناپی گئی لاگت میں بھی بڑا فرق ہے: Vals Index ٹیسٹ کے لیے $15.68 اور CUA-bench کے لیے $193.78 ۔ یہ جائزہ کار کے کاموں کی لاگت ہے، Google کے فی دس لاکھ ٹوکن اعلان کردہ نرخ سے الگ۔ Vals کے مطابق کچھ ایجنٹ جائزوں میں مقررہ ہارنیس اور کچھ میں ماڈل کا اپنا ایجنٹ استعمال ہوتا ہے؛ شائع کردہ معیاری غلطی میں پرامپٹس، سیڈز یا تعیناتی کی ترتیبات کے فرق شامل نہیں۔ اس تناظر میں چھوٹے اسکور فرق کو سمجھنا چاہیے۔

Google DeepMind کی اپنی تقابلی فہرست ہر میدان میں برتری کے دعوے کے خلاف مزید مثالیں دیتی ہے۔ DeepSWE v1.1 میں Argon نے GPT-6 Astra سے بہتر اسکور کیا، 77.9% to 74.1%؛ مگر FrontierSWE v2 میں Astra سے پیچھے رہا، 55.0% to 65.5%اور Terminal-Bench Science میں بھی، 57.6% to 68.1%۔ Terminal-Bench 4.0 میں Claude Opus 5.5 نے Argon کو پیچھے چھوڑا، 66.4% to 57.4%اور PostTrainBench میں بھی، 49.3% to 45.3%۔ فہرست کے آف لائن OSWorld-2.0 ذیلی مجموعے میں Astra نے 72.6% اور Argon نے 69.2%اسکور کیے۔ یہ موازنے Google کی منتخب فہرست اور اس کے بیان کردہ بینچ مارک طریقوں پر مبنی ہیں؛ دستاویزی عوامی سروس میں صارفین کی اپنی آزمائش کا متبادل نہیں۔

Google کے مطابق Argon ایک ہی سلسلے میں زیادہ سے زیادہ دس لاکھ آؤٹ پٹ ٹوکنتیار کر سکتا ہے، جو پہلے کی 64,000 ٹوکن حد سے زیادہ ہے۔ Vals نے دس لاکھ ٹوکن کی سیاق ونڈو درج کی، مگر Argon کی اپنی جانچ میں زیادہ سے زیادہ آؤٹ پٹ 262,144 ٹوکنرکھی۔ اس ترتیب سے Google کی مستقبل کی مصنوعات کی قطعی حد ثابت نہیں ہوتی۔ البتہ Vals کے عوامی نتائج دس لاکھ ٹوکن کی مکمل تیاری نہیں دکھاتے، اور Google نے عام ڈویلپرز کے لیے دستیاب آؤٹ پٹ حد واضح کرنے والی عوامی API تفصیل بھی جاری نہیں کی۔

اندرونی استعمال اور حفاظت کے دعووں کے لیے الگ شواہد ضروری ہیں

Google کے مطابق Argon ایجنٹس نے C/C++ سے Rust میں کوڈ منتقلی، کوانٹم کمپیوٹنگ کے ایک ذیلی پروگرام اور ڈیٹا سینٹر کی میموری کو بہتر بنانے میں مدد دی۔ اس کا کہنا ہے کہ میموری کی تبدیلیوں کے ایک مجموعے سے اجرا کے بعد 300 TiB سے زیادہ جگہ خالی ہوئی۔ Google یہ بھی کہتا ہے کہ اس کے شراکت دار Wiz نے Argon کے ذریعے طبی سافٹ ویئر میں ایک سنگین خامی دریافت کی۔ یہ اندرونی یا شراکت داروں کے کام سے متعلق Google کے بیانات ہیں؛ اجرا کے مواد میں اتنی آزاد تفصیل نہیں کہ نتائج کی تصدیق یا تکرار کی جا سکے۔ Google کہتا ہے کہ Rust میں بڑی تبدیلیوں کو پیداوار میں شامل کرنے سے پہلے خودکار اور انسانی جائزہ ہوتا ہے۔

حفاظت کے لیے Google نقصان دہ درخواستوں سے انکار کی تربیت، بالواسطہ پرامپٹ انجیکشن کے خلاف دفاع، صارف کی نیت سے ہٹنے والے رویے کو پکڑنے کے لیے ماڈل کے استدلال اور عمل کی نگرانی، اور جائزہ ماحول کی مضبوط علیحدگی بیان کرتا ہے۔ بالواسطہ پرامپٹ انجیکشن کے خلاف Argon کو اپنا سب سے مضبوط ماڈل کہنا فراہم کنندہ کا دعویٰ ہے۔ Google کے مطابق ابتدائی سائبر گروپ کو بھی معمول کی سائبر حفاظتی پابندیوں کے بغیر رسائی مل رہی ہے، اس لیے دائرۂ رسائی بڑھنے پر نگرانی خاص طور پر اہم ہوگی۔

روزمرہ افادیت کے بارے میں ابتدائی شواہد ایک دوسرے سے متفق نہیں۔ Axios نے رپورٹ کیا کہ Bloomberg نے گمنام ذرائع کے حوالے سے لکھا کہ Google کے بعض ملازمین نے Argon کی اندرونی کارکردگی کو کمزور سمجھا؛ Axios کے مطابق Google نے Bloomberg کو بتایا کہ یہ بات درست نہیں۔ Google نے Axios کو کہا کہ ملازمین نے ماڈل کو مشکل کوڈنگ اور تحقیق کے کاموں میں استعمال کیا۔ ان میں سے کوئی بیان عوامی ورژن کی کارکردگی طے نہیں کرتا۔ اگلا مفید ثبوت دستاویزی ترتیبات کے تحت رسائی اور ایسے کام کے نتائج و اخراجات ہوں گے جنہیں دوسرے لوگ جانچ سکیں۔