أعلنت Google عن Gemini 4 Argon في 30 سبتمبر، مع نتائج قوية في أعمال المعرفة والبرمجة، وحدّ معلن لمليون رمز إخراج، وأسعار لإصدار API مستقبلي. وتبدأ Google بإتاحة النموذج لمجموعة أولى من المدافعين والمختبرين الموثوقين في الأمن السيبراني. ولم تنشر معرّفاً عاماً للنموذج للمطورين أو موعداً لاستخدامه من عملاء API المدفوعة أو مشتركي Google AI Ultra. إعلان Google و دليل نماذج Gemini API يوضحان الفجوة بين إطلاق النموذج وإتاحته لمعظم القراء.

التغيير الأبرز

  • ما الذي تغيّر: وضعت Google نموذجاً متقدماً جديداً في أيدي بعض المدافعين في الأمن السيبراني، بينما لا يستطيع معظم المطورين والمشتركين الوصول إليه بعد. وأصبحت أبرز ادعاءات القدرات والأسعار معلنة، لكن API العامة لم تُطرح بعد.
  • لماذا يهم ذلك: تضع تقييمات Vals AI المستقلة Argon في المركز الأول في أعمال المعرفة العامة واختبار لوكيل مالي. وهذا يمنح الفرق التي تقارن النماذج مرشحاً جديداً جدياً. لكن تفاوت النتائج بين المهام ومحدودية الإتاحة يبقيان الأداء والتكلفة في مسارات عمل كل فريق غير محسومين.
  • ما الذي ينبغي متابعته: سمّت Google عملاء API المدفوعة ومشتركي AI Ultra ضمن المجموعات التالية، من دون تحديد موعد. وسيسمح معرّف نموذج موثق وحدود خدمة معلنة للمطورين باختبار المهام المهمة لهم، بما في ذلك التحقق من إمكانية استخدام مليون رمز إخراج عملياً.

من يستطيع استخدام Gemini 4 الآن

تقول Google إن أول المستخدمين هم مدافعون ومختبرون موثوقون في الأمن السيبراني ضمن برنامج Fairwind. وهو برنامج محدود الإتاحة لبعض عملاء Google Cloud والجهات الحكومية وشركاء الأمن. وتقول Google إنها تتيح Argon للمدافعين الموثوقين من دون ضوابط الأمن السيبراني المعتادة كي يستفيدوا من قدراته الدفاعية. وهذا الإطلاق الأولي اختبار مضبوط لحالة استخدام شديدة الحساسية.

تخطط Google لتوسيع الإتاحة للمطورين والشركات والمستهلكين، بدءاً بعملاء API المدفوعة ومشتركي Google AI Ultra. ولم يُحدد موعد لهذه الخطوة. وحتى 1 أكتوبر، كان دليل نماذج Gemini API من Google يعرض نماذج Gemini 3 من دون معرّف لـ Gemini 4 Argon. كما أن صفحة أسعار API لم تتضمن بنداً لـ Argon. ولذلك فإن أي دليل لاستدعاء API سيضطر إلى اختلاق اسم نموذج ومسار وصول لم توثقهما Google.

مع ذلك، ذكرت الشركة أسعار الرموز المستقبلية في منشور الإطلاق. والسعر التمهيدي هو 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، مع خفض سعر الإدخال المخزن مؤقتاً بنسبة 95% عن سعر الإدخال. وبعد الفترة التمهيدية، تقول Google إن الأسعار سترتفع إلى 4 و20 دولاراً. ولم تحدد متى تنتهي الفترة التمهيدية. هذه أسعار معلنة وليست تكلفة API ذاتية الخدمة متاحة اليوم. كما أن سعر الرمز وحده لا يوضح تكلفة مهمة وكيل طويلة قبل معرفة مقدار الاستدلال واستخدام الأدوات والإخراج المطلوب.

نتائج قوية ونقاط ضعف واضحة

يسجل التقييم المستقل لـ Vals AI نموذج Argon نتيجة 68.90% ± 0.97 على Vals Index، في المركز الأول بين 41 نموذجاً في الجدول. كما يتصدر Finance Agent v2 من بين 73 نموذجاً بنتيجة 65.40% ± 0.32. ويأتي ثانياً من بين 106 في Vibe Code Bench بنتيجة 91.91% ± 1.90؛ وثانياً من بين 71 في Code Migration بنتيجة 68.17% ± 4.35؛ وثانياً من بين 43 في CyberBench v1.1 بنتيجة 77.86% ± 5.30. وتدل هذه النتائج على بداية قوية في عدة مهام، لكنها لا تجعل Argon الأفضل في كل مهمة.

ويصنفه المقيّم نفسه خامساً من بين 42 في Terminal-Bench 4.0 بنتيجة 57.58% ± 2.31، وخامس عشر من بين 106 في MedScribe، وسابعاً من بين ثمانية في اختبار استخدام الحاسوب CUA-bench بنتيجة 4.83%. وتتباين التكلفة المقاسة لكل اختبار أيضاً: $15.68 لاختبار Vals Index و $193.78 لاختبار CUA-bench. وهذه تكاليف مهام التقييم، وهي منفصلة عن أسعار Google المعلنة لكل مليون رمز. وتقول Vals إن بعض تقييمات الوكلاء تستخدم بيئة اختبار ثابتة وأخرى تستخدم وكيل النموذج الأصلي؛ ولا تشمل الأخطاء المعيارية المنشورة اختلاف المطالبات أو البذور العشوائية أو إعدادات النشر. وينبغي فهم الفروق الصغيرة في النتائج ضمن هذا السياق.

ويقدم جدول المقارنة الذي نشرته Google DeepMind أمثلة أخرى تنقض ادعاء التفوق الشامل. إذ يتقدم Argon على GPT-6 Astra في DeepSWE v1.1، 77.9% to 74.1%، لكنه يتأخر عن Astra في FrontierSWE v2، 55.0% to 65.5%وفي Terminal-Bench Science، 57.6% to 68.1%. ويتقدم Claude Opus 5.5 على Argon في Terminal-Bench 4.0، 66.4% to 57.4%وفي PostTrainBench، 49.3% to 45.3%. وفي المجموعة الفرعية غير المتصلة بالإنترنت OSWorld-2.0 في الجدول، يسجل Astra 72.6% مقابل 69.2% لـ Argon. وتعتمد هذه المقارنات على اختيارات Google وإعدادات الاختبارات التي ذكرتها، ولا تغني عن تجارب العملاء في خدمة عامة موثقة.

تقول Google إن Argon يستطيع توليد ما يصل إلى مليون رمز إخراج في مسار واحد، بعد أن كان الحد 64,000 رمز. وتذكر Vals نافذة سياق بسعة مليون رمز، لكنها ضبطت تقييم Argon على حد أقصى للإخراج قدره 262,144 رمزاً. ولا يثبت هذا الإعداد حداً نهائياً لمنتج Google المستقبلي. لكنه يعني أن نتائج Vals المنشورة لا تعرض توليد مليون رمز كاملة، وأن Google لم تنشر بعد مدخلاً عاماً لـ API يوضح حد الإخراج المتاح للمطورين عموماً.

الاستخدامات الداخلية وادعاءات السلامة تحتاج إلى أدلة مستقلة

تصف Google وكلاء Argon وهم يساعدون في نقل الشيفرات من C/C++ إلى Rust، وإنشاء روتين فرعي للحوسبة الكمومية، وتحسين الذاكرة في مراكز البيانات. وتقول إن مجموعة من تغييرات الذاكرة وفرت أكثر من 300 TiB بعد تطبيقها. كما تقول إن شريكها Wiz عثر باستخدام Argon على ثغرة خطيرة تؤثر في برمجيات الرعاية الصحية. هذه روايات Google عن أعمال داخلية أو لدى شركائها؛ ولا تتضمن مواد الإطلاق تفاصيل مستقلة كافية للتحقق من تلك النتائج أو تكرارها. وتقول Google إن عمليات إعادة كتابة Rust الكبيرة تخضع لمراجعة آلية وبشرية قبل الإنتاج.

وفي مجال السلامة، تصف Google تدريباً على رفض الطلبات الضارة، ودفاعات ضد حقن المطالبات غير المباشر، ومراقبة استدلال النموذج وأفعاله لرصد السلوك الخارج عن مقصد المستخدم، وعزلاً أقوى لبيئات التقييم. والقول إن Argon نموذجها الأكثر مقاومة لحقن المطالبات غير المباشر هو ادعاء من المورّد. ووفقاً لـ Google، يحصل الفوج السيبراني الأول أيضاً على الإتاحة من دون الضوابط المعتادة للأمن السيبراني، ما يجعل نطاق الوصول والمراقبة مهمين على نحو خاص عند توسيعه.

الأدلة المبكرة على الفائدة اليومية متضاربة. أفادت Axios بأن Bloomberg، نقلاً عن مصادر مجهولة، قالت إن بعض موظفي Google رأوا أن أداء Argon الداخلي ضعيف؛ كما أفادت Axios بأن Google أبلغت Bloomberg أن ذلك غير دقيق. وقالت Google لـ Axios إن الموظفين استخدموا النموذج في أعمال صعبة للبرمجة والبحث. ولا يحسم أي من الروايتين أداء نسخة عامة. والدليل التالي المفيد هو إتاحة الاستخدام ضمن إعدادات موثقة، مع نتائج مهام وتكاليف يستطيع الآخرون فحصها.