Google ৩০ সেপ্টেম্বর Gemini 4 Argon ঘোষণা করে জ্ঞানভিত্তিক কাজ ও কোডিংয়ে ভালো স্কোর, সর্বোচ্চ ১০ লাখ আউটপুট টোকেনের দাবি এবং ভবিষ্যৎ API-র মূল্য প্রকাশ করেছে। প্রথমে বিশ্বস্ত সাইবার প্রতিরক্ষা বিশেষজ্ঞ ও পরীক্ষকদের একটি ছোট দলকে মডেলটি দিচ্ছে। ডেভেলপারদের জন্য প্রকাশ্য মডেল ID বা অর্থের বিনিময়ে API গ্রাহক ও Google AI Ultra সদস্যদের ব্যবহারের তারিখ দেয়নি। Google-এর ঘোষণা এবং Gemini API মডেল ক্যাটালগ দেখায় যে ঘোষণা আর অধিকাংশ পাঠকের প্রবেশাধিকারের মধ্যে ফারাক রয়েছে।
মূল পরিবর্তন
- কী বদলেছে: Google নতুন একটি শীর্ষস্থানীয় মডেল নির্বাচিত সাইবার প্রতিরক্ষা বিশেষজ্ঞদের হাতে দিয়েছে, অথচ অধিকাংশ ডেভেলপার ও সদস্য এখনও এটি ব্যবহার করতে পারেন না। সক্ষমতা ও মূল্য নিয়ে প্রধান দাবিগুলো প্রকাশিত হয়েছে, কিন্তু প্রকাশ্য API এখনও আসেনি।
- কেন গুরুত্বপূর্ণ: Vals AI-এর স্বাধীন মূল্যায়নে বিস্তৃত জ্ঞানভিত্তিক কাজ ও একটি আর্থিক এজেন্ট পরীক্ষায় Argon প্রথম হয়েছে। মডেল তুলনা করা দলগুলোর সামনে তাই বিবেচনার মতো নতুন প্রার্থী এসেছে। কাজভেদে ফল ভিন্ন এবং প্রবেশাধিকার সীমিত হওয়ায় নিজস্ব কাজের প্রবাহে ফল ও খরচ এখনও অনিশ্চিত।
- যা নজরে রাখবেন: পরবর্তী দল হিসেবে Google অর্থের বিনিময়ে API গ্রাহক ও AI Ultra সদস্যদের উল্লেখ করেছে, তবে তারিখ দেয়নি। নথিভুক্ত মডেল ID ও পরিষেবার সীমা প্রকাশ পেলে ডেভেলপাররা নিজেদের জরুরি কাজ পরীক্ষা করতে পারবেন, ঘোষিত ১০ লাখ আউটপুট টোকেন বাস্তবে ব্যবহার করা যায় কি না তাও বুঝবেন।
এখন কারা Gemini 4 ব্যবহার করতে পারেন
Google বলছে, প্রথম ব্যবহারকারীরা তাদের Fairwind কর্মসূচিরবিশ্বস্ত সাইবার প্রতিরক্ষা বিশেষজ্ঞ ও পরীক্ষক। Fairwind হলো নির্বাচিত Google Cloud গ্রাহক, সরকারি সংস্থা ও নিরাপত্তা অংশীদারদের জন্য সীমিত প্রবেশের কর্মসূচি। Google বলছে, বিশ্বস্ত প্রতিরক্ষাকারীরা যাতে এর প্রতিরক্ষামূলক সক্ষমতা কাজে লাগাতে পারেন, সে জন্য Argon-এ প্রচলিত সাইবার সুরক্ষা বিধিনিষেধ রাখা হয়নি। এই প্রাথমিক প্রকাশ বিশেষ সংবেদনশীল ব্যবহারের একটি নিয়ন্ত্রিত পরীক্ষা।
Google ডেভেলপার, প্রতিষ্ঠান ও ভোক্তাদের কাছে প্রবেশাধিকার বাড়াতে চায়; শুরু হবে অর্থের বিনিময়ে API গ্রাহক ও Google AI Ultra সদস্যদের দিয়ে। এ ধাপের তারিখ নেই। ১ অক্টোবর দেখা Google-এর Gemini API মডেল ডিরেক্টরি তে Gemini 3 মডেল ছিল, কিন্তু Gemini 4 Argon ID ছিল না। এর API মূল্য পৃষ্ঠাতেও Argon-এর কোনো সারি ছিল না। তাই API কলের নির্দেশিকা লিখতে Google যে মডেল নাম ও প্রবেশপথ নথিভুক্ত করেনি, তা বানিয়ে নিতে হবে।
তবুও Google-এর প্রকাশনা পোস্টে ভবিষ্যৎ টোকেন মূল্য জানানো হয়েছে। প্রাথমিক মূল্য প্রতি ১০ লাখ ইনপুট টোকেনে ২ ডলার এবং প্রতি ১০ লাখ আউটপুট টোকেনে ১০ ডলার; ক্যাশ করা ইনপুটের মূল্য ইনপুট হারের চেয়ে ৯৫% কম। প্রাথমিক সময়ের পর মূল্য বেড়ে ৪ ও ২০ ডলারহবে বলে Google জানিয়েছে। প্রাথমিক সময় কখন শেষ হবে তা জানায়নি। এগুলো ঘোষিত মূল্য, বর্তমানে পাওয়া স্ব-পরিষেবা API-র মূল্য নয়। দীর্ঘ এজেন্ট কাজের যুক্তি, টুল ব্যবহার ও আউটপুটের পরিমাণ না জানলে প্রতি টোকেন মূল্য থেকেও মোট খরচ বোঝা যায় না।
ভালো স্কোর, তবে দুর্বলতাও স্পষ্ট
Argon নিয়ে Vals AI-এর স্বাধীন মূল্যায়ন Vals Index-এ 68.90% ± 0.97 স্কোর পেয়েছে এবং তাদের তালিকার ৪১টি মডেলের মধ্যে প্রথম। Finance Agent v2-তে ৭৩টির মধ্যে প্রথম, স্কোর 65.40% ± 0.32। Vibe Code Bench-এ ১০৬টির মধ্যে দ্বিতীয়, 91.91% ± 1.90; Code Migration-এ ৭১টির মধ্যে দ্বিতীয়, 68.17% ± 4.35; CyberBench v1.1-এ ৪৩টির মধ্যে দ্বিতীয়, 77.86% ± 5.30। ফলগুলো কয়েকটি কাজে শক্তিশালী সূচনা দেখায়, তবে সব কাজেই Argon সেরা—এমন নয়।
একই মূল্যায়ক Terminal-Bench 4.0-এ ৪২টি মডেলের মধ্যে Argon-কে পঞ্চম স্থানে রেখেছে, স্কোর 57.58% ± 2.31; MedScribe-এ ১০৬টির মধ্যে পঞ্চদশ এবং কম্পিউটার ব্যবহারের CUA-bench-এ আটটির মধ্যে সপ্তম, স্কোর 4.83%। পরীক্ষাপ্রতি মাপা খরচেও বড় পার্থক্য: Vals Index পরীক্ষায় $15.68 এবং CUA-bench-এ $193.78 । এগুলো মূল্যায়নের কাজের খরচ, Google-এর ঘোষিত প্রতি ১০ লাখ টোকেনের মূল্যের থেকে আলাদা। Vals বলছে, কিছু এজেন্ট মূল্যায়নে নির্দিষ্ট হ্যারনেস এবং অন্যগুলোতে মডেলের নিজস্ব এজেন্ট ব্যবহৃত হয়; প্রকাশিত স্ট্যান্ডার্ড এরর প্রম্পট, সিড বা স্থাপনার সেটিংসের ভিন্নতা ধরে না। স্কোরের সামান্য পার্থক্য এই প্রেক্ষাপটে দেখা উচিত।
Google DeepMind-এর নিজস্ব তুলনা তালিকা সবক্ষেত্রে এগিয়ে থাকার দাবির বিরুদ্ধে আরও উদাহরণ দেয়। DeepSWE v1.1-এ Argon GPT-6 Astra-কে ছাড়িয়ে যায়, 77.9% to 74.1%; কিন্তু FrontierSWE v2-তে Astra-র পিছনে, 55.0% to 65.5%এবং Terminal-Bench Science-এও পিছনে, 57.6% to 68.1%। Terminal-Bench 4.0-এ Claude Opus 5.5 Argon-এর চেয়ে এগিয়ে, 66.4% to 57.4%; PostTrainBench-এও, 49.3% to 45.3%। তালিকার অফলাইন OSWorld-2.0 উপসেটে Astra-র স্কোর 72.6% আর Argon-এর 69.2%। এসব তুলনা Google-এর বাছাই করা তালিকা ও প্রকাশিত বেঞ্চমার্ক সেটআপ ব্যবহার করে; নথিভুক্ত প্রকাশ্য পরিষেবায় গ্রাহকের পরীক্ষার বিকল্প নয়।
Google বলছে Argon একবারের ধারায় সর্বোচ্চ ১০ লাখ আউটপুট টোকেনতৈরি করতে পারে; আগের সীমা ছিল ৬৪,০০০ টোকেন। Vals এক মিলিয়ন টোকেনের কনটেক্সট উইন্ডোর কথা বললেও Argon মূল্যায়নে সর্বোচ্চ আউটপুট রেখেছে ২,৬২,১৪৪ টোকেন। এ সেটিং Google-এর ভবিষ্যৎ পণ্যের চূড়ান্ত সীমা নির্ধারণ করে না। তবে Vals-এর প্রকাশ্য ফল সম্পূর্ণ এক মিলিয়ন টোকেন তৈরি দেখায় না, আর সাধারণ ডেভেলপারদের জন্য আউটপুট সীমা স্পষ্ট করে এমন প্রকাশ্য API এন্ট্রি Google এখনও প্রকাশ করেনি।
অভ্যন্তরীণ ব্যবহার ও নিরাপত্তার দাবির আলাদা প্রমাণ দরকার
Google বলছে, Argon এজেন্ট C/C++ থেকে Rust-এ কোড স্থানান্তর, কোয়ান্টাম কম্পিউটিং সাবরুটিন এবং ডেটা সেন্টারের মেমরি অপ্টিমাইজেশনে সাহায্য করেছে। মেমরির একগুচ্ছ পরিবর্তন চালুর পর ৩০০ TiB-এর বেশি জায়গা খালি হয়েছে বলেও জানায়। অংশীদার Wiz Argon দিয়ে স্বাস্থ্যসেবা সফটওয়্যারের একটি গুরুতর দুর্বলতা খুঁজে পেয়েছে বলেও Google জানিয়েছে। এগুলো অভ্যন্তরীণ বা অংশীদারদের কাজ নিয়ে Google-এর বিবরণ; ফল যাচাই বা পুনরাবৃত্তির মতো স্বাধীন বিস্তারিত লঞ্চ উপকরণে নেই। Google বলছে, Rust-এ বড় পুনর্লিখন উৎপাদনে যাওয়ার আগে স্বয়ংক্রিয় ও হাতে পরীক্ষা হয়।
নিরাপত্তার জন্য ক্ষতিকর অনুরোধ প্রত্যাখ্যানের প্রশিক্ষণ, পরোক্ষ প্রম্পট ইনজেকশনের বিরুদ্ধে প্রতিরক্ষা, ব্যবহারকারীর উদ্দেশ্যের বাইরে আচরণ শনাক্তে মডেলের যুক্তি ও কাজ পর্যবেক্ষণ, এবং মূল্যায়ন পরিবেশ আরও বিচ্ছিন্ন করার কথা Google জানিয়েছে। Argon তাদের পরোক্ষ প্রম্পট ইনজেকশন প্রতিরোধে সবচেয়ে শক্তিশালী মডেল—এটি সরবরাহকারীর দাবি। Google-এর মতে, প্রথম সাইবার দলও প্রচলিত সাইবার সুরক্ষা বিধিনিষেধ ছাড়া প্রবেশাধিকার পাচ্ছে; পরিধি বাড়লে প্রবেশের আওতা ও পর্যবেক্ষণ তাই বিশেষ গুরুত্বপূর্ণ।
দৈনন্দিন উপযোগিতা নিয়ে প্রাথমিক প্রমাণ পরস্পরবিরোধী। Axios জানায় যে Bloomberg বেনামি সূত্রের বরাত দিয়ে বলেছে, কিছু Google কর্মীর কাছে Argon-এর অভ্যন্তরীণ কর্মক্ষমতা দুর্বল মনে হয়েছে; Axios আরও জানায়, Google Bloomberg-কে বলেছে খবরটি সঠিক নয়। Google Axios-কে জানায়, কর্মীরা কঠিন কোডিং ও গবেষণার কাজে মডেলটি ব্যবহার করেছেন। কোনোটিই প্রকাশ্য সংস্করণের কর্মক্ষমতা মীমাংসা করে না। পরের কার্যকর প্রমাণ হবে নথিভুক্ত সেটিংসে প্রবেশাধিকার এবং অন্যদের যাচাইযোগ্য কাজের ফল ও খরচ।



