আটটি উদাহরণে ম্যাথিউ বারম্যানের ২৪ সেপ্টেম্বরের ভিডিওটিতে TypeSafe AI-এর Jev মডেলকে পরিচিত কিছু কাজে ব্যবহার করা হয়েছে: ওয়েব পেজ পরিষ্কার করা, কোনো অংশ খুঁজে বের করা, ইনবক্সের বার্তা সাজানো এবং ইন্টারফেসের উপাদান বেছে নেওয়া। প্রদর্শনীগুলো বিভিন্ন নির্মাতার। সব কটির সাধারণ পদ্ধতি হলো, মডেলকে একটি সীমিত বিচার করতে দেওয়া, আর ইনপুট জোগাড় ও ফল কার্যকর করার কাজ অ্যাপকে করতে দেওয়া।
সিদ্ধান্তটিকে কোডে বা অন্য মডেলের করা কাজ থেকে আলাদা করে দেখলে প্রতিটি ভিডিও থেকে বেশি বোঝা যায়। ব্যবহারকারী যে ভুলটি টের পাবেন, সেটিও মডেল কলের মতোই গুরুত্বপূর্ণ। এগুলো প্রদর্শনী ও প্রাথমিক পর্যায়ের টুল; BIG CHANGE এগুলোর নির্ভুলতা বা দৈনন্দিন নির্ভরযোগ্যতা স্বাধীনভাবে পরীক্ষা করেনি।
বড় পরিবর্তন
- কী বদলেছে: নির্মাতারা ব্রাউজারের শর্টকাট থেকে ইনবক্সের দৃশ্য—বিদ্যমান সফটওয়্যারের নানা ব্যবহারে টাইপ-নির্দিষ্ট AI বিচার বসাচ্ছেন। Jev একটি বাছাই, স্কোর বা সম্ভাব্যতা দেয়; কোন উপাদান বিবেচনা হবে এবং উত্তর অনুযায়ী কী করা হবে, তা অ্যাপ ঠিক করে।
- কেন গুরুত্বপূর্ণ: কেউ পড়া, খোঁজা বা সাজানোর সময়েই একটি প্রাসঙ্গিক সিদ্ধান্ত পাওয়া যায়, পুরো কাজটি চ্যাট ইন্টারফেসে তুলে না দিয়েও। একই নকশায় ভুল র্যাঙ্কিং, আড়াল হয়ে যাওয়া তথ্য এবং অনিচ্ছাকৃত পদক্ষেপের দায় অ্যাপের মালিকদের ওপর থাকে।
- কী নজরে রাখবেন: পরের প্রয়োজনীয় প্রমাণ নির্দিষ্ট কাজভিত্তিক: টুলটি সঠিক অনুচ্ছেদ বেছে নেয় কি না, পেজের জরুরি নিয়ন্ত্রণগুলো অক্ষত রাখে কি না, গুরুত্বপূর্ণ ইমেইল ভালোভাবে সাজায় কি না এবং সাধারণ ব্যবহারে অনিশ্চিত পরিস্থিতি সামলায় কি না। দ্রুত একটি ডেমো এসব প্রশ্নের মীমাংসা করে না।
পেজ পরিষ্কারের উদাহরণে কাজের ভাগ স্পষ্ট
Kitze-এর Unclutter ব্রাউজার এক্সটেনশন সবচেয়ে স্পষ্ট উদাহরণ। এর প্রকল্পের README অনুযায়ী, এক্সটেনশনটি পেজের সম্ভাব্য উপাদান বের করে এবং Jev-কে জিজ্ঞেস করে কোনগুলো অপ্রয়োজনীয়। এরপর ব্রাউজারের কোড সেগুলো উল্টে দেওয়া যায় এমন নিয়মে আড়াল করে, পেজের টেমপ্লেট অনুযায়ী সংরক্ষণ করে এবং নতুন করে মডেলকে না জিজ্ঞেস করেই আবার প্রয়োগ করে। ব্যবহারকারী এক্সটেনশন থামাতে, কোনো উপাদান দৃশ্যমান রাখতে বা পেজ নতুন করে বিশ্লেষণ করতে পারেন। কুকির পপ-আপ আড়াল হতে পারে, তবে এক্সটেনশনটি ব্যবহারকারীর হয়ে Accept বা Reject বোতাম চাপ দেয় না।
এই সীমারেখার বাস্তব তাৎপর্য আছে। Jev কোনো উপাদানকে বাড়তি মনে করতে পারে; কিন্তু ব্রাউজারের মালিকানা তার নয়, সম্মতির পছন্দ সে লেখে না, আর নিয়মটি কত দিন থাকবে সেটিও ঠিক করে না। বাস্তবসম্মত মূল্যায়নে দেখা দরকার, পরিষ্কারের পর নেভিগেশন, accessibility নিয়ন্ত্রণ, পেওয়াল নোটিস বা প্রকৃত সম্মতির বিকল্পগুলো ব্যবহারযোগ্য থাকে কি না। প্রকল্পটিতে source build ও নিজের API key ব্যবহারের ব্যবস্থা আছে, কিন্তু README-তে এসব ভুল নিয়ে স্বাধীন মাঠপর্যায়ের গবেষণা নেই।
ওই Made with Jev ওয়েবসাইট শনাক্তকারী—যা বারম্যানের ভিডিওর ৩:২৯ মিনিটে দেখানো হয়েছে—তার কাজের ধাপ আলাদা। এর নিজস্ব পদ্ধতি অনুযায়ী, ব্রাউজার রেন্ডার হওয়া style মাপে, DeepSeek V4 Flash স্ক্রিনশট বর্ণনা করে, Jev কিছু নির্দিষ্ট লক্ষণের ভিত্তিতে নকশা ও কপি বিচার করে, এবং DeepSeek সংক্ষিপ্ত রায় লেখে। টুলটি anthropic.com-কে ২৬% “slop” স্কোর দেখায়। এটি টুলটির নিজস্ব রুব্রিকে দেওয়া শৈলীগত স্কোর। বারম্যান ভিডিওতে যে অনুমান করেছেন, তার বিপরীতে এই স্কোর Anthropic-এর সাইটের কতটা AI দিয়ে লেখা তা প্রমাণ করে না।
তথ্য সাজানো সিদ্ধান্তের আরেক ধরন
Jonathan Unikowski-এর ইনবক্স ডেমোতে উল্টো-কালানুক্রমিক ক্রমের বদলে গুরুত্ব অনুযায়ী বার্তা সাজানোর প্রস্তাব দেখানো হয়েছে। তাঁর পোস্টে ফিচারটি Avec-এ “আসছে” বলা হয়েছে। সেখানে চালু ইনবক্স, গুরুত্বের সংজ্ঞা, কিংবা জরুরি বার্তা বাদ পড়ার স্বাধীন পরিমাপ নথিবদ্ধ নেই। অ্যাপকেই ইমেইল আনতে, সাজানো তালিকা দেখাতে এবং কিছু archive, label বা send করা হবে কি না ঠিক করতে হবে; ডেমোতে Jev-এর কাজ হলো অগ্রাধিকার নির্ধারণ।
Shubham Saboo-এর Needle এক্সটেনশন পার্থক্যটি আরও স্পষ্ট করে। Saboo-র বক্তব্য অনুযায়ী, Jev পাঠকের প্রশ্নের সঙ্গে পেজের অনুচ্ছেদগুলো মিলিয়ে স্কোর দেয়, আর এক্সটেনশনটি মিল থাকা লেখা সেখানেই হাইলাইট করে। তাঁর বিস্তারিত ব্যাখ্যায় বলা হয়েছে, Needle উত্তর লেখে না: হাইলাইট করা বাক্যটি পেজে আগে থেকেই থাকে। এতে খোঁজার শর্টকাটে কী অনুসন্ধান করা যায় তা বদলে যায়, তবে ভুল বাক্যও হাইলাইট হতে পারে। যাচাইয়ের জন্য সঠিক অনুচ্ছেদ আগে থেকে জানা—এমন প্রশ্ন দরকার; একই পেজে কাছাকাছি কিন্তু পরস্পরবিরোধী বক্তব্যও থাকতে হবে।
Burhan Usman-এর ভিডিও ক্লিপ করার পোস্টে ৯০ মিনিটের বেশি দীর্ঘ ভিডিওতে কোনো বিষয়ের ক্লিপ খুঁজে পাওয়ার কথা বলা হয়েছে। ভিডিওর ৮:৩৪ মিনিটের অংশে বারম্যান বলেন, সিস্টেমটি সম্ভবত transcript ব্যবহার করছে; এটি তাঁর অনুমান, কাজের ধাপের যাচাইকৃত বিবরণ নয়। পোস্টে Jev-এর সুনির্দিষ্ট ইনপুট বা আউটপুট জানানো হয়নি। ক্লিপ তৈরির অ্যাপকে তবু মূল উপাদান আনতে, সময়সীমা নির্ধারণ করতে এবং ডাউনলোডযোগ্য ক্লিপ তৈরি করতে হবে। পোস্টে সময় ও খরচ সম্পর্কে একজন নির্মাতার বিবরণ আছে; নির্ভুলতার পরীক্ষা বা শুরু থেকে শেষ পর্যন্ত কাজের হিসাব প্রকাশিত হয়নি।
UI জোড়া লাগাতে অ্যাপের যে কাজ বাকি থাকে
Chris Tate-এর json-render পরীক্ষা অ্যাপের নিজস্ব বিকল্প থেকে একটি user interface সাজায়। প্রকল্পের Jev নথি বিশেষভাবে স্পষ্ট করে বলেছে: Jev component ও layout-এর অবস্থান বেছে নেয়; কোড specification জোড়ে এবং যাচাই করে; renderer সেটি দেখায়। playground-এর ব্যবসায়িক তথ্য কৃত্রিম, আর ব্যবহারকারী কোনো action নিলে তবেই action handler চলে। তাই এই ডেমো সীমাবদ্ধ বিকল্প থেকে interface সাজানোর একটি উপায় দেখায়—মডেল নিজে ওয়েবসাইট লিখে চালু করছে, তা নয়।
দুটি সৃজনশীল উদাহরণে তুলনামূলক কম ঝুঁকির বাছাই দেখা যায়। Matt DesLauriers-এর রঙের পরীক্ষা লেখা prompt-কে visual demo-তে রঙের palette-এ রূপ দেয়। Stefan-এর emoji পরীক্ষা—যা ৯:৫২ মিনিটে দেখা যায়—টাইপ করা লেখার সঙ্গে emoji-র মিল অনুযায়ী সেগুলো সাজায়। দুই ক্ষেত্রেই অ্যাপ বেছে নেওয়ার মতো দৃশ্যমান উপাদান দেখায়। পোস্টগুলো পারস্পরিক ক্রিয়ার ধারণা তুলে ধরে; কোনো ব্র্যান্ডের সঙ্গে মানানসই হওয়া, contrast-এর শর্ত পূরণ, বা বিভিন্ন ভাষা ও পরিস্থিতিতে কাজ করার প্রমাণ দেয় না।
TypeSafe-এর নথিপত্রে ব্যাখ্যা করা হয়েছে, উদাহরণগুলোতে মিল কেন। দেওয়া state-এর ভিত্তিতে Jev টাইপ-নির্দিষ্ট Choice, Score ও yes/no প্রশ্নের উত্তর দেয়। Choice ও Score উত্তরগুলোর বণ্টন এবং একটি confidence value ফেরত দেয়, যা সফটওয়্যার তার নিজস্ব নিয়মে ব্যবহার করতে পারে। কোম্পানি প্রকৃত কাজটিতে threshold পরীক্ষা করার পরামর্শ দেয়; confidence field নিজে থেকে নির্ভুলতার স্বাধীন প্রমাণ নয়।
উদাহরণগুলো একটি বিশ্বাসযোগ্য নকশার ধারা দেখায়: নির্দিষ্ট নিয়ম খুব অনমনীয় হলে সফটওয়্যার সঠিক সময়ে ছোট একটি প্রশ্ন করতে পারে। কোনো নির্দিষ্ট টুল দৈনন্দিন কাজে জায়গা পাবে কি না, তা নির্ভর করে তার ভুল, সে কী দেখায় বা আড়াল করে, এবং অ্যাপ ব্যবহারকারীকে ভুল থেকে ফেরার উপায় দেয় কি না তার ওপর। এগুলো পুরো workflow-এর বৈশিষ্ট্য—শুধু মডেলের সিদ্ধান্তের নয়।



