توظف الشركات أشخاصًا لمقارنة إجابات النماذج وشرح أخطائها وتقديم أمثلة على عمل أفضل. وفي هذا السياق، لا تمثل الإجابة المصقولة سوى جزء من المطلوب؛ فقد يدفع المشتري مقابل حكم لم يصدر عن النموذج موضع الاختبار.
تقرير 404 Media يفيد بأن ثلاثة متعاقدين يعملون في مشروعات مرتبطة بـOpenAI وصفوا قواعد تمنع استخدام الذكاء الاصطناعي، وقال اثنان إن متعاقدين استُبعدوا بسبب ذلك. وأخبرت Mercor، التي وفرت اثنين من الأشخاص الذين أُجريت معهم المقابلات، الصحيفة بأن عقودها تحظر استخدام النماذج اللغوية الكبيرة لإنجاز عمل المشروع، وأن الانتهاكات المؤكدة تؤدي إلى الاستبعاد. ورفضت OpenAI التعليق. ولم نطّلع على وثائق المشروعات الخاصة ولم نتحقق بصورة مستقلة من الحالات الفردية.
يتجاوز السؤال المفيد منصة تعاقد واحدة: عندما تطلب شركة مراجعة بشرية مستقلة، كيف تفصل هذا العمل عن المهام التي ترحب فيها بالمساعدة من الذكاء الاصطناعي؟
التغيير الأبرز
- ما الذي تغيّر: يكشف النزاع المبلغ عنه بشأن المتعاقدين عن خلاف حول ما يفترض أن يقدمه عمل تدريب الذكاء الاصطناعي: إجابات مكتملة أم تقييم بشري مستقل.
- لماذا يهم: يجعل البرنامج التجريبي العام لـMercor الحكم المهني معيارًا للتقييم. واستبدال ترتيب النماذج الذي يجريه الإنسان بترتيب مولّد آليًا يغيّر ما يقيسه التقييم، حتى إن كانت الإجابة المقدمة مكتوبة بإتقان.
- ما الذي ينبغي مراقبته: القرار الأهم لجهات شراء التقييم هو تحديد المراحل التي تتطلب حكمًا مستقلًا عن المساعدة. وينبغي تضمين ذلك في تعليمات المهمة، كي يطلع عليها العامل قبل قبولها.
قد يكون الاستقلال هو الشيء الذي يجري شراؤه
يكون مساعد الذكاء الاصطناعي مفيدًا عندما تكون المهمة إعداد مسودة أولى بسرعة. لكنه يصبح مشكلة عندما تتطلب المهمة إجابة مرجعية أو مقارنة مستقلة ويُخفى هذا الفرق.
ويشرح إعلان Mercor العام تفاصيل برنامج تجريبي لتقييم النماذج في مجال الأعمال، الذي يحدد هذا الشرط بوضوح غير معتاد. إذ يحل الخبراء مهمة مهنية، ويرتبون خمس محاولات للنماذج، ويقيّمونها ويكتبون مبررات تستند إلى الأدلة. ويذكر الإعلان عدم توفير معيار تقييم أو إجابة نموذجية، لأن الحكم المهني هو ما يجري قياسه. كما يحظر استخدام مساعدات الذكاء الاصطناعي أثناء حل المهمة وترتيب الإجابات وتقييمها وكتابة المبررات.
تصف هذه الشروط برنامجًا تجريبيًا واحدًا. وتعتمد المقارنة فيه على تقييم المهني نفسه؛ أما تفويض ذلك التقييم إلى نموذج فيغيّر التجربة.
البيانات الاصطناعية ليست سيئة بالضرورة
من المغري ربط أي إجابة تدريبية مولدة بالذكاء الاصطناعي بظاهرة «انهيار النماذج». لكن ذلك يتجاوز الأدلة المتاحة هنا. بحث نُشر في مجلة Nature درس أنظمة تدريب تكراريًا تحل فيها البيانات المولدة محل بيانات مستمدة من توزيع أصلي. وفي تلك التجارب، فقدت النماذج المتعاقبة معلومات عن التوزيع الأساسي. لكن ذلك الإعداد لا يدرس عمل المتعاقدين المذكور في التقارير، ولا تستطيع الورقة إخبارنا ما إذا كان تقييم بعينه قد أثر في نموذج OpenAI مستخدم فعليًا.
وتوضح دراسة أخرى عن انهيار النماذج سبب أهمية هذا التمييز. فقد رصد مؤلفوها انهيارًا عندما حلت البيانات الاصطناعية لكل جيل محل البيانات الأصلية الحقيقية، لكنهم تجنبوه في تجاربهم عندما ظلت البيانات الحقيقية موجودة وتراكمت البيانات الاصطناعية المتعاقبة إلى جانبها. ولا تثبت النتيجة أن كل مزيج آمن. لكنها توضح أن وصف البيانات بأنها «مولدة بالذكاء الاصطناعي» لا يكفي وحده لتشخيصها؛ فمصدر البيانات وآلية اختيارها وعملية التدريب أمور مهمة.
اجعل سير العمل المسموح به صريحًا
ينبغي للتكليف أن يحدد الأدوات المسموح بها، والمراحل التي تتطلب حكمًا مستقلًا، وكيفية إفصاح العاملين عن المساعدة. ويشترط البرنامج التجريبي لـMercor الاستقلال في حل المهمة وتقييمها. أما المشترون الذين يكلفون بعمل بمساعدة الأدوات فعليهم وصف الحكم المهني الذي ما زالوا يتوقعون من العامل تقديمه.
تحتاج المراجعة إلى القدر نفسه من العناية. ويفيد تقرير 404 Media بأن وثيقة داخلية حذرت المراجعين من استخدام أدوات كشف الذكاء الاصطناعي ووصفتها بأنها غير موثوقة. ويتفق ذلك مع مبدأ إداري أساسي: علامات الترقيم أو السرعة أو الصياغة المصقولة لا تثبت استخدام شخص لنموذج. ويمكن للمراجع فحص ما إذا كان المبرر يستشهد بالمواد المصدرية، وطلب شرح قرار من العامل، ومقارنة الأعمال المتكررة، والتحقق من سجلات الأدوات التي يجمعها المشروع على نحو قانوني. ولا ينبغي لأي علامة أسلوبية منفردة أن تحسم قضية عامل.
يحتاج العاملون إلى قاعدة يمكن الاعتراض عليها، لا إلى لعبة تخمين
قد يفقد المتعاقدون المستقلون إمكانية الوصول إلى المشروع بسرعة. لذلك ينبغي لنظام موثوق أن يوضح القاعدة قبل بدء العمل المدفوع، ويميّز بين الاشتباه بالمخالفة وتأكيدها، ويوفر قناة للعامل لشرح الأدلة ذات الصلة. وهذه توصية بإجراء منصف، وليست ادعاءً بشأن الحقوق بموجب أي عقد أو قانون.
من جانبهم، ينبغي للعاملين اعتبار اشتراط الحكم المستقل جزءًا من مواصفات المنتج. ومن يعتقد أن أداة معتمدة ضرورية يمكنه الاستفسار قبل استخدامها أو رفض المهمة. ولا تصبح المساعدة المخفية مقبولة لمجرد أن النموذج يكتب جيدًا، كما لا يصبح التعاون الخارجي المحظور مقبولًا لأن الإجابة كانت صحيحة.
حدّد مصدر الحكم
يجعل البرنامج التجريبي العام لـMercor مواصفات المنتج صريحة: تقييم مهني مستقل. وينبغي للمشترين الذين يكلفون بعمل مدعوم بالأدوات أن يصفوا بالوضوح نفسه الأدوات المسموح بها والحكم الذي يتعين على العامل تقديمه.



