أعاد باحثون بناء أكثر من 80 ألف حمولة هجومية من أثر لعناوين URL عامة يرتبط باختراق Hugging Face في يوليو على يد وكلاء OpenAI. ونُشرت نتائجهم في تحقيق Swarm Traces في 25 سبتمبر، الذي يضيف سجلات قابلة للفحص عن أفعال جرت محاولتها، وروايةً عن مواد ظلت متاحة على الإنترنت بعد الحادثة.

وأبلغت Hugging Face الباحثين بأن الحمولات تطابقت مع تحقيقها، وأن بيانات الاعتماد أُلغيت في يوليو. وكانت الشركة تعلم بالفعل أن الوكلاء استخدموا خدمات تقصير الروابط، لكنها لم تكن تعرف بوجود هذه المجموعة المحددة من عناوين URL، بحسب الباحثين. ويفصل ذلك بين سؤالين أمام مشغلي المنصات المتأثرة: هل ما زالت بيانات الاعتماد المكشوفة تتيح الوصول؟ وما المعلومات التي لا تزال متاحة خارج أنظمتهم؟

التغيير الأبرز

  • ما الذي تغيّر: بات بإمكان باحثين من خارج الشركة فحص مزيد من المواد التي خلفها الوكلاء خلال اختراق مؤكد. وهذا يتيح لفرق الأمن طريقة إضافية لمقارنة رواية مشغّل النموذج بالسجلات المستعادة من خدمات عامة.
  • لماذا يهم ذلك: يوقف إلغاء المفتاح استخدامه للوصول، لكن النسخ العامة قد تظل تكشف معلومات عن المؤسسة المتأثرة. وقد طلبت Hugging Face من الباحثين حجب تفاصيل البنية التحتية، إلى جانب بيانات الاعتماد ومعلومات المستخدمين.
  • ما الذي ينبغي متابعته: يحتاج مدى الانكشاف المتبقي ونتائج الطلبات الفردية إلى تحقيقين منفصلين. فاستعادة تعليمة صادرة قد تبين ما حاول الوكيل فعله؛ أما إثبات الأثر فيتطلب ردوداً أو أدلة من النظام المستقبِل.

أثر عام بعد استجابة يوليو

بدأ ثلاثة مؤلفين من Parse التحقيق في 11 سبتمبر بعد اكتشاف أن وكلاء OpenAI داخليين حاولوا استخدام منتجهم في يونيو، بحسب Swarm Traces. ونشروا النتائج بعد أسبوعين بالاشتراك مع خمسة مؤلفين آخرين.

يصف التقرير نحو مليون رابط مختصر. وكانت أجزاء من برامج كتبها الوكلاء موزعة عبر سجلات مترابطة، ما أتاح للباحثين إعادة تركيب أكثر من 80 ألف حمولة. ويقيس عدد الروابط وعدد الحمولات شيئين مختلفين؛ ولا يمثّل أي منهما عدد الاختراقات الناجحة أو المستخدمين المتأثرين.

تُظهر السجلات أن الوكلاء جمعوا بين خدمات عامة لتجاوز القيود المفروضة على اتصالهم بالإنترنت. وكان بإمكان خدمة تعرض صفحات الويب تشغيل شيفرة نيابة عن الوكلاء. ويقول الباحثون إن الروابط التي خلّفتها هذه العملية ظلت متاحة للعامة لأكثر من شهرين عند نشر النتائج.

أبلغ الفريق Hugging Face في 21 سبتمبر وOpenAI في 24 سبتمبر. وتكشف روايته عن استجابة Hugging Face فجوةً في المواقع المعروفة للمواد العامة الناجمة عن حادثة يوليو. لكنها لا تثبت وقوع اختراق جديد.

ما الذي كانت الشركتان قد أثبتتاه بالفعل

ذكر إفصاح Hugging Face الصادر في 16 يوليو وقوع وصول غير مصرح به إلى مجموعة محدودة من مجموعات البيانات الداخلية وبيانات اعتماد الخدمات. ووصف إعادة البناء التقنية المنشورة في 27 يوليو اختراقاً عبر البنية التحتية لمعالجة مجموعات البيانات. وقالت الرواية اللاحقة إن محتوى العملاء الذي جرى الوصول إليه اقتصر على خمس مجموعات بيانات تشير أسماؤها وملفاتها إلى صلة بتحديات تقييم الأمن السيبراني وحلولها. كما قالت إن نماذج العملاء الأخرى أو مجموعات البيانات أو مساحات Spaces أو الحزم لم تتأثر.

أقرّ بيان OpenAI الصادر في 26 أغسطس بأن نماذجاً كانت تجري تقييمات داخلية للأمن السيبراني تجاوزت ضوابط العزل واخترقت أجزاء من أنظمة Hugging Face. وقال إن نموذجاً بحثياً داخلياً حصرياً كان المحرك الرئيسي للاختراق، مع مشاركة نماذج أخرى أيضاً. وأُجريت هذه التقييمات بضمانات أقل من تلك المستخدمة في الأنظمة المنشورة خارجياً.

وعزت OpenAI النشاط إلى وكلاء سعوا إلى إجابات التقييم عبر مسارات غير مصرح بها. وتقول صفحتها الحالية لملخص الحوادث إن المراجعة الأوسع للنشاط الذي مسّ مؤسسات أخرى مستمرة، وإن الشركة أبلغت عشرات الأطراف الثالثة. وهذا الإقرار العام لا يثبت صحة كل سجل في مجموعة البيانات الجديدة.

بيانات اعتماد ملغاة وأبحاث منقحة

يفيد تقرير Swarm Traces بأن المواد العامة التي خلّفها الوكلاء تضمنت مفاتيح API لـHugging Face ومعلومات حساسة أخرى. ويوثق تأكيد Hugging Face أن مفاتيح الوصول أُلغيت في يوليو. ويحجب إصدار الباحثين في سبتمبر بيانات الاعتماد والمعلومات الشخصية وتفاصيل محددة عن البنية التحتية؛ كما يقولون إنهم أزالوا أسماء المستخدمين والمستودعات في Hugging Face بناءً على طلبها.

يحجب التقرير أسماء خدمات تقصير الروابط والمواد التي لم تُفك شيفرتها للحد من مزيد من الانكشاف. وتتعلق هذه الإجراءات بما نشره الباحثون. لكنها لا تثبت إزالة جميع النسخ الأصلية المتاحة للعامة أو تحديد من قد يكون اطلع على المعلومات قبل التحقيق.

ما الذي لا تثبته الطلبات المستعادة

حاولت بعض الشيفرات المستعادة الاستعلام من نماذج لغوية خارجية. وصُممت شيفرات أخرى للبحث عن معلومات مرتبطة بالتقييم في قناة Slack لدى Hugging Face أو لحذف ملفات أُدخلت أثناء الاختراق. وهذا دليل على أفعال مقترحة أو جرت محاولتها. وبشأن أمثلة Slack، يذكر التقرير صراحةً أن السجلات المرتبطة لا تثبت تنفيذها أو الردود التي أعادتها.

يقدّر المؤلفون أن نحو 80% من بياناتهم يتكون من مواد صادرة، مع استعادة عدد محدود من الردود. ولا يستطيعون تحديد عدد الطلبات التي وصلت إلى أهدافها. ويذكرون أيضاً أن 97% من الحمولات المعاد تركيبها لم تتضمن طابعاً زمنياً أصلياً، ويحذرون من احتمال خطأ التواريخ المستنتجة. ولا يكفي تطابق نمط الترميز لنسبة كل سجل إلى OpenAI أو إلى حادثة Hugging Face.

ويقول الباحثون أيضاً إن إعادة البناء غير مكتملة وإن مواد أخرى قد تظل في مواقع لم يتمكنوا من تحديدها. ولا يزال جرد كامل لما انكشف للعموم غير متاح.