تقدم ورقة عمل من هارفارد اختبارًا مفيدًا لادعاء شائع عن الإنتاجية: ينبغي أن تعني كتابة شيفرة أكثر بالذكاء الاصطناعي تسليم برمجيات أكثر. في 718 شركة تستخدم منصة Jellyfish لتحليلات الهندسة، يقدّر Fiona Chen وJames Stratton أن اعتماد وكلاء البرمجة أعقبه ارتفاع بنسبة 30% في أسطر الشيفرة، و20% في عمليات الإيداع، و23% في طلبات السحب لكل موظف نشط. ولم تُظهر مقاييسهما للمسائل والملحمات المكتملة في Jira زيادة ذات دلالة إحصائية. يعود تاريخ النسخة الحالية من الورقة إلى 4 أغسطس 2026؛ وتنتهي بيانات أحداث العمل في مارس 2026.

يهم هذا التباين قادة الهندسة لأن طلب السحب يدخل طابورًا للمراجعة والاختبار وربما التعديل. وفي الدراسة نفسها، ارتفع الوقت المنقضي من تقديم طلب السحب إلى دمجه بنسبة تقديرية بلغت 49% بعد اعتماد الوكلاء. وأصبحت طلبات التغيير أكثر شيوعًا، كما زادت التعليقات لكل طلب سحب. تشير هذه النتائج إلى عبء مراجعة أكبر، لكنها لا تثبت أن كل تغيير كتبه وكيل رديء ولا تحدد معدلًا مقاسًا للعيوب.

التغيير الكبير

  • ما الذي تغير:في هذه الدراسة على مستوى الشركات، تزامن اعتماد وكلاء البرمجة مع نشاط برمجي أكبر بكثير ومراجعات أشد لطلبات السحب، من دون زيادة ذات دلالة إحصائية في المسائل المحلولة أو الملاحم.
  • لماذا يهم ذلك:تقيس الأسطر وعمليات الإيداع وطلبات السحب العمل الداخل إلى عملية الإنتاج. أما العمل المحلول فهو مقياس لاحق. وقد تفوّت الفرق التي تحكم على الوكلاء بحجم الشيفرة وحده العبء الذي يصل إلى المراجعة.
  • ما ينبغي متابعته:قدرة الشركات على زيادة طاقة المراجعة، وما إذا كانت البيانات اللاحقة ستظهر مكاسب في العمل المكتمل. تتتبع ورقة العمل هذه التبني المبكر حتى مارس 2026، ولا تستطيع حسم الآثار طويلة الأمد.

أنتج المساعدون والوكلاء تقديرات مختلفة

يفصل الباحثان بين المساعدين، الذين يقدمون اقتراحات للشيفرة أثناء عمل المطور، و الوكلاء، الذين يمكنهم تولي مهمة أعلى مستوى والعمل عبر عدة خطوات قبل أن يوافق المطور على النتيجة. ويقيسان اعتماد المساعدين من خلال تفعيل تراخيص الأعمال في GitHub Copilot وCursor. أما الوكلاء فيجمعان بيانات استخدام Claude Code مع مؤشرات مثل حسابات الروبوتات وبصمات الأدوات في عمليات الإيداع أو طلبات السحب. وقد لا تشمل هذه المقاييس بعض الاستخدام الفردي أو الأدوات غير المتكاملة. ويمثل تقدير الوكلاء الارتباط الإضافي المحيط باعتمادهم مقارنة بفترة اعتماد المساعدين السابقة؛ ولا يمثل تقديرًا لكل فرد يستخدم وكيلًا.

كانت نتائج المساعدين أصغر: زيادة مقدرة قدرها 12% في الأسطر و9% في عمليات الإيداع و5% في طلبات السحب. ولم تكن ذات دلالة إحصائية في التقديرات الرئيسية للورقة سوى نتيجة عمليات الإيداع. وأظهر اعتماد الوكلاء زيادات ذات دلالة في مقاييس النشاط البرمجي الثلاثة كلها. تسجل عملية الإيداع تحديثًا للشيفرة؛ ويقدم طلب السحب تغييرًا للمراجعة. ولا يثبت أي منهما وصول ميزة إلى المستخدمين. تستخدم الورقة مسائل Jira المحلولة والملاحم الأكبر بوصفها مقاييس لمخرجات مرحلة لاحقة، استنادًا إلى سير العمل المتتبع الذي تضع فيه الفرق علامة الاكتمال بعد المراجعة والاختبار والنشر. وتظل حالة Jira مؤشرًا بديلًا للتسليم، لا قياسًا مستقلًا لما تلقاه المستخدمون.

بالنسبة إلى الوكلاء، بلغ الارتفاع المقدر في المسائل المحلولة 0.12 لكل عامل-شهر، مقابل خط أساس قدره 3.67، مع خطأ معياري قدره 0.17. ولا يمكن تمييز النتيجة إحصائيًا عن الصفر. ولم يظهر إنجاز الملاحم تغييرًا ذا دلالة كذلك. ويذكر الباحثان أن فترة الثقة تستبعد زيادة في إنجاز المسائل تتجاوز 12% من متوسط خط الأساس خلال الفترة المدروسة. وهذا استنتاج أضيق من القول إن الوكلاء لا ينتجون برمجيات مفيدة: إذ تظل المكاسب المتواضعة ممكنة، ولا تستطيع أعداد المسائل التقاط كل تغير في القيمة أو الجودة. واختبر الباحثان تغير حجم المسائل باستخدام مقاييس متوقعة لطول المهام، ولم يجدا دليلًا على ذلك في عينتهما.

وصل عمل أكثر إلى المراجعين

تقدم مقاييس المراجعة آلية معقولة لفجوة المخرجات. فبعد اعتماد الوكلاء، تقدر الورقة 3.45 أيام إضافية بين تقديم طلب السحب ودمجه مقارنة بخط أساس قدره 7.03 أيام، أي زيادة بنسبة 49%. وهذا زمن تقويمي في عملية المراجعة، وليس قياسًا بساعة توقيت لدقائق المراجعة النشطة لشخص ما. وارتفعت حصة طلبات السحب التي تلقت طلبًا رسميًا للتغيير بنحو 12 نقطة مئوية من خط أساس قدره 13%، بينما زادت التعليقات لكل طلب بمقدار 0.58 من خط أساس قدره 1.66، أو 35%. وارتفعت حصة العاملين الذين راجعوا طلب سحب واحدًا على الأقل في الشهر بنحو أربع نقاط مئوية من خط أساس قدره 29%، أي زيادة نسبية قدرها 14%. ولم تُظهر تقديرات المساعدين المماثلة زيادات ذات دلالة في مدة المراجعة أو طلبات التغيير أو التعليقات.

لا تستطيع الورقة أن تحدد من هذه البيانات الوصفية وحدها سبب طلب المراجع للتغييرات. فقد تضغط كثرة الطلبات على طابور مراجعة ثابت السعة؛ كما يمكن أن يؤدي تغير جودة الشيفرة أو معايير المراجعة إلى تدقيق أكبر. ولم يجد الباحثان زيادة ذات دلالة في متوسط حجم طلب السحب، ما يضعف تفسيرًا بسيطًا للتعليقات الإضافية. ولم يفحصا محتوى الشيفرة أو يعدّا مباشرة عيوب العمل الذي أنشأه الوكلاء. ويشرح نموذج الإنتاج ذي المرحلتين كيف يمكن لكتابة الشيفرة بسرعة أكبر وتغير مقدار المراجعة المطلوبة لكل مسودة أن يحدا معًا من المخرجات المكتملة. والنموذج تفسير للملاحظات، وليس اختبارًا منفصلًا يعزل أيًا من الآليتين.

انتشرت أدوات مراجعة الذكاء الاصطناعي أيضًا في العينة: فقد استخدمتها نحو 80% من الشركات بحلول مارس 2026. ومع ذلك، تنسب الورقة 23.3% من تعليقات المراجعة إلى الذكاء الاصطناعي، وتجد تعليقًا واحدًا على الأقل من الذكاء الاصطناعي في 10.8% من طلبات السحب. لذلك لا يعني اعتماد أداة للمراجعة أن المراجعة أصبحت آلية في هذه الشركات.

ما الذي يستطيع التصميم إثباته

حلل الباحثان نحو 300 مليون حدث عمل من يناير 2021 حتى مارس 2026 لدى 718 شركة عميلة وافقت على المشاركة في Jellyfish، تضم 725,938 عاملًا. وقارنا النتائج قبل اعتماد الشركات للمساعدين أو الوكلاء وبعده بنتائج شركات اعتمدت لاحقًا أو لم تعتمد بعد، باستخدام تصميم الفروق في الفروق المتدرج. وتضبط تأثيرات الشركة والشهر التقويمي بعض الفروق الثابتة والاتجاهات الزمنية المشتركة. لكن الاستدلال يظل معتمدًا على مدى قابلية مقارنة المسارات التي كانت ستسلكها تلك الشركات في غياب الاعتماد. واعتمدت الشركات الأكبر حجمًا مبكرًا، وربما أثرت تغيرات غير مقاسة في الاعتماد والعمل الهندسي معًا. الدراسة رصدية، ولا ينبغي قراءة تقديراتها على أنها تجربة عشوائية أو توقع لجميع فرق البرمجيات.

وتتطلب نتيجة التوظيف القدر نفسه من التحفظ. فلم يتمكن الباحثان، باستخدام إجمالي التوظيف المرتبط بـLinkedIn والعاملين النشطين في Jellyfish لقياس التوظيف الهندسي، من عزو تغير ذي دلالة إلى اعتماد الوكلاء خلال الفترة المرصودة. ولا يبين ذلك ما سيحدث للتوظيف بعد فترة أطول من التكيف أو في سوق العمل الأوسع.

تغطية BIG CHANGE السابقة تناولت رواية هندسية منفصلة عن البرمجة بالذكاء الاصطناعي والتسليم الموثوق. وتضيف هذه الدراسة منظورًا عبر شركات متعددة ومقاييس منفصلة للنشاط البرمجي والمراجعة والعمل المحلول. ودرسها العملي هو تتبع تلك المراحل معًا عند تقييم الوكلاء: فالمسودة الأولى الأسرع تغير مقدار العمل المنتظر في المراحل اللاحقة، وهذه الورقة لا تظهر بعد زيادة مقابلة في المسائل أو المشاريع المكتملة.

المصادر ومزيد من القراءة