7.2

7.2 قياس تطوير البرمجيات المدعوم بالذكاء الاصطناعي

نظرة عامة والدوافع

أرسى الموضوع 7.1 لماذا لم تعد عدة مقاييس حالية تقيس بشكل موثوق ما كانت تقيسه تحت التطوير المدعوم بالذكاء الاصطناعي. هذا الموضوع عن ما ينبغي قياسه بدلًا من ذلك: كيف تعرف، بدليل حقيقي بدلًا من انطباع أو تسويق بائع، ما إذا كانت مساعدة ترميز الذكاء الاصطناعي تساعد فعليًا منظمتك، وبأي مقدار. هذا سؤال مهم حقًا بعواقب ميزانية حقيقية، تمثل تراخيص أدوات الذكاء الاصطناعي تكلفة حقيقية ومستمرة، ينطبق انضباط اقتصاديات الوحدة من الموضوع 5.4 مباشرة، ومنظمة لا تستطيع الإجابة عليه بدليل إما تدفع أكثر من اللازم لأداة لا تساعد أو تستثمر أقل من اللازم في واحدة تساعد فعليًا.

نهج هذا الموضوع يعتمد مباشرة على مبدأ النتائج-فوق-الناتج من الموضوع 1.3، مُطبَّقًا الآن تحديدًا على تقييم أدوات الذكاء الاصطناعي. النهج الساذج والأكثر شيوعًا يقيس التطوير المدعوم بالذكاء الاصطناعي بحجم الناتج، أسطر كود مُولَّدة، واقتراحات مقبولة، ووقت مُوفَّر لكل مهمة كما يُبلِّغ عنه ذاتيًا المطورون، بالضبط المقاييس التي حذّر الموضوع 7.1 من أنها الأكثر عرضة لهذا التحول. النهج الأكثر صرامة الذي يوصي به هذا الموضوع يقيس النتائج: هل قلّلت مساعدة الذكاء الاصطناعي زمن الدورة حقًا بدون تدهور الجودة، وهل قلّلت الوقت المُنفَق على عمل متكرر ومنخفض القيمة حقًا، مُحرِّرة قدرة لعمل أعلى قيمة، وهل أثّرت بشكل قابل للقياس في نتائج الأعمال والمنتج من الجزء 5.

بالنسبة للفرق الكبيرة، الحصول على هذا القياس بشكل صحيح يُحدِّد ما إذا كانت قرارات استثمار أدوات الذكاء الاصطناعي تُتَّخَذ بناءً على دليل أو على ادعاءات بائع وزخم تنظيمي. تحتاج المؤسسات الكبرى التي تتفاوض على عقود أدوات ذكاء اصطناعي واسعة النطاق دليلًا حقيقيًا على القيمة لتبرير الإنفاق ولمقارنة أدوات متنافسة بعدالة؛ تحتاج المنظمات الحكومية، غالبًا تحت تدقيق خاص لإنفاق التقنية، منهجية تقييم صارمة وقابلة للدفاع عنها قبل الالتزام بأموال عامة لتبني أدوات ذكاء اصطناعي على نطاق واسع.

المبادئ الأساسية

  • قِس مساعدة الذكاء الاصطناعي بالنتيجة، لا بحجم الناتج أو إحصاءات استخدام مُبلَّغة من البائع. ينطبق انضباط الموضوع 1.3 بكامل قوته هنا.
  • استخدم مجموعة مقارنة حقيقية حيثما أمكن، لا مجرد مقارنة قبل-وبعد قد يُشوِّشها خط أساس متصاعد على مستوى الصناعة.
  • توفيرات الوقت المُبلَّغة ذاتيًا إشارة ضعيفة بمفردها. اقرنها ببيانات زمن دورة وجودة موضوعية.
  • قِس التكلفة الكاملة، شاملة وقت المراجعة والتصحيح، لا سرعة التوليد فقط.
  • يمكن لمهام ومهندسين مختلفين رؤية قيمة مساعدة ذكاء اصطناعي مختلفة جدًا. تجنّب رقمًا واحدًا ومُمزَّجًا على مستوى المنظمة يُخفي هذا التباين.

التوصيات

ابنِ مقارنة حقيقية، لا مجرد لقطة قبل-وبعد

حيثما أمكن، قارن النتائج بين مجموعة تستخدم مساعدة ذكاء اصطناعي ومجموعة مقارنة لا تستخدمها، عبر نفس الفترة، بدلًا من مقارنة أرقام قبل-وبعد لمنظمتك الخاصة فقط، التي لا تستطيع تمييز تأثير مساعدة الذكاء الاصطناعي عن أي تغيير متزامن آخر (يُنطبَّق تحذير المتغير المُشوِّش من الموضوع 1.6 مباشرة). حيثما كانت مجموعة مقارنة حقيقية غير عملية، قارن على الأقل مقابل خط أساس تاريخي أطول (مخطط تحكم، وفق الموضوع 1.6) بدلًا من لقطة قبل-وبعد واحدة عرضة للارتداد إلى المتوسط أو تغييرات متزامنة غير ذات صلة.

قِس زمن الدورة والجودة معًا، أبدًا ادعاء سرعة مساعدة الذكاء الاصطناعي وحده

طبّق انضباط الموضوعين 2.6 و2.10 مباشرة: تتبّع ما إذا كان العمل المدعوم بالذكاء الاصطناعي يتحرك أسرع عبر مراحل زمن الدورة، وفي نفس الوقت ما إذا كان معدل فشل التغيير أو معدل العيوب المتسربة (الموضوع 5.1) لذلك العمل يتحرك في الاتجاه الخاطئ. مكسب إنتاجية حقيقي يُظهر زمن دورة أسرع بجودة ثابتة أو مُحسَّنة؛ مكسب زائف يُظهر زمن دورة أسرع بجودة مُتدهورة، بالضبط المفاضلة التي حذّر منها الموضوع 7.1، مُكتشَفة هنا عبر نفس انضباط المقياس المقترن الذي يُطبِّقه هذا الكتاب طوال الوقت.

أدرج وقت المراجعة والتصحيح في محاسبة التكلفة الكاملة

كود مُولَّد بالذكاء الاصطناعي أسرع إنتاجًا لكنه أبطأ مراجعة، أو يتطلب تصحيحًا وإعادة عمل أكثر بعد التوليد الأولي، قد يُظهر بلا تحسن صافٍ في زمن الدورة بمجرد قياس خط الأنابيب الكامل، حتى لو شعرت خطوة توليد الكود الأولية بأنها أسرع بشكل كبير للمهندس الفرد. قِس سلسلة زمن الدورة الكاملة (الموضوع 2.6)، لا مرحلة الترميز فقط، لالتقاط هذا بصدق بدلًا من احتساب الفضل لمساعدة الذكاء الاصطناعي بناءً على شعور بالسرعة لكنه ناقص.

عامل توفيرات الوقت المُبلَّغة ذاتيًا كفرضية أولية، لا استنتاجًا

الإبلاغ الذاتي للمطور بأن “هذا وفّر لي ساعة” مفيد كإشارة أولية وكسياق نوعي (ينطبق نهج الموضوع 5.3 المُدمَج كميًا-نوعيًا هنا أيضًا)، لكنه عرضة لنفس تحيزات التذكر والمرغوبية التي يحذّر منها الموضوع 1.5 لأي بيانات مُبلَّغة ذاتيًا، ولا يقول شيئًا عن تكلفة مراجعة أو تصحيح لاحقة. استخدم الإبلاغ الذاتي لتوليد فرضيات حول أين تساعد مساعدة الذكاء الاصطناعي أكثر، ثم تحقق من تلك الفرضيات مقابل بيانات زمن دورة وجودة موضوعية قبل استخلاص استنتاج راسخ.

قسِّم القياس حسب نوع المهمة وتجنّب رقمًا واحدًا مُمزَّجًا

على الأرجح توفر مساعدة ترميز الذكاء الاصطناعي قيمة مختلفة جدًا لمهام نموذجية ومفهومة جيدًا مقارنة بحل مشكلات معقد وحقيقي الجدة. قِس وأبلِغ حسب فئة المهمة بدلًا من متوسط واحد ومُمزَّج على مستوى المنظمة، الذي يمكن أن يُخفي حقيقة أن المساعدة تُقدِّم قيمة قوية في فئة واحدة بينما تُقدِّم قيمة قليلة أو حتى سلبية في أخرى، معلومة سيُخفيها رقم مُمزَّج تمامًا.

المفاضلات: الإيجابيات والسلبيات

النهجالإيجابياتالسلبيات
توفيرات وقت مُبلَّغة ذاتيًا وحدهاسريعة، سهلة الجمعإشارة ضعيفة؛ عرضة للتحيز؛ تتجاهل تكلفة مراجعة لاحقة
مقارنة قبل-وبعد فقطبسيطة الإعدادمُشوَّشة بأي تغيير متزامن آخر أو اتجاه على مستوى الصناعة
مجموعة مقارنة حقيقيةأقوى وأكثر دليل قابل للدفاع عنهأصعب ترتيبًا؛ قد تكون غير عملية لطرح كامل التبني
قياس نتيجة مُقسَّم بالمهمةيكشف أين تتركّز القيمة حقًايتطلب تتبعًا وتصنيفًا أكثر تفصيلًا

التوتر المركزي هو صرامة القياس مقابل الجدوى العملية. مجموعة مقارنة حقيقية ومُتحكَّم بها أقوى دليل لكنها غالبًا غير عملية بمجرد طرح أداة على مستوى المنظمة بلا مجموعة تحكم مُحتفَظ بها. الانطباعات المُبلَّغة ذاتيًا سريعة وسهلة لكنها ضعيفة بمفردها. حُلّ التوتر باستخدام أقوى تصميم مقارنة يسمح به طرحك الفعلي، مجموعة تحكم حقيقية خلال مرحلة تجريبية مبكرة إن أمكن، مخطط تحكم بخط أساس تاريخي إن لا، ومعاملة الإبلاغ الذاتي كأداة توليد فرضيات بدلًا من الكلمة الأخيرة، بغض النظر عن تصميم المقارنة الذي تستخدمه في النهاية.

أسئلة للنقاش مع فريقك

  1. هل كانت لدينا، أو هل نستطيع لا نزال بناء، مجموعة مقارنة حقيقية لتقييم تبني أدواتنا للذكاء الاصطناعي، أم نعتمد كليًا على مقارنة قبل-وبعد؟ إذا لم تُؤسَّس مجموعة مقارنة حقيقية أبدًا، ناقش ما إذا كان مخطط تحكم بخط أساس تاريخي لا يزال يستطيع توفير بديل صارم بشكل معقول.

  2. هل قسنا زمن الدورة والجودة معًا للعمل المدعوم بالذكاء الاصطناعي، أم لدينا فقط ادعاء سرعة بدون فحص جودة مقابل؟ اسحب أيًا كانت البيانات الموجودة وتحقق من هذا الاقتران المحدد؛ إذا لم يوجد، تلك الفجوة أعلى إصلاح أولوية في هذا الموضوع.

  3. هل يشمل قياس زمن دورتنا للعمل المدعوم بالذكاء الاصطناعي وقت المراجعة والتصحيح، أم خطوة التوليد الأولية فقط؟ ادعاء سرعة قائم على وقت التوليد فقط، متجاهلًا تكلفة مراجعة لاحقة، يخاطر بفخ المحاسبة الناقصة الذي يحذّر منه هذا الموضوع مباشرة.

  4. أي ادعاءات توفير وقت مُبلَّغة ذاتيًا جمعناها، وهل تحققنا من أي منها مقابل بيانات موضوعية؟ اختر ادعاءً محددًا ومُكرَّرًا شيوعًا وتحقق مما إذا كانت البيانات الموضوعية تدعمه فعليًا.

  5. هل يُمزِج قياسنا الحالي كل أنواع المهام في رقم واحد، أم نعرف أي فئات عمل محددة ترى أقوى قيمة مساعدة ذكاء اصطناعي؟ إذا مُمزَّج، ناقش ما قد يكشفه تفصيل مُقسَّم بالمهمة يُخفيه الرقم الحالي.

  6. لو اضطررنا للدفاع عن استثمار أدواتنا للذكاء الاصطناعي لصاحب مصلحة مالي متشكك اليوم، باستخدام دليل بدلًا من انطباع، ماذا سنستطيع فعليًا إظهاره له؟ هذا الاختبار الملموس يكشف الفجوة بين ما تعتقده منظمتك حاليًا حول قيمة مساعدة الذكاء الاصطناعي وما تستطيع فعليًا إثباته بدليل.

منظور القطاع

الشركات الناشئة. دراسة مجموعة مقارنة رسمية عادة غير عملية بحجم صغير، لكن حتى نظرة قبل-وبعد بسيطة وصادقة على زمن الدورة ومعدل العيوب، بدلًا من الاعتماد بحتًا على مدى سرعة شعور العمل، تمنح إشارة أكثر موثوقية بشكل ذي معنى من الانطباع وحده.

الشركات الصغيرة. ركّز جهد القياس على فئة مهمتك الأعلى قيمة والأكثر تكرارًا أولًا، حيث قيمة مساعدة الذكاء الاصطناعي على الأرجح الأوضح والأكثر قابلية للقياس، بدلًا من محاولة تقييم شامل عبر كل نوع عمل يقوم به فريقك الصغير.

المؤسسات الكبرى. مقارنة حقيقية ومُتحكَّم بها خلال مرحلة تجريبية مبكرة، قبل الطرح الكامل على مستوى المنظمة، غالبًا قابلة للتحقيق هنا وتستحق الجهد المتعمد لترتيبها، إذ تُنتج دليلًا أكثر قابلية للدفاع عنه بكثير لقرار استثمار الأدوات واسع النطاق الذي عادة ما يتبع تجربة ناجحة.

الحكومة. غالبًا ما تواجه قرارات إنفاق تقنية عامة، بما فيها شراء أدوات ذكاء اصطناعي، تدقيقًا خاصًا وقد تتطلب تبريرًا رسميًا لتحليل تكلفة-فائدة (الموضوع 5.5). ابنِ انضباط القياس الذي يوصي به هذا الموضوع في أي مرحلة تجريبية منذ البداية، إذ منهجية تقييم صارمة وموثقة تُقوِّي حالة التمويل أو الشراء النهائية بشكل كبير.

أمثلة

المؤسسات الكبرى. طرحت شركة برمجيات مساعد ترميز ذكاء اصطناعي لنصف فرق هندستها كتجربة متعمدة، مُحتفِظة بالنصف الآخر كمجموعة مقارنة لربع واحد قبل الطرح الكامل. أظهرت المجموعة التجريبية تحسنًا حقيقيًا وذا معنى إحصائي في زمن الدورة لمهام مُحدَّدة جيدًا ومكثفة النمطية، لكنها أظهرت بلا تحسن قابل للقياس، وعدد تكرار مراجعة مرتفع قليلًا (الموضوع 2.9)، لعمل معماري معقد وحقيقي الجدة. أدى هذا الاكتشاف المُقسَّم بالمهمة، المرئي فقط بسبب تصميم المقارنة الحقيقي وتفصيل فئة المهمة، إلى استهداف الشركة تحديدًا رسائل طرح مساعدة الذكاء الاصطناعي والتدريب نحو فئات المهام التي ساعدت فيها بشكل قابل للإثبات، بدلًا من تقديمها كتعزيز إنتاجية موحّد عبر كل العمل.

الحكومة. اعتمدت وكالة فيدرالية تُجرِّب مساعدة ترميز ذكاء اصطناعي لمجموعة فرعية من فرق برنامج تحديثها في البداية على استبيانات توفير وقت مُبلَّغة ذاتيًا، أظهرت استجابات متحمسة وإيجابية بشكل موحّد. وجد تحليل موضوعي لاحق، يُقارِن زمن الدورة ومعدل العيوب المتسربة بين الفرق التجريبية ومجموعة غير تجريبية مقارنة تعمل على مكونات نظام مشابهة، أن تحسن زمن الدورة الموضوعي كان حقيقيًا لكنه أصغر بشكل ملحوظ مما اقترحته التقديرات المُبلَّغة ذاتيًا، وحدّد زيادة متواضعة لكن حقيقية في وقت المراجعة كانت تُعوِّض بعض مكسب سرعة التوليد، اكتشاف فاتته بيانات الإبلاغ الذاتي وحدها كليًا. أثرت هذه الصورة الأكثر دقة والقائمة على الدليل مباشرة حالة أعمال أكثر تواضعًا وأكثر قابلية للدفاع عنها لشراء مستمر وموسَّع للأداة.

الحالة التجارية: الدوافع والعائد على الاستثمار وإجمالي تكلفة الملكية

العائد على قياس التطوير المدعوم بالذكاء الاصطناعي بدقة هو قرارات استثمار واثقة وقائمة على الدليل: منظمة تعرف بدقة أين تساعد مساعدة الذكاء الاصطناعي فعليًا تستطيع الاستثمار في توسيعها هناك وتجنب دفع أكثر من اللازم لتراخيص في فئات مهام تُقدِّم فيها قيمة قليلة، بالضبط بصيرة التقسيم بالمهمة التي يُظهرها مثال شركة البرمجيات أعلاه. هذا يرتبط مباشرة باقتصاديات الوحدة من الموضوع 5.4 وانضباط عائد الاستثمار من الموضوع 5.5، إذ تحتاج تكلفة أدوات الذكاء الاصطناعي، غالبًا مُرخَّصة لكل مقعد، نفس معاملة التكلفة-الفائدة الصارمة التي يُطبِّقها هذا الكتاب على أي استثمار هندسة كبير آخر.

إجمالي تكلفة الملكية هي الجهد التحليلي لبناء مقارنات حقيقية، وقياس زمن الدورة الكامل شاملًا المراجعة والتصحيح، والتقسيم حسب نوع المهمة، وهو عمل أكثر من قبول إحصاءات استخدام مُبلَّغة من البائع أو انطباعات مُبلَّغة ذاتيًا كما هي. ذلك الجهد مُبرَّر مباشرة بحجم تكلفة ترخيص أدوات الذكاء الاصطناعي عبر منظمة كبيرة وخطر التزام مكلف وعلى مستوى المنظمة بدليل ضعيف مبني على انطباع بدلًا من بيانات.

الأنماط المضادة والمزالق

  • قياس مساعدة الذكاء الاصطناعي بحجم الناتج أو إحصاءات استخدام البائع وحدها: يُكرِّر تحذير الموضوع 7.1 المركزي مباشرة.
  • الاعتماد كليًا على توفيرات وقت مُبلَّغة ذاتيًا: إشارة ضعيفة عرضة للتحيز، وعمياء عن تكلفة مراجعة وتصحيح لاحقة.
  • قياس خطوة سرعة التوليد فقط، متجاهلًا زمن الدورة الكامل: يُنتج محاسبة ناقصة وربما مُضلِّلة لتأثير الإنتاجية الفعلي.
  • الإبلاغ عن رقم واحد ومُمزَّج على مستوى المنظمة: يُخفي تباينًا حقيقيًا في القيمة عبر فئات مهام مختلفة.
  • بلا مجموعة مقارنة أو خط أساس تاريخي: لا يستطيع تمييز تأثير مساعدة الذكاء الاصطناعي الفعلي عن أي تغيير متزامن آخر.
  • معاملة نتيجة استبيان مُبلَّغة ذاتيًا ومتحمسة كدليل كافٍ لقرار استثمار واسع النطاق: يخاطر بالفجوة المحددة التي اكتشفها مثال الوكالة الفيدرالية أعلاه فقط بعد بناء مقارنة أكثر صرامة.

نموذج النضج

  • المستوى 1، البدء: تُقيَّم قيمة التطوير المدعوم بالذكاء الاصطناعي، إن قُيِّمت، عبر انطباع مُبلَّغ ذاتيًا وإحصاءات استخدام بائع فقط.
  • المستوى 2، التطوير: توجد بعض بيانات زمن الدورة أو الجودة، لكن لا مجموعة مقارنة حقيقية أو خط أساس تاريخي ولا تحليل مُقسَّم بالمهمة.
  • المستوى 3، التوحيد القياسي: يُطبَّق تصميم مقارنة حقيقي (مجموعة تحكم أو خط أساس تاريخي) بقياس زمن دورة وجودة مقترن باتساق، مُقسَّمًا حسب نوع المهمة.
  • المستوى 4، الإدارة: تُتبَّع محاسبة زمن دورة كاملة، شاملة وقت المراجعة والتصحيح؛ تُتحقَّق ادعاءات مُبلَّغة ذاتيًا منهجيًا مقابل بيانات موضوعية.
  • المستوى 5، التنسيق الشامل: لدى المنظمة فهم ناضج وقائم على الدليل بالضبط أين تساعد مساعدة الذكاء الاصطناعي فعليًا، مُثريًا طرحًا مُستهدَفًا، واستثمار تدريب، وقرارات شراء بعائد استثمار مُثبَت وقابل للدفاع عنه.

أفكار للنقاش

  1. أي مقارنة حقيقية، إن وُجِدت، لدينا لتقييم تبنينا الحالي لأدوات الذكاء الاصطناعي؟
  2. هل قسنا زمن الدورة والجودة معًا، أم ادعاء سرعة فقط؟
  3. أي ادعاء مساعدة ذكاء اصطناعي مُبلَّغ ذاتيًا ينبغي أن نتحقق منه مقابل بيانات موضوعية؟
  4. أي فئة مهمة محددة تُظهر أقوى دليل على قيمة مساعدة ذكاء اصطناعي حقيقية لنا؟
  5. هل نستطيع حاليًا الدفاع عن استثمار أدواتنا للذكاء الاصطناعي لصاحب مصلحة مالي متشكك بدليل؟

أهم الاستنتاجات

  • قِس التطوير المدعوم بالذكاء الاصطناعي بـالنتيجة، لا حجم الناتج أو إحصاءات استخدام مُبلَّغة من البائع.
  • استخدم مجموعة مقارنة حقيقية أو خط أساس تاريخي، لا مجرد لقطة قبل-وبعد عرضة لمتغيرات مُشوِّشة.
  • قِس زمن الدورة والجودة معًا، شاملًا خط الأنابيب الكامل، ووقت المراجعة والتصحيح، لا سرعة التوليد فقط.
  • عامل توفيرات الوقت المُبلَّغة ذاتيًا كفرضية، لا استنتاجًا، وتحقق منها مقابل بيانات موضوعية.
  • قسّم حسب نوع المهمة؛ رقم واحد مُمزَّج يُخفي أين تتركّز القيمة حقًا وأين لا تفعل.

المراجع وقراءات إضافية

  • Accelerate: The Science of Lean Software and DevOps، بقلم Nicole Forsgren وJez Humble وGene Kim (انضباط قياس النتيجة الذي يُطبِّقه هذا الموضوع على تقييم أدوات الذكاء الاصطناعي).
  • بحث GitHub حول البرمجة الزوجية بالذكاء الاصطناعي وإنتاجية المطور (بحث تجريبي على نطاق الصناعة حول نتائج التطوير المدعوم بالذكاء الاصطناعي).
  • Forsgren, Nicole, Margaret-Anne Storey, Chandra Maddila, Thomas Zimmermann, Brian Houck, and Jenna Butler, “The SPACE of Developer Productivity,” ACM Queue (2021) (انضباط القياس متعدد الأبعاد الذي يُطبِّقه هذا الموضوع على فئة أدوات جديدة محددة).
  • How to Measure Anything، بقلم Douglas W. Hubbard (بناء مقارنات قابلة للدفاع عنها وتكميم القيمة تحت عدم يقين حقيقي).