7.1

7.1 التحول النموذجي للذكاء الاصطناعي التوليدي

نظرة عامة والدوافع

لمعظم تاريخ هندسة البرمجيات، كانت كتابة الكود بطيئة ومُجهِدة بما يكفي بحيث ارتبط حجم الناتج الخام، أسطر مكتوبة، والتزامات مُنجَزة، وميزات مشحونة، بشكل فضفاض على الأقل بجهد حقيقي، وبشكل غير مثالي، بقيمة حقيقية. لم يكن ذلك الارتباط مثاليًا أبدًا، خصّص الموضوع 3.4 بأكمله لشرح لماذا تُضلِّل مقاييس النشاط حتى في عالم ما قبل الذكاء الاصطناعي، لكنه كان قويًا بما يكفي لدرجة أن منظمات كثيرة بنت برامج مقاييس على افتراض ضمني بأن كودًا أكثر يعني عمومًا عملًا أكثر مُنجَزًا. كسر مساعدو ترميز الذكاء الاصطناعي التوليدي ذلك الافتراض بشكل حاسم: تستطيع أداة الآن إنتاج حجم كبير ويبدو معقولًا من الكود خلال ثوانٍ، بكسر من التكلفة السابقة، وذلك الحجم لا يخبرك بشيء تقريبًا بمفرده عما إذا كان الكود الناتج يعمل، أو قابل للصيانة، أو يخدم أي غرض حقيقي.

الادعاء الأساسي لهذا الموضوع هو أن هذا تحول نموذجي، لا تغيير أدوات تدريجي. يُغيِّر التحول النموذجي ما تقيسه أدواتك الحالية فعليًا، لا فقط القيم التي تُبلِّغ عنها. لا يزال عداد سرعة يقيس السرعة بعد تغيير محرك سيارة؛ عدة مقاييس في هذا الكتاب لا تصمد أمام هذا الانتقال بنفس النظافة. يمكن أن يرتفع تكرار النشر (الموضوع 2.10) لأن الذكاء الاصطناعي سرّع عملًا قيّمًا حقًا، أو لأن الذكاء الاصطناعي جعل توليد تغييرات صغيرة ومنخفضة القيمة كثيرة سهلًا تفاهة؛ لا يستطيع الرقم وحده تمييز الاثنين بعد الآن، بطريقة كان يستطيعها في معظمها، بحذر مناسب، سابقًا. ينطبق نفس المنطق بقوة أكبر حتى على أعداد التزامات خام، وأسطر الكود، وحجم طلبات السحب، جميعها حذّر الموضوع 3.4 منها بالفعل كمقاييس فردية، مُضخَّمة الآن إلى خطر ذي صلة على مستوى الفريق والمنظمة أيضًا.

بالنسبة للفرق الكبيرة، وصل هذا التحول أسرع مما استطاعت ممارسة قياس معظم المنظمات التكيف معه، والفجوة بين سرعة التبني وتكيف القياس حيث يعيش الخطر الحقيقي في هذا الجزء. تخاطر المؤسسات الكبرى التي تستمر بالإبلاغ عن مقاييس نشاط من عصر ما قبل الذكاء الاصطناعي بلا تعديل بالاحتفال بمقياس توقف بهدوء عن الارتباط بالقيمة؛ تحتاج المنظمات الحكومية التي تُقيِّم استثمار أدوات الذكاء الاصطناعي فهمًا واضح العين تمامًا لأي المقاييس تبقى موثوقة وأيها لم تعد كذلك، قبل الالتزام بقرارات شراء أو سياسة مبنية على افتراضات قياس قديمة.

المبادئ الأساسية

  • هذا تحول نموذجي فيما تقيسه المقاييس، لا تغيير تدريجي. توقفت بعض المقاييس الحالية بهدوء عن أن تعني ما كانت تعنيه.
  • حجم الناتج لم يكن أبدًا مؤشرًا بديلًا موثوقًا للقيمة، وأصبح غير موثوق بنشاط الآن. كان تحذير الموضوع 3.4 صحيحًا دائمًا؛ يجعل هذا التحول تجاهله أكثر تكلفة بكثير.
  • الفجوة بين سرعة تبني الذكاء الاصطناعي وسرعة تكيف القياس هي الخطر الحقيقي. تتبنى المنظمات الأدوات أسرع مما تُعيد النظر في مقاييسها.
  • لا يتأثر كل مقياس في هذا الكتاب بالتساوي. مقاييس النتيجة (الجزء 5) أكثر مرونة بكثير أمام هذا التحول من مقاييس النشاط والناتج الخام.
  • هذا التحول واسع النطاق في الصناعة ومستمر، لا تعديل لمرة واحدة. توقع تغيرًا مستمرًا مع استمرار تطور الأدوات وأنماط تبنيها.

التوصيات

دقّق مجموعة مقاييسك الحالية صراحة لصلاحية عصر الذكاء الاصطناعي

استعرض لوحة معلوماتك الحالية، ولكل مقياس، اسأل مباشرة: هل سيُظهر فريق يستخدم مساعدة ذكاء اصطناعي بكثافة لكن لا يُنتج قيمة حقيقية أكثر من قبل قراءة مُحسَّنة على هذا المقياس. أعداد النشاط، وتكرار الالتزامات، وتكرار النشر الخام (بدون ضمان استقرار مقترن، الموضوع 2.10) الأكثر عرضة. مقاييس النتيجة من الجزء 5، معدل العيوب المتسربة، وتبني الميزات، ونتائج الأعمال، مرنة نسبيًا، إذ تقيس النتيجة الفعلية بدلًا من حجم النشاط الذي أنتجها.

أعد فحص تكرار النشر وزمن التقدم تحديدًا، باهتمام ضمان مُعزَّز

حذّر الموضوع 2.10 بالفعل من تلاعب الاستبدال، تقسيم عمل ذي معنى إلى نشرات تافهة لتضخيم العدد. يجعل الذكاء الاصطناعي التوليدي نمط التلاعب المحدد هذا أرخص وأسهل بكثير للإنتاج، حتى بدون قصد، إذ أصبحت التغييرات التافهة المدعومة بالذكاء الاصطناعي شبه مجانية للتوليد الآن. شدّد ضمان معدل فشل التغيير لديك (الموضوع 2.10) تحديدًا نسبة لمدى تبني فريق للتطوير المدعوم بالذكاء الاصطناعي بكثافة، وراقب اتجاهات حجم النشر عن كثب أكثر من قبل حتى.

عامل قدرة مراجعة الكود كاختناق جديد وحرج

إذا زادت مساعدة الذكاء الاصطناعي حجم الكود المُقترَح للمراجعة بشكل كبير، تصبح مرحلة المراجعة (الموضوع 2.9)، غالبًا أكبر مُساهِم في وقت انتظار خط أنابيب التسليم بالفعل، قيدًا أكثر حدة. مراجع مُطالَب بتقييم حجم أكبر بكثير من الكود المُولَّد بالذكاء الاصطناعي بنفس الوتيرة السابقة سيُبطئ خط الأنابيب حتمًا أو يُقلِّل عمق المراجعة، بالضبط خطر الختم المطاطي الذي حذّر منه الموضوع 2.9 بالفعل، الآن تحت ضغط أكبر بكثير. راقب ضمانات عمق وجودة المراجعة باهتمام مُعزَّز مع ارتفاع حجم الكود المُولَّد بالذكاء الاصطناعي.

لا تفترض أن الكود المُولَّد بالذكاء الاصطناعي يحمل نفس ملف تعريف العيوب مثل كود مكتوب بشريًا

يوحي الدليل المبكر وخبرة الممارسين بأن الكود المُولَّد بالذكاء الاصطناعي يمكن أن يحمل ملف تعريف عيوب مختلفًا عن الكود المكتوب بشريًا: منطق يبدو معقولًا لكنه خاطئ بشكل خفي، أو معالجة حالة حدّية مُولَّدة بثقة لكن غير صحيحة، أو كود يمر مراجعة سطحية لأنه يبدو اصطلاحيًا ومعقولًا، لكنه لم يُفكَّر فيه فعليًا بفهم حقيقي لسياق النظام المحدد. عامل هذا كفرضية تستحق الاختبار النشط مقابل بيانات عيوبك المتسربة الخاصة (الموضوع 5.1)، مُصنِّفًا العيوب حسب ما إذا كان الكود الأصلي مُولَّدًا بالذكاء الاصطناعي بشكل كبير، بدلًا من افتراض أن علاقات معدل العيوب التاريخية التي بنت منظمتك ممارسات جودتها حولها لا تزال قائمة بلا تغيير.

حدّث ميثاق مقاييسك وعملية حوكمتك صراحة لهذا التحول

باتباع انضباط الحوكمة من الموضوع 1.4، لا تدع هذا التحول يحدث لبرنامج مقاييسك بشكل سلبي. أعد زيارة ميثاق مقاييسك صراحة، مُسمِّيًا أي المقاييس تحتاج ضمانات جديدة، وأيها يحتاج التقاعد، وأيها يبقى موثوقًا، كقرار حوكمة متعمد بدلًا من انجراف غير مفحوص. وثّق المنطق، إذ هذا بالضبط النوع من التحول التعريفي والسياقي الذي يحذّر الموضوع 1.4 من أنه يمكن أن يحدث بصمت وأن يُكتشَف فقط لاحقًا بكثير بخلاف ذلك.

المفاضلات: الإيجابيات والسلبيات

النهجالإيجابياتالسلبيات
الاستمرار بالإبلاغ عن مقاييس ما قبل الذكاء الاصطناعي بلا تغييرلا اضطراب، إبلاغ مألوفيخاطر بالاحتفال بمقاييس توقفت بهدوء عن الارتباط بالقيمة
تدقيق كامل لمجموعة المقاييس ومراجعة متعمدةيستعيد قياسًا موثوقًايتطلب جهدًا تحليليًا حقيقيًا وإدارة تغيير تنظيمي
التخلي عن مقاييس النشاط والناتج كليًايُزيل الخطر الأكثر عرضة مباشرةيفقد بعض إشارة سياقية مفيدة بشكل مشروع (تحفظ الموضوع 3.4)
تشديد الضمانات بدون تدقيق كاملأسرع تنفيذًاقد يفوّت مقاييس تعرضها أقل وضوحًا من الحالات الأوضح

التوتر المركزي هو استمرارية القياس مقابل صلاحية القياس. تُفضِّل المنظمات مفهومًا الاستمرار بالإبلاغ عن مقاييس مألوفة بطرق مألوفة، إذ لتغيير برنامج مقاييس تكلفة تنظيمية واضطراب حقيقيان. لكن الاستمرار بالإبلاغ عن مقياس توقف بهدوء عن قياس ما كان يقيسه أسوأ من الاضطراب، إنه تضليل نشط. حُلّ التوتر بمعاملة هذا كبالضبط نوع تغيير الحوكمة المتعمد والموثق الذي يصفه الموضوع 1.4، مُزعِج على المدى القصير لكن ضروري لإبقاء مقاييس المنظمة صادقة.

أسئلة للنقاش مع فريقك

  1. لكل مقياس على لوحة معلوماتنا، هل سيُظهر فريق يستخدم مساعدة ذكاء اصطناعي بكثافة لكن لا يُنتج قيمة حقيقية أكثر قراءة مُحسَّنة؟ استعرض مقاييسك صراحة بهذا الاختبار؛ التي تفشله أعلى مرشحيك أولوية لضمانات مُنقَّحة أو تقاعد.

  2. هل ارتفع تكرار نشرنا أو حجم التزامنا منذ تبني مساعدة ترميز ذكاء اصطناعي، وهل تحققنا مما إذا كان معدل فشل التغيير أو معدل العيوب قد تحرّك بشكل مقابل؟ اسحب البيانات المقترنة الفعلية بدلًا من افتراض نتيجة إيجابية أو سلبية.

  3. هل قدرة مراجعة كودنا تواكب أي زيادة في حجم الكود المدعوم بالذكاء الاصطناعي، أم يتآكل عمق المراجعة بهدوء تحت ضغط متزايد؟ تحقق من مقاييس مرحلة المراجعة (الموضوع 2.9) تحديدًا لعلامات تكثيف خطر الختم المطاطي.

  4. هل نُصنِّف العيوب حسب ما إذا كان الكود الأصلي مُولَّدًا بالذكاء الاصطناعي بشكل كبير، وإذا كان الأمر كذلك، ماذا تُظهر تلك البيانات حتى الآن؟ إذا لا نُصنِّف هذا حاليًا، ناقش ما سيتطلبه البدء، إذ هذه البيانات ذات صلة مباشرة بما إذا كانت افتراضات جودتك التاريخية لا تزال قائمة.

  5. هل أعدنا زيارة ميثاق مقاييسنا (الموضوع 1.4) عمدًا في ضوء هذا التحول، أم استمرت ممارسة قياسنا بلا تغيير ببساطة؟ إذا كانت الإجابة الصادقة الثانية، تلك الفجوة بالضبط ما يوصي هذا الموضوع بإغلاقه أولًا.

  6. كيف سيبدو أن تُفاجَأ منظمتنا بهذا التحول، مُحتفِلة بمقياس توقف بالفعل عن أن يعني ما اعتقدنا أنه يعنيه؟ هذه التجربة الفكرية الملموسة وغير المريحة قليلًا تساعد على تحفيز التدقيق الذي يوصي به هذا الموضوع قبل، لا بعد، حدوث ذلك السيناريو فعليًا.

منظور القطاع

الشركات الناشئة. تبني أدوات الذكاء الاصطناعي السريع شائع وغالبًا ميزة تنافسية حقيقية، لكن نفس السرعة التي تجعل التبني جذابًا تجعل انجراف المقياس غير المفحوص أكثر احتمالًا. ابنِ عادة التحقق من مقاييس النتيجة (الجزء 5) إلى جانب أي مكاسب كفاءة تُبلِّغ عنها من تبني الذكاء الاصطناعي، بدلًا من الإبلاغ عن تحسينات سرعة وحدها.

الشركات الصغيرة. يمكن لمساعدة ترميز الذكاء الاصطناعي أن تُوسِّع قدرة فريق صغير بشكل ذي معنى، لكن قاوم إغراء الإبلاغ عن زيادات ناتج خام كنجاح لا لبس فيه بدون التحقق من ضمانات الجودة؛ لدى فريق صغير قدرة أقل لاستيعاب مشكلة جودة غير مُكتشَفة من منظمة أكبر بتكرار أكثر.

المؤسسات الكبرى. يتراكم حجم هذا الخطر بشكل كبير هنا، إذ تبني الذكاء الاصطناعي عبر عشرات أو مئات الفرق في آن واحد يمكن أن يُغيِّر صلاحية المقياس على مستوى المنظمة قبل أن يلاحظ أي فريق واحد النمط محليًا. أجرِ تدقيق مجموعة المقاييس الذي يوصي به هذا الموضوع على المستوى التنظيمي، لا فريقًا بفريق فقط، وحدّث الحوكمة (الموضوع 1.4) مركزيًا وصراحة.

الحكومة. غالبًا ما تتبنى منظمات القطاع العام تقنية جديدة بحذر أكبر، لكن المقاييس والمعايير المُستخدَمة لتقييم برامج تقنية حكومية غالبًا ما تُستمَد من أو تُقارَن ببيانات صناعة قطاع خاص تتحول هي نفسها تحت نفس الضغط. افهم صراحة أي معايير صناعة تُقارِن نفسك بها تأثرت بهذا التحول قبل استخدامها لتحديد توقعات أو تقييم أداء.

أمثلة

المؤسسات الكبرى. لاحظت قيادة هندسة شركة تقنية مالية أن تكرار النشر ارتفع قرابة 40% في الربعين التاليين لتبني واسع لمساعد ترميز ذكاء اصطناعي، وأبلغت في البداية عن هذا كفوز إنتاجية مباشر في عرض لمجلس الإدارة. وجد تحليل متابعة أكثر حذرًا، مدفوعًا بسؤال عضو مجلس متشكك حول ما إذا كانت الجودة قد فُحِصت، أن معدل فشل التغيير ارتفع تقريبًا بالتوازي مع تكرار النشر، مُعوِّضًا كليًا المكسب الظاهر بمجرد فحص مقياس الاستقرار المقترن فعليًا. يعرض إبلاغ الشركة المُنقَّح الآن تكرار النشر ومعدل فشل التغيير معًا صراحة كلما قُدِّمت ادعاءات إنتاجية مدعومة بالذكاء الاصطناعي، متجنبًا الادعاء المُضلِّل السابق والقريب من العلني.

الحكومة. وجدت وزارة تقنية معلومات لحكومة ولاية، تُجرِّب مساعدة ترميز ذكاء اصطناعي لمجموعة فرعية من فرق هندستها، أن ناتج الكود الخام لكل مهندس ارتفع بشكل كبير، رقم اُستُشهِد به في البداية بشكل إيجابي في مراجعة تجريبية داخلية. فحص تحليل أقرب، مدفوعًا بدمج توجيه هذا الكتاب في إطار تقييم الوزارة، معدل العيوب المتسربة للعمل المدعوم بالذكاء الاصطناعي مقابل غير المدعوم به تحديدًا ووجد معدل عيوب مرتفعًا بشكل متواضع في المجموعة المدعومة بالذكاء الاصطناعي، مُتركِّزًا في معالجة حالات حدّية لظروف مواطن غير عادية لم تتعرض لها أداة الذكاء الاصطناعي خلال التدريب. لم يوقف هذا الاكتشاف التجربة لكنه أدى لزيادة مُستهدَفة ومحددة في صرامة المراجعة للتغييرات المدعومة بالذكاء الاصطناعي التي تلمس منطق حالات حدّية للأهلية، مُعالِجًا المخاطرة الفعلية التي لم يكن مقياس الناتج الخام وحده ليكشفها أبدًا.

الحالة التجارية: الدوافع والعائد على الاستثمار وإجمالي تكلفة الملكية

العائد على إجراء هذا التدقيق استباقيًا هو تجنب إحراج عام أو على مستوى مجلس إدارة من الإبلاغ عن مقياس يتبين، تحت التدقيق، أنه لم يقس شيئًا حقيقيًا، بالضبط السيناريو الذي كاد ينتجه مثال التقنية المالية أعلاه. منظمة تتقدم على هذا التحول تحافظ على مصداقية مع أصحاب مصلحتها؛ واحدة تُكتشَف وهي تُبلِّغ عن مقياس أجوف تدفع تكلفة سمعية حقيقية وقابلة للتجنب إلى حد كبير.

إجمالي تكلفة الملكية هي الجهد التحليلي لتدقيق مجموعة المقاييس الحالية، وتشديد الضمانات، وتحديث توثيق الحوكمة، استثمار معتدل ولمرة واحدة نسبة لخطر الاستمرار المستمر بالإبلاغ عن مقاييس توقفت بهدوء عن قياس ما تدّعي قياسه. هذه التكلفة متكررة أيضًا بمستوى أقل، إذ هذا التحول مستمر، لا حدث لمرة واحدة، وإعادة التدقيق الدوري مع استمرار تطور الأدوات وأنماط تبنيها إضافة معقولة ودائمة لوتيرة حوكمة مقاييس.

الأنماط المضادة والمزالق

  • الاستمرار بالإبلاغ عن مقاييس نشاط من عصر ما قبل الذكاء الاصطناعي بلا تغيير وبلا انتقاد: يخاطر بالاحتفال بمقياس توقف بهدوء عن الارتباط بقيمة حقيقية.
  • الإبلاغ عن زيادات تكرار نشر أو حجم ناتج بدون ضمان الاستقرار المقترن: يُكرِّر تحذير الموضوع 2.10 بمخاطر أعلى بكثير تحت التطوير المدعوم بالذكاء الاصطناعي.
  • افتراض أن الكود المُولَّد بالذكاء الاصطناعي يحمل نفس ملف تعريف العيوب مثل كود مكتوب بشريًا بدون التحقق: افتراض غير مُختبَر يمكن أن يكون خاطئًا بنشاط.
  • ترك عمق المراجعة يتآكل بصمت تحت حجم كود مُولَّد بالذكاء الاصطناعي متزايد: خطر الختم المطاطي من الموضوع 2.9، مُكثَّف.
  • معاملة هذا التحول كتعديل لمرة واحدة بدلًا من اهتمام مستمر: تستمر الأدوات وأنماط تبنيها في التطور، وتحتاج ممارسة القياس مواكبة ذلك.
  • المقارنة بمعايير صناعة بدون فهم ما إذا كانت تلك المعايير نفسها تحولت تحت نفس الضغط: يخاطر بشعور زائف بالأداء النسبي.

نموذج النضج

  • المستوى 1، البدء: تُبلَّغ مقاييس عصر ما قبل الذكاء الاصطناعي بلا تغيير، بلا وعي بأن تبني الذكاء الاصطناعي قد يكون أثّر على صلاحيتها.
  • المستوى 2، التطوير: يوجد بعض الوعي بالتحول، لكن لم يُجرَ تدقيق منهجي لمجموعة المقاييس الحالية.
  • المستوى 3، التوحيد القياسي: أُجرِي تدقيق كامل لمجموعة المقاييس، بضمانات مُشدَّدة ومقاييس موثقة كمتأثرة أو مرنة، على مستوى المنظمة.
  • المستوى 4، الإدارة: تُصنَّف وتُتبَّع العيوب ونتائج الجودة بنشاط حسب مستوى مساعدة الذكاء الاصطناعي لاختبار، لا افتراض، أن علاقات جودة المنظمة التاريخية لا تزال قائمة.
  • المستوى 5، التنسيق الشامل: لدى المنظمة ممارسة ناضجة ومستمرة لإعادة فحص مقاييسها مع استمرار تطور أدوات الذكاء الاصطناعي وأنماط تبنيها، وتستطيع الإشارة إلى قرارات حوكمة محددة اُتُّخِذت استباقيًا استجابة لهذا التحول بدلًا من رد فعل بعد ظهور مشكلة.

أفكار للنقاش

  1. أي من مقاييسنا الحالية سيُجمِّل بأكبر شكل فريقًا يستخدم مساعدة ذكاء اصطناعي بكثافة لكن لا يُنتج قيمة حقيقية أكثر؟
  2. هل ارتفع تكرار نشرنا منذ تبني الذكاء الاصطناعي، وهل تحرّك معدل فشل التغيير معه؟
  3. هل نُصنِّف نتائج الجودة حسب مستوى مساعدة الذكاء الاصطناعي، وماذا ستُظهر تلك البيانات؟
  4. هل تواكب قدرة مراجعتنا أي زيادة في حجم الكود المُولَّد بالذكاء الاصطناعي؟
  5. أي معيار صناعة نُقارِن أنفسنا به حاليًا، وهل تحول هو نفسه تحت هذا الضغط؟

أهم الاستنتاجات

  • الذكاء الاصطناعي التوليدي تحول نموذجي فيما تقيسه عدة مقاييس حالية، لا تغيير أدوات تدريجي؛ توقفت بعض المقاييس بهدوء عن أن تعني ما كانت تعنيه.
  • مقاييس النشاط والناتج الخام هي الأكثر عرضة؛ مقاييس النتيجة (الجزء 5) مرنة نسبيًا.
  • شدّد الضمانات، خاصة معدل فشل التغيير، نسبة لتبني التطوير المدعوم بالذكاء الاصطناعي.
  • اختبر، لا تفترض، ما إذا كان الكود المُولَّد بالذكاء الاصطناعي يحمل ملف تعريف عيوب مختلفًا عن الكود المكتوب بشريًا، باستخدام بيانات عيوب متسربة مُصنَّفة.
  • عامل هذا كـاهتمام حوكمة مستمر، لا لمرة واحدة (الموضوع 1.4)، إذ تستمر الأدوات وأنماط تبنيها في التطور.

المراجع وقراءات إضافية

  • Accelerate: The Science of Lean Software and DevOps، بقلم Nicole Forsgren وJez Humble وGene Kim (أساس القياس القائم على النتيجة الذي يُجادِل هذا الموضوع بأنه يصبح أكثر أهمية، لا أقل، تحت هذا التحول).
  • بحث GitHub حول البرمجة الزوجية بالذكاء الاصطناعي وإنتاجية المطور (بحث صناعة حول تأثيرات التطوير المدعوم بالذكاء الاصطناعي القابلة للقياس).
  • برنامج بحث وتقييم DevOps من Google Cloud، dora.dev (بحث حالة DevOps المستمر يدمج اكتشافات تبني الذكاء الاصطناعي في السنوات الأخيرة).
  • The Tyranny of Metrics، بقلم Jerry Z. Muller (الحجة العامة للشكوكية تجاه مقاييس قائمة على الحجم، ذات صلة مباشرة مع أن يصبح حجم الناتج رخيصًا).