3.3

3.3 مقاييس الأداء والمؤشرات البديلة للنتيجة

نظرة عامة والدوافع

الأداء، حرف P في SPACE (الموضوع 3.1)، هو البُعد الأكثر خلطًا بالنشاط، وذلك الخلط بالضبط ما يوجد هذا الموضوع لمنعه. يسأل الأداء عما إذا كان عمل مهندس أو فريق قد أنتج فعليًا نتيجة جيدة: ميزة شُحنت وعملت، نظام بقي موثوقًا، تغيير حرّك مقياس أعمال أو مستخدم في الاتجاه الصحيح. يسأل النشاط (الموضوع 3.4) فقط عن مقدار الحركة التي حدثت. يمكن لفريق أن يكون نشطًا للغاية ومنخفض الأداء، يشحن تغييرات صغيرة مستمرة لا تُحرِّك نتيجة أبدًا، والعكس ممكن بنفس القدر: فريق يشحن نادرًا لكن تغييراته تصيب الهدف بدقة باستمرار.

الصعوبة في هذا البُعد أن النتيجة غالبًا لا تُعزى لشخص واحد أو حتى فريق واحد؛ تنبثق نتائج البرمجيات من التعاون، ومن قرارات اُتُّخِذت قبل أشهر بواسطة أشخاص انتقلوا منذ ذلك الحين لمشاريع أخرى، ومن ظروف سوق لا يتحكم بها أي مهندس. كان باحثو SPACE صريحين حول هذا: ينبغي قياس الأداء على مستوى النظام أو الفريق باستخدام إشارات متعددة ومتقاربة، لا اختزاله إلى رقم واحد وبالتأكيد ليس عزوه لمهندس فردي بمعزل عن غيره. يأخذ هذا الموضوع تلك التوجيهات بجدية ويعامل عزو الأداء الفردي كفخ يجب تجنبه بنشاط، لا اختصارًا يُؤخَذ عند الملاءمة.

بالنسبة للفرق الكبيرة، الحصول على قياس الأداء بشكل صحيح هو ما يفصل برنامج مقاييس يُحسِّن النتائج فعليًا عن آخر يُكافئ فقط الانشغال المرئي. تحتاج المؤسسات الكبرى التي تقارن الأداء عبر فرق كثيرة إشارات تقاوم التلاعب عبر حجم الناتج الخام؛ تحتاج المنظمات الحكومية التي تُبرِّر استثمار التقنية لهيئات الرقابة إثبات أن جهد الهندسة أنتج نتائج حقيقية، لا فقط سلّم مُخرَجات، وهو بالضبط مبدأ النتائج-قبل-الناتج من الموضوع 1.3 مُطبَّقًا على هذا البُعد المحدد.

المبادئ الأساسية

  • يقيس الأداء ما إذا كان العمل قد أنتج نتيجة جيدة، لا مقدار العمل الذي حدث. هذا هو التمييز الأساسي عن بُعد النشاط.
  • استخدم إشارات متعددة ومتقاربة، أبدًا رقم أداء واحد. لا مؤشر بديل فردي موثوق بما يكفي للوقوف بمفرده.
  • قِس على مستوى الفريق أو النظام. عزو النتيجة الفردية غير موثوق عادة ويدعو بالضبط إلى التلاعب الذي يحذّر منه هذا الكتاب طوال الوقت.
  • الجودة جزء من الأداء، لا اهتمام منفصل. عمل يُشحَن لكنه يُعطِّل شيئًا آخر لم يؤدِّ حقًا بشكل جيد.
  • إشارة أداء بلا قرار مرتبط بها زخرفة، تمامًا وفق مبدأ الموضوع 1.1 العام مُطبَّقًا على هذا البُعد.

التوصيات

اجمع عدة إشارات متقاربة بدلًا من درجة أداء واحدة

استمد أدلة الأداء من مصادر متعددة: معدل فشل التغيير (الموضوع 2.10) ومعدل تسرب العيوب (الموضوع 5.1) للجودة، ونتائج نشر مرتبطة بتبني ميزة فعلي (الموضوع 5.2) لما إذا كان العمل مهمًا، وتقييم نوعي من الأقران أو المدير لمساهمة فريق في الأهداف الاستراتيجية لسياق لا يستطيع مقياس بحت التقاطه. لا واحد من هذه موثوق بمفرده؛ معًا، عندما تتقارب على نفس الاستنتاج، أكثر موثوقية بكثير من أي رقم واحد يمكن أن يكون.

قِس على مستوى الفريق، قاوم العزو الفردي

نادرًا ما تكون نتائج البرمجيات نتاج عمل شخص واحد بمفرده؛ تنبثق من قرارات تصميم، وتعليقات مراجعة، وعمل سابق لأشخاص ربما غادروا الفريق منذ ذلك الحين، وتعاون عبر الحدود. عزو نتيجة لمهندس واحد عادة دقة زائفة تتجاهل هذا الواقع وتخلق حافزًا قويًا للأفراد لحماية الفضل بدلًا من التعاون بحرية، بالضبط نوع تشويه الحافز الذي يحذّر منه الموضوع 1.2.

أدرج الجودة مباشرة في تعريف الأداء

ميزة تُشحَن في الوقت المحدد لكنها تُسبِّب موجة من حوادث الإنتاج لم تؤدِّ بشكل جيد، حتى لو عدّتها رؤية بسيطة قائمة على الناتج فقط بأنها مُسلَّمة. أدرج معدل فشل التغيير، ومعدل تسرب العيوب، وبيانات حوادث ما بعد الإصدار مباشرة في كيفية تقييمك للأداء، بدلًا من معاملة الجودة كاهتمام منفصل ومنقطع يُقاس فقط في الجزء 4 والجزء 6 من هذا الكتاب.

استخدم بيانات الأداء لإبلاغ قرارات الاستثمار والعملية، لا ترتيبات فردية

الاستخدام المُنتِج لبيانات الأداء هو تحديد أين تستثمر أكثر (فريق يُسلِّم نتائج قوية باستمرار يستحق موارد واستقلالية أكثر) وأين تحقق (فريق يفشل عمله باستمرار في تحقيق النتائج يستحق مساعدة، لا لومًا، وفق تأطير الموضوع 1.1 التشخيصي). ترتيب الأفراد أو الفرق تنافسيًا ضد بعضهم على بيانات الأداء يدعو بالضبط إلى التلاعب وضرر المعنويات الذي يحذّر منه هذا الكتاب ونادرًا ما يُنتج نتائج أفضل مما يفعله الاستخدام التشخيصي.

كن صادقًا حول حدود العزو، خاصة لفرق المنصة والفرق التمكينية

الفرق التي تبني بنية تحتية مشتركة، أو أدوات داخلية، أو قدرات منصة (موضوع الهندسة النمطية في الكتاب الشقيق `software-engineering-guide` يغطي هذا مباشرة) غالبًا ما تكون مساهمتها في النتائج بعيدة خطوات عديدة عن أي مقياس فردي يواجه العميل. قِس أداء هذه الفرق عبر تأثيرها على الفرق التي تُمكِّنها، وتبني منصتها، وتقليل الاحتكاك المُبلَّغ عنه من الفرق المستهلكة، بدلًا من فرض مقياس نتيجة مباشرة غير ملائم على عمل غير مباشر بطبيعته.

المفاضلات: الإيجابيات والسلبيات

النهجالإيجابياتالسلبيات
درجة أداء واحدة لكل فريقبسيطة للعرض والمقارنةدقة زائفة؛ تُخفي أي إشارة أساسية دفعت الدرجة فعليًا
إشارات متعددة متقاربةأكثر موثوقية، تقاوم التلاعب أحادي المقياسأصعب تلخيصًا في رقم واحد؛ تتطلب سياقًا أكثر للتفسير
قياس الأداء على مستوى الفريقيطابق كيف تنبثق نتائج البرمجيات فعليًالا يستطيع الإجابة مباشرة عن أسئلة حول المساهمة الفردية
عزو الأداء على المستوى الفردييشعر بأنه أكثر قابلية للتصرف مباشرة للمراجعاتعادة دقة زائفة؛ خطر تلاعب وحماية فضل قوي

التوتر المركزي هو الدقة مقابل الصدق. رقم أداء واحد لكل فريق، أو أسوأ، لكل فرد، سهل المقارنة والترتيب، لكن تلك الدقة عادة زائفة، تُخفي عدم يقين حقيقي حول العزو والجودة خلف رقم يبدو نظيفًا. حُلّ التوتر بقبول صورة أقل ترتيبًا ومتعددة الإشارات كالصورة الصادقة، ومقاومة الضغط من القيادة أو عمليات مراجعة الأداء لطي الصورة عائدة إلى رقم واحد زائف الدقة.

أسئلة للنقاش مع فريقك

  1. هل يجمع قياس أدائنا الحالي إشارات متعددة متقاربة، أم يعتمد على رقم واحد يشعر بأنه أدق مما هو فعليًا؟ دقّق أيًا كان ما تسميه حاليًا “مقياس أداء” وتحقق من عدد الإشارات المستقلة والمتقاربة التي تُغذّيه فعليًا.

  2. هل عزونا يومًا أداء فريق أو فرد بدون احتساب الطبيعة التعاونية عبر الفرق لكيفية حدوث النتيجة فعليًا؟ اختر قصة نجاح حديثة وتتبّع كم اعتمدت على أشخاص، أو قرارات، أو عمل سابق خارج الفريق أو الفرد المُنسَب إليه الفضل.

  3. هل يشمل قياس أدائنا الجودة، أم فقط سرعة التسليم وحجم الناتج؟ ميزة مُشحَنة تسببت لاحقًا في حوادث إنتاج كبيرة يجب ألا تُسجِّل كأداء عالٍ؛ تحقق مما إذا كان قياسك الحالي سيكتشف فعليًا هذه الحالة.

  4. كيف نقيس أداء فرق المنصة أو الفرق التمكينية التي مساهمتها في النتائج غير مباشرة؟ إذا كانت الإجابة الصادقة “لا نفعل ذلك حقًا”، تلك الفجوة تستحق التسمية والمعالجة مباشرة بدلًا من ترك تلك الفرق غير مقيسة فعليًا أو مقيسة بشكل غير عادل ضد مقاييس نتيجة تواجه العميل لا تناسب عملها.

  5. هل استُخدِمت بيانات الأداء يومًا لترتيب أفراد تنافسيًا ضد بعضهم، رسميًا أو غير رسمي؟ هذا الانحراف، مشابه لخطر بيانات الرضا في الموضوع 3.2، يُضر بصدق البيانات واستعداد الفريق للتعاون بانفتاح.

  6. عندما تختلف إشاراتنا المتقاربة، سرعة تسليم عالية لكن معدل عيوب متصاعد، مثلًا، ماذا نستنتج، وهل تتعامل عمليتنا مع ذلك الاختلاف بشكل جيد؟ الاختلاف بين الإشارات معلومة قيّمة بحد ذاتها؛ ناقش ما إذا كان فريقك يعامله حاليًا كضوضاء تُتجاهَل أو كاكتشاف حقيقي يستحق التحقيق.

منظور القطاع

الشركات الناشئة. الأداء عادة مرئي مباشرة: هل عملت الميزة، هل تبنّاها العملاء، هل تحرّك المقياس. القياس الرسمي متعدد الإشارات غالبًا غير ضروري بهذا الحجم؛ الخطر بدلًا من ذلك هو عزو النجاح أو الفشل بسرعة كبيرة لشخص واحد في فريق صغير سريع الحركة وشديد التعاون حيث نادرًا ما ينتمي الفضل أو اللوم لفرد واحد فقط.

الشركات الصغيرة. اجمع أي بيانات تسليم وجودة لديك بالفعل (الموضوع 2.10، الموضوع 5.1) مع محادثة صادقة ومباشرة حول ما إذا كان العمل الأخير قد ساعد الأعمال فعليًا، بدلًا من بناء أدوات قياسية رسمية متعددة الإشارات تفتقر للقدرة على صيانتها.

المؤسسات الكبرى. هنا يستحق انضباط القياس على مستوى الفريق متعدد الإشارات استثماره، إذ الضغط لاختزال الأداء إلى رقم واحد قابل للمقارنة عبر عشرات الفرق أقوى هنا، وضرر الدقة الزائفة يتراكم عبر قرارات تخصيص الموارد للمنظمة بأكملها. قاوم ذلك الضغط صراحة وابنِ الحالة متعددة الإشارات لسبب أهميته.

الحكومة. إثبات أن استثمار الهندسة أنتج نتائج حقيقية، لا فقط سلّم مُخرَجات، غالبًا السؤال المركزي الذي تطرحه هيئة رقابة. قياس الأداء متعدد الإشارات، المرتبط صراحة بمقاييس النتيجة (الموضوع 5.3) بدلًا من مؤشرات بديلة قائمة على التسليم فقط، يمنح إجابة أقوى وأكثر قابلية للدفاع عنها بكثير من عدد نشاط أو تسليم وحده.

أمثلة

المؤسسات الكبرى. كانت قيادة شركة تقنية تجزئة تُرتِّب فرق الهندسة بشكل غير رسمي حسب نقاط القصة المُكتملة لكل سباق، معاملة ذلك كمؤشر بديل للأداء. بعد تبني نهج متعدد الإشارات، يجمع بيانات التسليم، ومعدل فشل التغيير، وتبني الميزة بعد الإصدار، وجدت القيادة أن الفريق بأعلى معدل إكمال نقاط قصة كان لديه أدنى معدل تبني ميزة في الشركة: كانوا يشحنون بسرعة لكن يبنون أشياء لا يستخدمها العملاء. إعادة تخصيص أولويات خارطة طريق ذلك الفريق بناءً على صورة الأداء الأكمل، بدلًا من الترتيب المُضلِّل برقم واحد، أعادت توجيه قدرة هندسية كبيرة نحو عمل أعلى تأثيرًا خلال ربع واحد.

الحكومة. احتاج برنامج هندسي لوكالة ضرائب وطنية إثبات للجنة رقابة أن استثمارًا كبيرًا في الأنظمة قد حسّن الأداء، لا فقط سلّم النطاق المُتعاقَد عليه. بدلًا من الإبلاغ عن نقاط القصة أو إكمال معالم فقط، قدّم البرنامج مجموعة متقاربة من الإشارات: معدل خطأ معالجة مُقلَّل، ووقت معالجة وسيط مُقلَّل، ومعدل إكمال خدمة ذاتية ناجحة متزايد، جميعها مرتبطة بمكونات نظام محددة تم تسليمها. العرض متعدد الإشارات والمرتبط بالنتيجة أرضى تدقيق اللجنة بطريقة فشل تقرير “سُلِّم في الموعد المحدد” البسيط من برنامج سابق في تحقيقها العام السابق.

الحالة التجارية: الدوافع والعائد على الاستثمار وإجمالي تكلفة الملكية

العائد على قياس الأداء عبر إشارات متقاربة ومرتبطة بالنتيجة بدلًا من رقم واحد زائف الدقة هو قرارات تخصيص موارد أفضل: منظمة تستطيع رؤية أي عمل فرق يُحرِّك النتائج فعليًا تستطيع الاستثمار أكثر حيث يهم والتحقيق حيث لا يفعل، بدلًا من مكافأة أي فريق يبدو الأكثر انشغالًا. مثال التجزئة أعلاه نموذجي: كان ترتيب مُضلِّل برقم واحد يُوجِّه انتباه الاستثمار بعيدًا عن حيث كان سيساعد فعليًا.

إجمالي تكلفة الملكية أعلى من نهج مقياس واحد، لأنه يتطلب جمع بيانات من مصادر متعددة (التسليم، الجودة، النتيجة) ومقاومة الضغط التنظيمي لطي الصورة عائدة إلى رقم واحد قابل للمقارنة. تلك التكلفة تستحق الدفع لأن البديل، درجة واحدة زائفة الدقة، تُضلِّل بنشاط قرارات تخصيص الموارد التي صُمِّمت بيانات الأداء لإبلاغها.

الأنماط المضادة والمزالق

  • الخلط بين النشاط والأداء: الخطأ الأكثر شيوعًا الذي صُمِّم هذا البُعد تحديدًا لمنعه.
  • عزو الأداء الفردي لنتائج تعاونية عبر الفرق: عادة دقة زائفة تُثبِّط التعاون.
  • استبعاد الجودة من تعريف الأداء: يُكافئ عملًا يُشحَن لكنه يُعطِّل شيئًا آخر.
  • فرض مقياس نتيجة مباشرة على فرق المنصة أو الفرق التمكينية: يقيس الشيء الخاطئ لعمل غير مباشر بطبيعته.
  • طي إشارات متقاربة متعددة عائدة إلى رقم واحد زائف الدقة تحت ضغط تنظيمي: يفقد الصدق الذي بُني النهج متعدد الإشارات لتوفيره.
  • استخدام بيانات الأداء لترتيب الأفراد تنافسيًا: يُضر بصدق البيانات وتعاون الفريق كليهما.

نموذج النضج

  • المستوى 1، البدء: يُخلَط الأداء بالنشاط أو حجم الناتج، يُقاس برقم واحد غير مفحوص.
  • المستوى 2، التطوير: تُعتبَر بعض إشارات الجودة إلى جانب الناتج، لكن لا نهج متعدد الإشارات ثابت والعزو الفردي لا يزال يحدث بشكل غير رسمي.
  • المستوى 3، التوحيد القياسي: يُقاس الأداء على مستوى الفريق باستخدام إشارات متعددة ومتقاربة تشمل الجودة، باتساق على مستوى المنظمة.
  • المستوى 4، الإدارة: يُحقَّق الاختلاف بين الإشارات المتقاربة بنشاط؛ لدى فرق المنصة والفرق التمكينية مقاييس أداء غير مباشرة بشكل مناسب تلائم عملها الفعلي.
  • المستوى 5، التنسيق الشامل: تُشكِّل بيانات الأداء مباشرة قرارات تخصيص الموارد والاستثمار، وتستطيع المنظمة الإشارة إلى قرارات إعادة تخصيص محددة مكّنتها رؤية متعددة الإشارات وكانت ستفوتها رؤية برقم واحد.

أفكار للنقاش

  1. أي رقم واحد نستخدمه حاليًا كمؤشر بديل للأداء ينبغي أن نتقاعد عنه لصالح مجموعة متقاربة؟
  2. هل نسبنا يومًا نتيجة لفريق أو شخص خاطئ لأن العزو كان غير واضح؟
  3. كيف نقيس حاليًا أداء فريق منصة أو فريق تمكيني؟
  4. كيف سيبدو لو اختلفت إشاراتنا المتقاربة مع بعضها الربع القادم؟
  5. أين وجَّه ترتيب بنقاط القصة أو عدد التسليم انتباه استثمارنا بشكل خاطئ؟

أهم الاستنتاجات

  • يقيس الأداء ما إذا كان العمل قد أنتج نتيجة جيدة، لا مقدار الحركة التي حدثت؛ لا تخلطه بالنشاط (الموضوع 3.4).
  • استخدم إشارات متعددة ومتقاربة، أبدًا رقم أداء واحد، وكن مرتابًا من الدقة الزائفة.
  • قِس على مستوى الفريق أو النظام؛ عزو النتيجة الفردية غير موثوق عادة ويُضر بالتعاون.
  • الجودة جزء من الأداء، لا اهتمام منفصل ومنقطع.
  • أعطِ فرق المنصة والفرق التمكينية مقاييس أداء غير مباشرة بشكل مناسب بدلًا من فرض مقياس نتيجة مباشرة غير ملائم على عملها.

المراجع وقراءات إضافية

  • Forsgren, Nicole, Margaret-Anne Storey, Chandra Maddila, Thomas Zimmermann, Brian Houck, and Jenna Butler, “The SPACE of Developer Productivity,” ACM Queue (2021).
  • Accelerate: The Science of Lean Software and DevOps، بقلم Nicole Forsgren، Jez Humble، وGene Kim (قياس الأداء القائم على النتيجة).
  • Team Topologies، بقلم Matthew Skelton وManuel Pais (هياكل فرق المنصة والفرق التمكينية وكيفية قياس مساهمتها).
  • Measuring and Managing Performance in Organizations، بقلم Robert D. Austin (مخاطر مقاييس الأداء زائفة الدقة).