1.6

1.6 इंजीनियरिंग मेट्रिक्स के लिए सांख्यिकीय साक्षरता

अवलोकन और प्रेरणा

एक मेट्रिक्स कार्यक्रम को अच्छी तरह चलाने के लिए आपको सांख्यिकी की डिग्री की आवश्यकता नहीं है, लेकिन आपको उन विशिष्ट, आम ग़लतियों की एक छोटी संख्या से बचने की आवश्यकता है जो अन्यथा अच्छी तरह गवर्न किए गए, अच्छी तरह इंस्ट्रूमेंट किए गए मेट्रिक्स को सक्रिय रूप से भ्रामक बना देती हैं। एक टीम सब कुछ सही कर सकती है, एक स्पष्ट निर्णय नाम दे सकती है, गुडहार्ट के नियम से बच सकती है, परिणामों की ओर तौल सकती है, स्वामित्व को गवर्न कर सकती है, विश्वसनीय रूप से इंस्ट्रूमेंट कर सकती है, और फिर भी ग़लत निष्कर्ष निकाल सकती है क्योंकि उसने वहाँ एक औसत पढ़ा जहाँ उसे एक प्रतिशतक की आवश्यकता थी, शोर को एक प्रवृत्ति समझ लिया, या एक संयोग के जाल में फँस गई जो कारण के रूप में सजा हुआ था। यह विषय वह न्यूनतम सांख्यिकीय समझ है जिसे यह पुस्तक मानती है कि बाद के हर विषय का पाठक पहले से रखता है।

मूल समस्या यह है कि इंजीनियरिंग मेट्रिक्स आमतौर पर औपचारिक सांख्यिकी के मानकों के हिसाब से शोरगुल वाले, तिरछे, और छोटे-नमूने वाले होते हैं। एक अकेली टीम की साप्ताहिक डिप्लॉय गिनती एक चिकनी बेल कर्व नहीं है; यह मुट्ठी भर डेटा बिंदु हैं जिनमें कभी-कभार बड़े आउटलायर होते हैं (एक बड़ी रिलीज़, एक घटना-चालित रोलबैक का सिलसिला)। बड़े, सुव्यवहृत डेटासेटों के लिए बने भोले-भाले अंतर्ज्ञानों को इस तरह के डेटा पर लागू करना नियमित रूप से आत्मविश्वासपूर्ण, ग़लत निष्कर्ष उत्पन्न करता है। यह सीखना कि जब कोई संख्या भरोसे के लायक़ होने के लिए बहुत शोरगुल वाली है, जब एक औसत आपसे झूठ बोल रहा है, और जब दो चीज़ों का साथ-साथ हिलना कार्य-कारण के बारे में कुछ नहीं कहता, यह वैकल्पिक कठोरता नहीं है, यह वह चीज़ है जो एक मेट्रिक्स कार्यक्रम को जो एक संगठन को कुछ सच सिखाता है से अलग करती है उससे जो उसे कुछ प्रशंसनीय-लगने वाला और झूठा सिखाता है।

एंटरप्राइज़ और सरकारी पैमाने पर, सांख्यिकीय ग़लतियाँ बढ़ती हैं क्योंकि एक भ्रामक निष्कर्ष, एक बार नेतृत्व द्वारा स्वीकार किए जाने पर, कई टीमों में उस पर कार्रवाई की जाती है इससे पहले कि कोई अंतर्निहित विश्लेषण को फिर से जाँचने के बारे में सोचे। दो डिवीज़नों के बीच, या एक प्रमुख पुनर्गठन से पहले और बाद के बीच एक सांख्यिकीय रूप से भोली तुलना, केवल शोर या एक भ्रामक चर से अधिक कुछ नहीं जिसे किसी ने नियंत्रित नहीं किया, के आधार पर वर्षों तक संसाधन निर्णयों को आकार दे सकती है। यह विषय उस विफलता को कम संभावित बनाने के लिए मौजूद है।

प्रमुख सिद्धांत

  • एक मध्यमान या प्रतिशतक आमतौर पर आपको एक औसत से अधिक बताता है। इंजीनियरिंग डेटा नियमित रूप से आउटलायरों से तिरछा होता है जिन्हें औसत अवशोषित करते हैं और प्रतिशतक नहीं करते।
  • छोटे नमूने शोरगुल वाली संख्याएँ उत्पन्न करते हैं। मुट्ठी भर घटनाओं से गणना किया गया एक प्रतिशत ऐसे कारणों से भयंकर रूप से झूलता है जिनका वास्तविक परिवर्तन से कोई लेना-देना नहीं है।
  • माध्य की ओर प्रतिगमन लोगों को लगातार मूर्ख बनाता है। एक असामान्य रूप से अच्छी या बुरी रीडिंग के बाद आमतौर पर एक अधिक सामान्य रीडिंग आती है, किसी हस्तक्षेप के साथ या बिना।
  • सहसंबंध कार्य-कारण नहीं है, और भ्रामक चर हर जगह हैं। दो मेट्रिक्स जो साथ-साथ हिलते हैं वे एक छिपे हुए तीसरे कारण को साझा कर सकते हैं बजाय इसके कि एक दूसरे को चला रहा हो।
  • एक नियंत्रण चार्ट एक अकेली पहले-और-बाद तुलना से बेहतर है। विविधता की सामान्य सीमा को देखना ही आपको एक वास्तविक बदलाव को शोर से अलग बताने देता है।

सिफ़ारिशें

तिरछे डेटा के लिए मध्यमान और प्रतिशतकों पर डिफ़ॉल्ट करें

इंजीनियरिंग समय-आधारित मेट्रिक्स, लीड टाइम, घटना पुनर्प्राप्ति समय, प्रतिक्रिया विलंबता, लगभग हमेशा दाएँ-तिरछे होते हैं: अधिकांश मूल्य कम पर समूहित होते हैं, कभी-कभार बड़े आउटलायरों की एक लंबी पूँछ के साथ। उस पूँछ द्वारा खींचा गया एक औसत एक ऐसा चित्र चित्रित कर सकता है जैसा कोई सामान्य मामला वास्तव में नहीं दिखता। मध्यमान (मध्य मूल्य, जहाँ आधे अवलोकन ऊपर और आधे नीचे होते हैं) को 90वें या 95वें प्रतिशतक (वह मूल्य जिसके नीचे 90% या 95% अवलोकन गिरते हैं) के साथ रिपोर्ट करें, जो साथ में सामान्य मामला और सबसे-बुरा-मामला पूँछ दोनों दिखाते हैं जिसे एक टीम वास्तव में अनुभव करती है। साथी software-engineering-guide पुस्तक का KPI विषय, और इस पुस्तक के भाग 2 का हर डिलीवरी मेट्रिक विषय, इस आदत को पूरे समय मानकर चलता है।

जानें कि कब एक नमूना भरोसा करने के लिए बहुत छोटा है

एक धीमे सप्ताह में तीन डिप्लॉय से गणना किया गया चेंज फ़ेल्योर रेट एक सार्थक संकेत नहीं है; एक अकेली विफलता प्रतिशत को रातों-रात 0% से 33% तक हिला देती है ऐसे कारणों से जिनका अंतर्निहित जोखिम से कोई लेना-देना नहीं हो सकता। एक प्रतिशत-आधारित मेट्रिक पर प्रतिक्रिया करने से पहले, अंतर्निहित गिनती जाँचें। एक व्यावहारिक अंगूठे के नियम के रूप में, लगभग बीस से तीस से कम अंतर्निहित घटनाओं से गणना की गई एक दर को शोरगुल वाला मानें और निष्कर्ष निकालने से पहले एक लंबी अवलोकन विंडो की आवश्यकता वाला मानें, और इसे डैशबोर्ड पर स्पष्ट रूप से कहें बजाय इसके कि एक अस्थिर छोटे-नमूने वाले प्रतिशत को एक स्थिर बड़े-नमूने वाले के समान आत्मविश्वास के साथ प्रस्तुत करें।

एक हस्तक्षेप को श्रेय देने से पहले माध्य की ओर प्रतिगमन के लिए सतर्क रहें

यदि एक टीम के घटनाओं के लिए अब तक के सबसे बुरे सप्ताह के बाद नेतृत्व का ध्यान और एक बाद का सुधार आता है, तो हस्तक्षेप को श्रेय देने का लालच होता है। अक्सर, उस सुधार में से कुछ वैसे भी हुआ होता, क्योंकि एक असामान्य रूप से चरम रीडिंग के बाद विशुद्ध रूप से एक सांख्यिकीय कलाकृति के रूप में एक अधिक विशिष्ट रीडिंग आने की प्रवृत्ति होती है, जिसे माध्य की ओर प्रतिगमन नामक एक परिघटना कहा जाता है। ध्यान आकर्षित करने वाले अकेले चरम डेटा बिंदु की बजाय एक लंबी ऐतिहासिक आधाररेखा के विरुद्ध तुलना करके इससे बचाव करें, और किसी भी देखे गए सुधार में से कितना एक विशिष्ट कार्रवाई को श्रेय दें इस बारे में उचित रूप से विनम्र रहकर।

एक मेट्रिक ने एक परिणाम का कारण बना यह दावा करने से पहले भ्रामक चर की तलाश करें

जब दो मेट्रिक्स साथ-साथ हिलते हैं, डिप्लॉयमेंट फ़्रीक्वेंसी ग्राहक संतुष्टि के साथ बढ़ती हुई, एक भ्रामक चर पर विचार करने से पहले यह दावा करने की प्रतिक्रिया का प्रतिरोध करें कि एक ने दूसरे का कारण बना: एक छिपा हुआ तीसरा कारक जो दोनों को चला रहा है। एक नई फ़ीचर लॉन्च स्वतंत्र रूप से डिप्लॉय फ़्रीक्वेंसी (अधिक फ़ॉलो-अप फिक्स) और संतुष्टि (फ़ीचर स्वयं) दोनों को बढ़ावा दे सकती है, दोनों मेट्रिक्स के बीच बिल्कुल कोई कारणात्मक संबंध के बिना। सहसंबंध को कार्य-कारण के प्रमाण के रूप में प्रस्तुत करने से पहले, सक्रिय रूप से पूछें कि उसी समय और क्या बदला जो दोनों गतियों को समझा सकता है।

एक नियंत्रण चार्ट का उपयोग करें, एक अकेला पहले-और-बाद स्नैपशॉट नहीं

एक नियंत्रण चार्ट एक मेट्रिक को समय के साथ प्लॉट करता है जिसमें उसकी विविधता की सामान्य सीमा स्पष्ट रूप से दिखाई गई हो, आमतौर पर एक केंद्रीय औसत के चारों ओर बैंड के रूप में। यह आपको एक वास्तविक बदलाव, सामान्य सीमा के बाहर एक डेटा बिंदु या निरंतर दौड़, को साधारण शोर से अलग करने देता है जिसे एक अकेली पहले-और-बाद तुलना अलग नहीं बता सकती। “परिवर्तन के बाद संख्या सुधरी” घोषित करने से पहले, यह देखने के लिए पर्याप्त ऐतिहासिक डेटा प्लॉट करें कि सामान्य विविधता कैसी दिखती है, और जाँचें कि क्या परिवर्तन-बाद रीडिंग वास्तव में उसके बाहर गिरती है।

समझौते: लाभ और हानि

दृष्टिकोणलाभहानि
औसतसरल, परिचित, गणना करना आसानतिरछे इंजीनियरिंग डेटा पर आउटलायरों से विकृत
मध्यमान और प्रतिशतकआउटलायरों के प्रति मज़बूत, सामान्य मामला और पूँछ दोनों साथ दिखाते हैंगैर-तकनीकी दर्शकों के लिए थोड़ा कम परिचित
अकेली पहले-और-बाद तुलनातेज़, सहज, प्रस्तुत करना आसानमाध्य की ओर प्रतिगमन और शोर के प्रति असुरक्षित
नियंत्रण चार्ट और लंबी आधाररेखाएँवास्तविक बदलावों को शोर से विश्वसनीय रूप से अलग करता हैअधिक ऐतिहासिक डेटा और गैर-तकनीकी दर्शकों को अधिक स्पष्टीकरण की आवश्यकता

केंद्रीय तनाव है सरलता बनाम कठोरता। औसत और अकेली पहले-और-बाद तुलनाएँ गणना और समझाना आसान हैं, यही ठीक कारण है कि वे आकस्मिक रिपोर्टिंग में हावी हैं, लेकिन वे उस तरह के शोरगुल वाले, तिरछे डेटा पर एक आत्मविश्वासपूर्ण, ग़लत निष्कर्ष उत्पन्न करने की सबसे अधिक संभावना वाली दो तकनीकें भी हैं जो इस पुस्तक के मेट्रिक्स उत्पन्न करते हैं। इसे किसी भी वास्तविक परिणाम वाले निर्णय के लिए अधिक कठोर तकनीकों, मध्यमान, प्रतिशतक, और नियंत्रण चार्ट, पर डिफ़ॉल्ट करके हल करें, और सरल तकनीकों को कम-दांव, खोजपूर्ण नज़रों के लिए आरक्षित रखें जहाँ एक ग़लत पठन कम क़ीमत चुकाता है।

अपनी टीम के साथ चर्चा करने के प्रश्न

  1. हमारी कौन-सी डैशबोर्ड टाइलें एक औसत रिपोर्ट करती हैं जहाँ एक मध्यमान या प्रतिशतक अधिक सच्ची कहानी बताएगा? समय-आधारित इंजीनियरिंग मेट्रिक्स लगभग हमेशा तिरछे होते हैं, और तिरछे डेटा पर एक औसत ठीक दिख सकता है जबकि सामान्य मामला, या सबसे-बुरा-मामला पूँछ, पूरी तरह एक अलग कहानी बताता है। इस प्रतिस्थापन के लिए विशेष रूप से अपनी समय-आधारित टाइलों का ऑडिट करें।

  2. हमारे प्रतिशत-आधारित मेट्रिक्स के पीछे अंतर्निहित नमूना कितना छोटा है, और क्या हम एक हज़ार घटनाओं से मेट्रिक के समान आत्मविश्वास के साथ दस घटनाओं से एक मेट्रिक का व्यवहार करते हैं? बिना अपनी अंतर्निहित गिनती के प्रस्तुत की गई एक अस्थिर छोटे-नमूने वाली दर शोर पर अतिप्रतिक्रिया को आमंत्रित करती है। इस अंतर के लिए अपनी चेंज-फ़ेल्योर-रेट और समान प्रतिशत टाइलों की जाँच करें।

  3. क्या हमने कभी एक ऐसे सुधार के लिए एक हस्तक्षेप को श्रेय दिया जिसे माध्य की ओर प्रतिगमन वैसे भी उत्पन्न करता? यह करने के लिए सबसे आसान सांख्यिकीय ग़लतियों में से एक है और बाद में नोटिस करने के लिए सबसे कठिन में से एक है, क्योंकि हस्तक्षेप और सुधार वास्तव में उसी क्रम में हुए। एक हालिया “हमने इसे ठीक किया” कहानी को देखें और ईमानदारी से पूछें कि क्या आधाररेखा तुलना इसे नकारने के लिए पर्याप्त लंबी थी।

  4. हमने कहाँ यह माना कि एक मेट्रिक ने दूसरे का कारण बना बिना किसी भ्रामक चर की जाँच किए? दो चीज़ों का साथ-साथ हिलना आम है; एक का दूसरे का कारण बनना एक मज़बूत दावा है जिसे अधिक प्रमाण की आवश्यकता है। एक सहसंबंध चुनें जिस पर आपकी टीम वर्तमान में विश्वास करती है और एक प्रशंसनीय भ्रम का नाम लेने का प्रयास करें जो इसे बिल्कुल कोई कारणात्मक संबंध के बिना समझाएगा।

  5. क्या हमारे पास इतना ऐतिहासिक डेटा है कि यह जानें कि हमारे सबसे महत्वपूर्ण मेट्रिक्स के लिए सामान्य विविधता कैसी दिखती है, या क्या हम अकेले बिंदुओं की तुलना कर रहे हैं? सामान्य सीमा की समझ के बिना, कोई भी अकेली रीडिंग प्रमाण की बजाय मनोदशा के आधार पर चिंताजनक या आश्वस्त करने वाली दिखती है। चर्चा करें कि क्या आपके सबसे-देखे-जाने वाले मेट्रिक को कभी एक अकेली संख्या की बजाय एक नियंत्रण चार्ट के रूप में प्लॉट किया गया है।

  6. हम वर्तमान में गैर-तकनीकी रुचिधारकों को अनिश्चितता कैसे संप्रेषित करते हैं, और क्या हमारा डैशबोर्ड डेटा वास्तव में जितना समर्थन करता है उससे अधिक सटीकता का संकेत देता है? सामान्य विविधता या नमूना आकार के किसी संकेत के बिना एक चार्ट एक नेतृत्व टीम को शोर पर अतिप्रतिक्रिया करने पर, या उतनी ही बार, एक वास्तविक संकेत को शोर के रूप में खारिज करने पर मजबूर कर सकता है। चर्चा करें कि आपकी रिपोर्टिंग इसे बिना अपठनीय बने ईमानदारी से कैसे संप्रेषित कर सकती है।

क्षेत्र दृष्टिकोण

स्टार्टअप। छोटी टीमें लगभग हर जगह छोटे नमूने उत्पन्न करती हैं, जिसका मतलब है कि इस विषय की छोटे-नमूने की सावधानी लगातार मायने रखती है। एक अकेले बुरे सप्ताह या एक अकेले शानदार सप्ताह से मज़बूत निष्कर्ष निकालने का प्रतिरोध करें; केवल मुट्ठी भर डेटा बिंदुओं के साथ, “क्या यह एक प्रवृत्ति है” का ईमानदार उत्तर अक्सर “हम अभी तक नहीं जानते” होता है।

छोटा व्यवसाय। रेडीमेड उपकरणों से अंतर्निहित डैशबोर्ड अक्सर औसत और अकेली-अवधि तुलनाओं पर डिफ़ॉल्ट करते हैं क्योंकि वे गणना और प्रदर्शित करने में सबसे सरल हैं। जहाँ उपकरण अनुमति दे, समय-आधारित मेट्रिक्स के लिए मध्यमान पर स्विच करें, और एक छोटी अंतर्निहित गिनती से गणना किए गए किसी भी “इस महीने 40% ऊपर” हेडलाइन के प्रति संदेहशील रहें।

एंटरप्राइज़। इस पैमाने पर सांख्यिकीय ग़लतियाँ उन संसाधन और पुनर्गठन निर्णयों में बेक हो जाती हैं जो सैकड़ों लोगों को प्रभावित करते हैं। विश्लेषकों या एम्बेडेड डेटा व्यावसायियों में निवेश करें जो उचित नियंत्रण चार्ट बना सकते हैं और नेतृत्व को तय तथ्य के रूप में प्रस्तुत किए जाने से पहले व्यावसायिक इकाइयों के बीच या पहले-और-बाद एक प्रमुख परिवर्तन की तुलना के लिए भ्रामक चरों की जाँच कर सकते हैं।

सरकार। एक सार्वजनिक रिपोर्ट या बजट औचित्य को फ़ीड करने वाली एक सांख्यिकीय रूप से भोली तुलना के वास्तविक-दुनिया के अत्यधिक परिणाम हो सकते हैं और ठीक उसी तरह की जाँच को आमंत्रित करती है जो लापरवाह विश्लेषण को सार्वजनिक रूप से उजागर करती है। बाहरी रूप से प्रकाशित किसी भी चीज़ के लिए एक स्थायी प्रथा के रूप में अधिक कठोर तकनीकों, नियंत्रण चार्ट, दस्तावेज़ीकृत नमूना आकार, भ्रम जाँच को लागू करें, न कि केवल एक कभी-कभार का सर्वश्रेष्ठ प्रयास के रूप में।

उदाहरण

एंटरप्राइज़। एक सॉफ़्टवेयर कंपनी की नेतृत्व टीम ने एक नई कोड समीक्षा नीति लागू करने के महीने बाद चेंज फ़ेल्योर रेट में 25% सुधार का जश्न मनाया, नीति को सीधे श्रेय देते हुए। एक क़रीबी नज़र में पाया गया कि “पहले” वाला महीना असामान्य रूप से बुरा था, जो एक टीम के ख़राब हुए माइग्रेशन से चलित था, और दोनों महीनों में अंतर्निहित नमूना आकार कंपनी भर में तीस डिप्लॉय से कम था। बारह महीनों के इतिहास का उपयोग करने वाले एक नियंत्रण चार्ट ने दिखाया कि नई रीडिंग सामान्य विविधता के भीतर अच्छी तरह से थी, कोई वास्तविक चरण परिवर्तन नहीं, और नीति का वास्तविक प्रभाव, यद्यपि वास्तविक, हेडलाइन संख्या के सुझाव से कहीं छोटा था।

सरकार। एक सार्वजनिक ट्रांज़िट एजेंसी ने एक नई डिजिटलीकृत शेड्यूलिंग प्रणाली के लिए समय-पर-प्रदर्शन में एक बड़े साल-दर-साल सुधार की रिपोर्ट दी, एक अकेले “पहले” चौथाई की एक अकेले “बाद” चौथाई से तुलना करते हुए। एक स्वतंत्र समीक्षा में पाया गया कि “पहले” चौथाई एक असंबंधित निर्माण बंदी के साथ मेल खाता था जिसने पूरे नेटवर्क में प्रदर्शन को दबा दिया था, और एक लंबी आधाररेखा ने दिखाया कि नई प्रणाली लॉन्च होने से पहले ही समय-पर-प्रदर्शन ठीक होना शुरू हो चुका था। एजेंसी की संशोधित रिपोर्ट ने एक पूर्ण बहु-वर्षीय नियंत्रण चार्ट का उपयोग किया और नई प्रणाली को विशेष रूप से एक अधिक मामूली, लेकिन अधिक बचाव योग्य, सुधार का श्रेय दिया।

व्यावसायिक तर्क: प्रेरणाएँ, ROI, और TCO

सांख्यिकीय साक्षरता का प्रतिफल टाला गया कुपथन है: एक संगठन जो सही ढंग से एक सुधार को श्रेय देता है, या सही ढंग से शोर को शोर के रूप में पहचानता है, वह अपना अगला निवेश वहाँ ख़र्च करता है जहाँ यह वास्तव में मदद करेगा बजाय इसके कि एक भूतिया प्रभाव का पीछा करे। ऊपर का रिटेल उदाहरण विशिष्ट है: एक कंपनी जो विश्वास करती थी कि उसकी अकेली समीक्षा नीति ने 25% सुधार को चलाया, वह अन्य वास्तविक योगदानकर्ताओं में कम निवेश कर सकती है, या नीति के मूल्य को इस तरह से बढ़ा-चढ़ा कर बता सकती है जो भविष्य के निर्णयों को भ्रामक बनाए।

सांख्यिकीय कठोरता की कुल लागत नए उपकरण की बजाय अधिकांशतः एक आदत में बदलाव है: औसत पर एक मध्यमान चुनना, प्रतिक्रिया करने से पहले एक नमूना आकार जाँचना, जीत घोषित करने से पहले एक लंबी आधाररेखा प्लॉट करना। ये आदतें अपनाने में कम क़ीमत लेती हैं और आत्मविश्वासपूर्ण, ग़लत निष्कर्षों पर लिए गए निर्णयों की बहुत बड़ी, पता लगाने में कठिन लागत को रोकती हैं।

विरोधी-पैटर्न और नुक़सान

  • तिरछे समय-आधारित डेटा पर एक औसत रिपोर्ट करना: सामान्य मामले और पूँछ को एक अकेली भ्रामक संख्या के पीछे छिपाता है।
  • बिना दृश्यमान नमूना आकार के एक प्रतिशत पर प्रतिक्रिया करना: मुट्ठी भर घटनाओं से शोर को ऐसे मानता है मानो यह एक स्थिर, सार्थक प्रवृत्ति हो।
  • माध्य की ओर प्रतिगमन को नकारे बिना एक हस्तक्षेप को श्रेय देना: एक आम, करने में आसान, नोटिस करने में कठिन ग़लती।
  • भ्रामक चरों पर विचार किए बिना सहसंबंध से कार्य-कारण का दावा करना: डेटा वास्तव में जो समर्थन करता है उसे बढ़ा-चढ़ा कर बताता है।
  • एक लंबी आधाररेखा प्लॉट करने की बजाय एक अकेला पहले-और-बाद स्नैपशॉट तुलना करना: एक वास्तविक बदलाव को साधारण विविधता से अलग नहीं बता सकता।
  • नेतृत्व-सामना करने वाली रिपोर्टिंग में डेटा के समर्थन से अधिक सटीकता का संकेत देना: शोर पर अतिप्रतिक्रिया या एक वास्तविक संकेत की अवहेलना को आमंत्रित करता है।

परिपक्वता मॉडल

  • स्तर 1, आरंभ: मेट्रिक्स को कच्चे औसत और अकेले पहले-और-बाद स्नैपशॉट के रूप में रिपोर्ट किया जाता है, बिना नमूना आकार, तिरछापन, या आधाररेखा विविधता पर ध्यान दिए।
  • स्तर 2, विकास: कुछ विश्लेषक अनौपचारिक रूप से मध्यमान या प्रतिशतक लागू करते हैं, लेकिन कोई निरंतर संगठनात्मक प्रथा नहीं है और भ्रम शायद ही कभी जाँचे जाते हैं।
  • स्तर 3, मानकीकरण: तिरछे समय-आधारित मेट्रिक्स के लिए मध्यमान और प्रतिशतक डिफ़ॉल्ट हैं; प्रतिशत-आधारित मेट्रिक्स के साथ नमूना आकार संगठन भर में दिखाए जाते हैं।
  • स्तर 4, प्रबंधन: ऐतिहासिक आधाररेखाओं वाले नियंत्रण चार्ट किसी भी वास्तविक बदलाव के दावे के लिए मानक प्रथा हैं; रिपोर्टिंग में कारणात्मक दावे किए जाने से पहले भ्रामक चरों पर सक्रिय रूप से विचार किया जाता है।
  • स्तर 5, संयोजन: सांख्यिकीय कठोरता उपकरण में ही निर्मित है, डैशबोर्ड डिफ़ॉल्ट रूप से प्रतिशतक और नियंत्रण बैंड प्रस्तुत करते हैं, और संगठन प्रदर्शित कर सकता है कि एक विशिष्ट पिछला निर्णय ठीक किया गया था क्योंकि रणनीति को आकार देने से पहले एक सांख्यिकीय रूप से भोले पठन को पकड़ लिया गया था।

चर्चा के लिए विचार

  1. यदि हम एक औसत को मध्यमान से बदल दें तो हमारी वर्तमान डैशबोर्ड हेडलाइनों में से कौन-सी अलग दिखेगी?
  2. क्या हमने कभी एक निर्णय बदला क्योंकि एक प्रतिशत हमारी सोच से बहुत छोटे नमूने पर आधारित निकला?
  3. एक हालिया “हमने इस मेट्रिक को सुधारा” कहानी क्या है जिसे हमें माध्य की ओर प्रतिगमन के लिए फिर से जाँचना चाहिए?
  4. हमारे कौन-से दो मेट्रिक्स एक छिपे हुए तीसरे कारण से सहसंबद्ध हो सकते हैं बजाय इसके कि एक दूसरे को चला रहा हो?
  5. क्या हमारे सबसे महत्वपूर्ण चार्ट विविधता की एक सामान्य सीमा दिखाते हैं, या केवल एक अकेली प्रवृत्ति रेखा?

मुख्य निष्कर्ष

  • तिरछे, समय-आधारित इंजीनियरिंग मेट्रिक्स के लिए औसत पर मध्यमान और प्रतिशतकों को प्राथमिकता दें।
  • एक छोटे नमूने से एक प्रतिशत को शोरगुल वाला मानें, और इसे स्पष्ट रूप से कहें बजाय इसके कि इस पर एक स्थिर प्रवृत्ति की तरह प्रतिक्रिया दें।
  • एक असामान्य रूप से बुरी रीडिंग के बाद आए सुधार के लिए एक हस्तक्षेप को श्रेय देने से पहले माध्य की ओर प्रतिगमन के लिए सतर्क रहें।
  • सहसंबंध कार्य-कारण नहीं है; एक कारणात्मक दावा करने से पहले सक्रिय रूप से भ्रामक चरों की तलाश करें।
  • एक वास्तविक बदलाव को साधारण शोर से अलग बताने के लिए एक वास्तविक ऐतिहासिक आधाररेखा वाला नियंत्रण चार्ट का उपयोग करें, एक अकेला पहले-और-बाद स्नैपशॉट नहीं।

संदर्भ और आगे पढ़ने के लिए

  • The Signal and the Noise, Nate Silver द्वारा (अपूर्ण डेटा में वास्तविक संकेत को शोर से अलग करना)।
  • How to Measure Anything, Douglas W. Hubbard द्वारा (संगठनात्मक मापन के लिए सांख्यिकीय तर्क)।
  • Understanding Variation: The Key to Managing Chaos, Donald J. Wheeler द्वारा (नियंत्रण चार्ट और सामान्य-कारण बनाम विशेष-कारण विविधता के बीच का भेद)।
  • Thinking, Fast and Slow, Daniel Kahneman द्वारा (संज्ञानात्मक पूर्वाग्रह जिनमें माध्य की ओर प्रतिगमन और कारणात्मक कथा का भ्रम शामिल है)।
  • The Visual Display of Quantitative Information, Edward R. Tufte द्वारा (मात्रात्मक डेटा की ईमानदार, उच्च-अखंडता प्रस्तुति)।