8.3 Развёртывание метрик без порождения страха
Обзор и мотивация
Эта тема, в реальном смысле, практическая кульминация всего, что эта книга утверждала с тех пор, как тема 1.2 ввела закон Гудхарта: программа метрик, развёрнутая плохо, способом, провоцирующим страх, а не доверие, гарантирует именно то поведение манипулирования, против которого предупреждала каждая последующая тема, независимо от того, насколько тщательно была спроектирована каждая отдельная метрика. Организация может правильно сделать каждую техническую деталь, честную визуализацию, сочетание со страховочной метрикой, тщательное управление, и всё же произвести разрушенную, не заслуживающую доверия программу метрик, если само развёртывание учит инженеров, что эти числа существуют, чтобы судить их, а не помогать им.
Механизм здесь прямолинеен и хорошо задокументирован в исследовании организационного поведения, которое эта книга цитировала на протяжении всего изложения: люди, боящиеся, что метрика будет использована против них, подрывающая психологическую безопасность, реагируют именно так, как предсказывает тема 1.2, они оптимизируют число, а не лежащую в основе реальность, поскольку стимул защитить себя немедленный и личный, пока вред организационному обучению рассеянный и отложенный. Это не провал индивидуального характера; это рациональный ответ на подлинную угрозу, и единственное долговечное исправление удаление угрозы, а не просьба к людям вести себя честнее несмотря на неё.
Для крупных команд руководство этой темы важнее всего особенно остро в момент первоначального развёртывания, когда доверие ещё не установлено в любую сторону, а ранние впечатления устанавливают длительные ожидания. Корпоративные организации, вводящие новую, общеорганизационную программу метрик, рискуют единственным плохо обработанным ранним инцидентом, метрики одной команды использованы карательно, отравляющим доверие по всему развёртыванию; государственные организации, часто вводящие программы метрик в контексте существующих профсоюзных защит, культуры государственной службы или исторического недоверия к инициативам измерения, нуждаются в руководстве этой темы, применённом с особой осторожностью и терпением.
Ключевые принципы
- Страх разрушает данные быстрее и основательнее, чем любой технический изъян в дизайне метрики. Идеально спроектированная метрика, развёрнутая плохо, всё равно подделывается.
- Доверие устанавливается через продемонстрированное, последовательное некарательное использование, а не через одно лишь политическое заявление. Действия на протяжении нескольких циклов строят доверие; слова одни не строят.
- Ранние инциденты развёртывания устанавливают длительные ожидания. Первые несколько раз, когда метрика касается чего-то значимого, определяют, как будет воспринята вся программа на будущее.
- Прозрачность о цели и процессе сокращает страх больше, чем одно лишь успокоение. Люди доверяют тому, что они могут увидеть и понять, а не только тому, что им говорят.
- Это постоянная организационная дисциплина, а не разовое объявление о развёртывании. Страх может постепенно вернуться даже после подлинно заслуживающего доверия начала.
Рекомендации
Сообщайте цель и не-цели явно, перед развёртыванием, а не после возникновения опасений
Следуя дисциплине устава метрик из темы 1.4, сообщайте цель новой программы метрик и, критически, её явные не-цели (никогда не используется для индивидуальной оценки производительности без отдельно, ясно раскрытой политики, согласно теме 1.1) перед запуском, а не реактивно после того, как инженеры уже начали беспокоиться. Проактивная, заблаговременная прозрачность о том, для чего метрика не предназначена, предотвращает тревожные спекуляции, иначе заполняющие вакуум и формирующие ранние, трудно обратимые впечатления.
Вовлекайте людей, которых измеряют, в процесс дизайна
Инженеры, помогающие спроектировать метрики, описывающие их собственную работу, гораздо менее вероятно будут бояться или возмущаться этими метриками, чем те, у кого система навязана без какого-либо вклада. Вовлекайте представителей команды напрямую в выбор того, какие метрики отслеживать, как они визуализируются и какие страховочные метрики применяются, следуя последовательному акценту этой книги на владении на уровне команды (тема 1.4), а не чисто директивному мандату сверху.
Начинайте с только диагностического использования и доказывайте это на протяжении нескольких циклов, прежде чем вообще рассматривается какое-либо оценочное использование
Следуя различию диагностического и оценочного из темы 1.1 напрямую: начинайте новую программу метрик в чисто диагностическом режиме, используемом только для понимания и улучшения систем, без какой-либо связи вообще с индивидуальной или командной оценкой, и поддерживайте эту дисциплину видимо на протяжении нескольких циклов отчётности, прежде чем вообще начнётся какой-либо разговор о более широком использовании. Доверие, построенное таким образом, через продемонстрированную сдержанность со временем, гораздо более долговечно, чем доверие, заявленное одним лишь политическим документом.
Отвечайте на первый плохо обработанный инцидент немедленно и видимо
Если метрика использована неправильно карательно, даже однажды, даже неформально, адресуйте это немедленно, видимо и напрямую, а не позволяйте этому пройти тихо. Ответ организации на её первый инцидент плохой обработки несоразмерно важен в формировании доверия всей команды или организации ко всей программе на будущее; быстрое, прозрачное исправление сигнализирует подлинную приверженность заявленной некарательной цели, пока молчание или тихое, неадресованное исключение подтверждает именно тот страх, движущий поведение манипулирования с самого начала.
Сделайте сам риск манипулирования общим, прозрачным разговором, а не скрытой заботой руководства
Вместо отношения к риску манипулирования как к тому, о чём руководство беспокоится приватно, делитесь логикой сочетания со страховочной метрикой из темы 1.2 открыто с командами, которых измеряют: объясняйте напрямую, почему существует конкретная страховочная метрика, какой паттерн манипулирования она спроектирована ловить, и приглашайте собственный вклад команды о том, хорошо ли спроектирована страховочная метрика. Эта прозрачность, формулирующая всю команду как партнёров в предотвращении манипулирования, а не субъектов, за которыми наблюдают на этот предмет, строит принципиально другие отношения с программой метрик, чем система, тихо полицейски наблюдающая за манипулированием сверху, никогда открыто не обсуждая риск.
Компромиссы: плюсы и минусы
| Подход | Плюсы | Минусы |
|---|---|---|
| Директивный мандат с минимальным вовлечением команды | Быстро развернуть, последовательный дизайн | Высокий риск движимого страхом манипулирования и низкого доверия с самого начала |
| Развёртывание с вовлечением команды, совместный дизайн | Строит подлинное доверие и поддержку, более низкий риск манипулирования | Медленнее развернуть, требует больше усилия координации |
| Немедленное оценочное использование с первого дня | Ощущается эффективным, быстро связывает метрики с последствиями | Провоцирует максимальный страх и риск манипулирования до того, как установлено какое-либо доверие |
| Расширенный только диагностический доказательный период перед любым оценочным использованием | Строит долговечное, основанное на доказательстве доверие | Медленнее реализовать любой случай оценочного использования, который руководство может в итоге хотеть |
Центральное напряжение: скорость развёртывания против построения доверия. Быстрое, директивное развёртывание запускает программу метрик быстро, но с реальным риском провоцирования именно того страха и манипулирования, против которых эта книга предупреждала с её открывающей темы; более медленное, с вовлечением команды, диагностическое в первую очередь развёртывание занимает больше времени, но строит долговечное доверие, делающее итоговые данные фактически стоящими сбора в первую очередь. Разрешайте напряжение твёрдо в пользу построения доверия, поскольку программа метрик, запускающаяся быстро, но производящая манипулированные, не заслуживающие доверия данные, в реальном смысле, достигла ничего из того, за что выступала эта книга, как бы быстро она ни была развёрнута.
Вопросы для обсуждения в команде
Была ли цель и явные не-цели нашей текущей программы метрик сообщены перед развёртыванием, или инженеры сначала узнали о ней и только позже услышали успокоение о том, как она будет использоваться? Если успокоение пришло реактивно, а не проактивно, эта последовательность сама по себе могла уже сформировать раннее доверие негативно, стоит честно назвать.
Были ли люди, которых измеряют, вовлечены в дизайн метрик, описывающих их собственную работу, или система была навязана без какого-либо вклада? Оцените ваш фактический процесс развёртывания против этого конкретного теста, поскольку вовлечение важно независимо от того, насколько хорошим оказался итоговый дизайн метрики.
Поддерживала ли наша программа метрик подлинно только диагностическое использование на протяжении нескольких циклов отчётности, или оценочное использование вкралось раньше, чем рекомендовало бы развёртывание, строящее доверие? Честно прослеживайте фактическую историю; дрейф здесь часто происходит постепенно и неформально, а не через единое явное изменение политики.
Была ли когда-либо метрика использована неправильно карательно, даже однажды, даже неформально, и как ответила организация? Если это случалось, честно оцените, был ли ответ быстрым и видимым или тихим и неадресованным, поскольку этот ответ сформировал доверие ко всей программе гораздо больше, чем сам исходный инцидент.
Понимают ли команды, которых измеряют, почему существует каждая страховочная метрика, или логика предотвращения манипулирования остаётся приватной заботой руководства, о которой им никогда напрямую не говорят? Обсудите, была ли логика страховочной метрики вашей организации (тема 1.2) фактически поделена прозрачно или осталась невысказанным, закулисным дизайнерским соображением.
Если бы мы начали развёртывание наших метрик с нуля сегодня, полностью применяя руководство этой темы, насколько другим выглядел бы процесс от того, что фактически произошло? Этот ретроспективный мысленный эксперимент часто раскрывает конкретные, называемые места, где построение доверия было срезано под давлением времени, стоящие извлечения урока, даже если исходное развёртывание нельзя отменить.
Отраслевой взгляд
Стартап. Доверие часто легче установить в этом масштабе, поскольку прямой ежедневный разговор естественно предоставляет прозрачность, которую рекомендует эта тема. Риск в пропуске сознательного сообщения цели и не-целей просто потому, что это ощущается ненужным в маленькой, близкой команде, предположение, способное тихо разрушиться по мере роста команды и присоединения новых сотрудников без того же общего контекста.
Малый бизнес. Простой, прямой разговор о том, почему вводится новая метрика и для чего она будет и не будет использоваться, проведённый перед развёртыванием, а не после возникновения опасений, захватывает большую часть ценности этой темы без необходимости в формальном процессе в этом масштабе.
Корпорация. Масштаб и обезличенность крупной организации делают руководство этой темы и труднее хорошо выполнить, и критичнее сделать правильно, поскольку единственный плохо обработанный инцидент может отравить доверие по десяткам команд, узнающих о нём из вторых рук, а не испытывающих его напрямую. Инвестируйте сознательно в расширенный, диагностический в первую очередь доказательный период, который рекомендует эта тема, и установите ясный, быстрый, видимый протокол ответа на любой инцидент неправильного использования метрики до того, как он произойдёт.
Государство. Организации государственного сектора часто вводят программы метрик в контекст существующих профсоюзных защит, устоявшейся культуры государственной службы и, в некоторых случаях, исторического недоверия к инициативам измерения, связанным с прошлыми спорами об управлении производительностью. Применяйте руководство этой темы с особым терпением и формальностью, потенциально вовлекая вклад профсоюза или представителей персонала напрямую в процесс дизайна, и ожидайте, что срок построения доверия подлинно длиннее, чем в типичном контексте частного сектора.
Примеры
Корпорация. Первоначальное развёртывание всеобъемлющей панели инженерных метрик компании-разработчика программного обеспечения, спроектированной полностью центральной командой платформы без вклада на уровне команды, встретило широко распространённое, тихое сопротивление: инженеры по всей организации начали неформально манипулировать собственными сообщаемыми числами в течение недель, именно так, как предсказывает тема 1.2 для не вызывающей доверия, директивной системы метрик. Перезапуск шесть месяцев позже, на этот раз вовлекший представителей команды напрямую в выбор метрик и дизайн страховочных метрик, и явно обязавшийся и затем подлинно поддерживавший шестимесячный только диагностический период, прежде чем начался какой-либо разговор о более широком использовании, произвёл измеримо более заслуживающие доверия данные в течение года: внутренний аудит, сравнивающий самостоятельно сообщённые и инструментированные конвейером числа развёртываний, обнаружил, что разрыв между ними существенно сократился по сравнению с ранними месяцами исходного развёртывания.
Государство. Первая попытка государственного агентства штата ввести инженерные метрики была полностью отменена двумя годами ранее после единственного инцидента, в котором менеджер неформально сослался на данные активности отдельного человека в разговоре о производительности, изолированный, но неадресованный инцидент, отравивший доверие к всей инициативе по всему агентству на годы вперёд, причём персонал всё ещё упоминал «ту штуку с метриками» с видимым скептицизмом долгое время после того, как исходная программа была тихо отложена. Новая, сознательно перезапущенная программа явно и публично адресовала эту историю напрямую, признав прошлую плохую обработку, обязавшись к конкретной, опубликованной политике некарательного использования с именованным подотчётным исполнительным спонсором, и установив быстрый, прозрачный протокол ответа на любую будущую заботу о неправильном использовании. Это явное признание прошлого провала, а не просто перезапуск, как если бы истории не существовало, было конкретно признано представителями персонала как причина, почему вторая попытка заработала подлинное доверие, где первая не смогла.
Бизнес-кейс: мотивация, ROI и TCO
Отдача от развёртывания, строящего доверие и избегающего страха, это, довольно просто, заслуживающие доверия данные, без которых тщательная работа по дизайну метрик каждой другой темы этой книги производит ничего реальной ценности. Пример корпорации выше показывает это конкретно и измеримо: данные перезапущенной программы были демонстративно более точными, чем были данные исходного, движимого страхом развёртывания, прямая, количественно измеримая отдача на дополнительную инвестицию в построение доверия.
Полная стоимость владения в основном это время и организационное терпение: расширенный диагностический в первую очередь доказательный период, усилие вовлечения команды в дизайн и поддерживаемая дисциплина быстрого и видимого ответа на любой инцидент неправильного использования. Эта стоимость значима, но это необходимая, неизбежная цена заслуживающих доверия данных, от которых зависит каждая другая тема этой книги; быстрое развёртывание, пропускающее эту инвестицию, производит программу метрик, выглядящую завершённой, но тихо бесполезную, разрушенную именно тем манипулированием, против которого эта книга предупреждала с самой первой содержательной темы.
Антипаттерны и ловушки
- Директивное развёртывание без вовлечения команды в дизайн метрики: провоцирует страх и манипулирование с самого начала, независимо от того, насколько хорошо спроектированы сами метрики.
- Реактивная, а не проактивная коммуникация цели и не-целей: позволяет тревожным спекуляциям заполнить вакуум и сформировать ранние, трудно обратимые впечатления.
- Спешка к оценочному использованию до того, как прошёл подлинный только диагностический период доверия: единственный самый распространённый способ, которым новая программа метрик немедленно провоцирует поведение манипулирования.
- Тихий, неадресованный ответ на инцидент неправильного использования метрики: подтверждает именно тот страх, движущий манипулированием, и наносит длительный ущерб доверию ко всей программе.
- Сохранение логики предотвращения манипулирования и страховочных метрик приватной заботой руководства: упускает возможность построения доверия через прозрачное, общее рассуждение с командами, которых измеряют.
- Перезапуск ранее плохо обработанной программы метрик без прямого признания прошлого провала: повторяет исходную ошибку недостаточной прозрачности, на этот раз усугублённую неадресованной историей.
Модель зрелости
- Уровень 1, Инициация: Метрики развёрнуты директивно без вовлечения команды, а цель и не-цели сообщаются реактивно, если вообще.
- Уровень 2, Развитие: Некоторая коммуникация и вовлечение команды происходят, но нет поддерживаемого только диагностического доказательного периода и никакого ясного протокола ответа на неправильное использование.
- Уровень 3, Стандартизация: Новые программы метрик последовательно развёртываются с проактивной коммуникацией, вовлечением команды в дизайн и обязательным только диагностическим доказательным периодом по всей организации.
- Уровень 4, Управление: Существует быстрый, прозрачный, проверенный протокол ответа на неправильное использование, и он был применён на практике, а рассуждение о страховочной метрике открыто делится с измеряемыми командами как стандартная практика.
- Уровень 5, Оркестрация: Организация имеет продемонстрированный, устойчивый послужной список заслуживающих доверия, с низким манипулированием данных метрик, напрямую приписываемый дисциплинированной, строящей доверие практике развёртывания, и этот послужной список активно защищается и усиливается с каждой новой вводимой метрикой.
Идеи для обсуждения
- Была ли цель нашей текущей программы метрик сообщена до или после возникновения опасений?
- Были ли люди, которых измеряют, подлинно вовлечены в дизайн наших метрик, или система была навязана?
- Плохо ли когда-либо наша организация обработала метрику карательно, и как мы ответили?
- Понимают ли измеряемые команды, почему существуют наши страховочные метрики, или это рассуждение держится приватным?
- Если бы мы перезапустили нашу программу метрик сегодня с полным вниманием к этой теме, что бы мы сделали по-другому?
Основные выводы
- Страх разрушает данные быстрее и основательнее, чем любой технический изъян в дизайне метрики; идеально спроектированная метрика, развёрнутая плохо, всё равно подделывается.
- Вовлекайте измеряемые команды напрямую в дизайн метрики и сообщайте цель и явные не-цели проактивно, перед развёртыванием.
- Начинайте только с диагностического и доказывайте это на протяжении нескольких циклов, прежде чем вообще рассматривается какое-либо оценочное использование.
- Отвечайте на первый плохо обработанный инцидент немедленно и видимо; молчание подтверждает именно тот страх, движущий поведением манипулирования.
- Делитесь рассуждением о страховочной метрике и предотвращении манипулирования прозрачно с измеряемыми командами, строя партнёрство, а не полицейские отношения.
Источники и дальнейшее чтение
- Drive: The Surprising Truth About What Motivates Us, Дэниел Х. Пинк (внутренняя против внешней мотивации, напрямую релевантная тому, почему страх разрушает поведение, движимое метриками).
- The Tyranny of Metrics, Джерри З. Мюллер (организационные и культурные стоимости плохо внедрённых программ метрик).
- Site Reliability Engineering: How Google Runs Production Systems, под редакцией Бетси Бейер, Криса Джонса, Дженнифер Петофф и Найалла Ричарда Мёрфи (принципы безвиновной культуры, которые эта тема расширяет от реагирования на инциденты к развёртыванию программы метрик в целом).
- Accelerate: The Science of Lean Software and DevOps, Николь Форсгрен, Джез Хамбл и Джин Ким (исследование организационной культуры, лежащее в основе заслуживающей доверия, высокоэффективной практики инженерных метрик).