1.0 1부 소개: 측정의 기초
이 책이 단 하나의 메트릭이라도 이름을 붙이기 전에, 먼저 더 어려운 질문에 답해야 한다. 측정은 무엇을 위한 것인가? 대시보드를 만들어 본 모든 팀은 결국, 어떤 수치가 나타내야 할 실제 대상은 나빠지고 있는데도 그 수치 자체는 개선되는 광경을 목격하게 된다. 이것은 도구의 실패가 아니다. 이 부에서 다루는 기초를 건너뛴 결과 예측 가능하게 벌어지는 일이다: 애초에 왜 측정하는가, 사람들이 어떤 메트릭이 감시되고 있다는 것을 알게 되면 그 메트릭에 무슨 일이 벌어지는가, 활동보다 결과를 어떻게 더 무겁게 평가할 것인가, 누가 수치와 그 정의를 소유하는가, 데이터는 실제로 어디서 오는가, 그리고 스스로를 속이지 않으면서 잡음이 섞인 신호를 어떻게 읽어낼 것인가.
대규모 팀에게 이러한 기초는 더 이상 선택 사항이 아니다. 단일 팀이라면 관리자가 일주일에 한 번 훑어보는 임시방편적인 수치로도 버틸 수 있다. 하지만 수백 명의 엔지니어와 수십 개의 대시보드를 보유하고, 상위 조직에 보고해야 하는 리더십 팀을 둔 조직은 그럴 수 없다. 그 규모에서는 소유자가 없거나 잘못 정의된 메트릭이 단지 한 팀만 오도하는 것이 아니라, 그 수치가 어떻게 만들어졌는지 확인하지 않고 신뢰하는 하류의 모든 사람을 오도하며, 행동이 그것을 게임하도록 이미 적응한 뒤에는 되돌리는 데 큰 비용이 든다.
엔터프라이즈 및 정부 조직은 이를 가장 뼈저리게 느끼는데, 이들의 메트릭은 종종 그것을 만들어 낸 팀을 넘어서는 결과를 초래하기 때문이다: 예산 결정, 공공 성과 보고서, 감사 결과, 그리고 공급업체 계약. 내부적인 엔지니어링 편의로 보이던 메트릭이 조용히 그것을 만들어 낸 파이프라인을 전혀 본 적 없는 사람들의 의사 결정에 중요하고 의심의 여지 없는 입력값이 되어 버릴 수 있다. 기초를 제대로 세우는 일이야말로 그 무게를 감당할 수 있게 만든다.
이 부의 주제
- 1.1 소프트웨어 공학을 왜 측정하는가: 애초에 측정을 해야 하는 이유, 측정이 이루고자 하는 목표, 그리고 학습을 위한 측정과 판단을 위한 측정의 차이.
- 1.2 굿하트의 법칙과 메트릭의 심리학: 이 책의 다른 모든 주제를 지배하는 단 하나의 아이디어, 즉 측정 지표가 목표가 되는 순간 좋은 측정 지표이기를 멈춘다는 것, 그리고 사람들이 자신이 감시되고 있음을 아는 순간 게임이 거의 불가피해지는 심리적 메커니즘.
- 1.3 산출물보다 결과: 무엇을 측정할지 선택하기: 고전적인 투입/산출/결과 구분과 노스스타 패턴을 사용해 메트릭 집합을 활동보다 결과 쪽으로 더 무겁게 설계하는 방법.
- 1.4 메트릭 거버넌스와 소유권: 무엇을 측정할지 누가 결정하는가, 누가 정의를 소유하는가, 그리고 메트릭 헌장이 성장하는 대시보드를 책임 소재 없는 난립으로부터 어떻게 지켜내는가.
- 1.5 데이터 출처와 계측: 엔지니어링 메트릭이 실제로 어디서 오는가, 계측과 자가 보고의 차이, 그리고 아무도 눈치채기 전에 대시보드를 조용히 무효화시키는 데이터 품질 문제들.
- 1.6 엔지니어링 메트릭을 위한 통계적 소양: 팀이 메트릭을 정직하게 읽어내기 위해 필요한 최소한의 통계적 판단력: 평균 대 백분위수, 표본 크기, 평균으로의 회귀, 그리고 교란 변수.
이 주제들이 서로 연결되는 방식
이 여섯 개 주제는 엄격한 순서로 쌓인다. 주제 1.1은 애초에 왜 측정해야 하는지 묻는데, 이 질문에 답하지 못한 팀은 아무도 행동으로 옮기지 않는 수치를 수집하게 되기 때문에 중요하다. 주제 1.2는 이 책의 나머지 전체가 그 위에서 회전하는 축이다. 어떤 측정 지표든 목표가 되어 게임당할 수 있다는 것을 일단 받아들이면, 이후의 모든 주제의 권고 사항은 그 위험에 맞서 설계하는 데서 비롯된다. 주제 1.3은 그 경계심을 긍정적인 규칙으로 바꾼다: 결과 쪽으로 더 무겁게 평가하라, 결과가 값싸게 게임하기 가장 어려운 범주이기 때문이다. 주제 1.4는 거버넌스를 구체화하고, 주제 1.5는 데이터를 구체화하며, 주제 1.6은 거버넌스와 계측이 견고해진 후에도 잡음에 속지 않기 위한 통계적 판단력을 제공한다.
이후 모든 내용은 이 부에 의존한다. 2부의 흐름 메트릭과 DORA 메트릭, 그리고 3부의 SPACE 프레임워크는 사실상 모두 주제 1.2와 주제 1.3에서 제시된 결과 가중치 부여 및 가드레일 짝짓기 원칙의 실제 적용 사례다. 주제 8.1의 대시보드 설계 지침은 주제 1.4의 거버넌스 모델을 전제로 한다. 그리고 이 책의 모든 주제를 마무리하는 성숙도 모델은, 그 다섯 단계 아래 깔려 있는 것이 바로 이 부가 소개하는 규율, 즉 진심으로 측정하고 자신의 작업을 스스로 점검하는 규율에 대한 성숙도 모델이다.