1.2 굿하트의 법칙과 메트릭의 심리학
개요 및 동기
경제학자 찰스 굿하트의 이름을 딴 굿하트의 법칙은 보통 이렇게 서술된다: 측정 지표가 목표가 되는 순간, 그것은 좋은 측정 지표이기를 멈춘다. 굿하트의 1975년 원래 관찰은 통화 정책에 관한 것이었지만, 인류학자 마릴린 스트래던의 이후의 재서술이야말로 소프트웨어 팀이 실제로 필요로 하는 버전이며, 이 책 전체가 세워진 문장이다. 이후 모든 주제에 등장하는 모든 메트릭, 배포 빈도, 테스트 커버리지, 만족도 점수는 이 위험을 지니며, 이 책의 모든 권장 사항은 어떤 형태로든 그것을 관리하기 위한 전략이다.
그 메커니즘은 신비로운 것이 아니다. 사람들은 유인에 반응하며, 보상이나 평가, 평판에 결부된 메트릭은 누군가 그렇게 의도했든 아니든 하나의 유인이다. 일단 어떤 팀이 “배포 빈도”가 감시되고 있다는 것을 알게 되면, 그 수치를 움직이는 가장 값싼 방법이 항상 의도된 방법인 것은 아니다: 의미 있는 변경 하나를 다섯 번의 사소한 배포로 쪼개면, 수치는 올라가지만 실제로 개선된 것은 아무것도 없다. 이것은 나쁜 행위자에 관한 이야기가 아니다. 평범하고 선의를 가진 엔지니어들도 잘못 설계된 유인에 대해 정확히 이런 식으로 반응하는데, 압박 아래서 행동을 형성하는 것은 의도가 아니라 유인 그 자체이기 때문이다.
대규모 조직에게는 판돈이 더 크다. 규모가 커질수록 메트릭 설계자와 그것이 행동을 형성하는 사람 사이의 거리가 멀어지기 때문이다. 자신의 여덟 명짜리 팀을 위해 메트릭을 만드는 팀 리더는 게임을 직접 지켜보다가 재빨리 경로를 수정할 수 있다. 육백 명 규모의 사업부에 걸쳐 도입되거나 입법부가 읽는 정부 성과 보고서에 실린 메트릭은 그 작성자를 결코 만난 적 없고 메트릭의 문구를 목표 그 자체로 취급할 온갖 이유를 가진 여러 계층의 사람들을 거쳐 이동한다. 그 왜곡은 거리에 비례해 복합적으로 커지며, 바로 그 때문에 이 책이 그 무게 중심을 나중의 주제가 아니라 바로 이 주제에 두는 것이다.
핵심 원칙
- 인센티브가 부여된 모든 메트릭은 게임당할 것이라고 가정하라. 왜곡이 발견된 후가 아니라 첫 버전부터 그것에 맞서 설계하라.
- 게임은 악의적인 것이 아니라 합리적인 것이다. 사람들은 당신이 만든 유인에 합리적으로 반응하고 있을 뿐이다. 그것을 사람 탓으로 돌리는 것은 아무것도 고치지 못한다.
- 메트릭 소유자로부터의 거리는 왜곡 위험을 높인다. 수치가 그 의도를 이해하는 사람으로부터 멀리 이동할수록, 그것은 정신이 아니라 문구가 된다.
- 비율과 범위는 원시 개수보다 게임에 더 잘 저항한다. 원시 개수는 물량을 보상하지만, 잘 선택된 비율은 당신이 실제로 원하는 행동을 보상한다.
- 인센티브가 부여된 메트릭에서 가드레일은 선택이 아니다. 보상을 결부시키는 모든 메트릭에는 절대 악화되어서는 안 되는 짝을 이루는 대응 메트릭이 필요하다.
권장 사항
모든 메트릭을 인센티브 노출도로 분류하라
어디에든 눈에 띄게 메트릭을 게시하기 전에 직접 물어보라: 이 수치가 특정 방향으로 움직이는 것에 누군가의 보상, 평가, 평판, 혹은 예산이 걸려 있는가? 그렇다면 그것은 인센티브가 부여된 메트릭이며 공개되기 전에 (아래의) 가드레일이 필요하다. 그렇지 않다면 그것은 진단적 메트릭(주제 1.1)이며 더 낮은 게임 위험을 지니지만, 결코 위험이 전혀 없는 것은 아니다. 사람들은 오늘 공식적인 인센티브가 붙어 있지 않더라도 나중에 그것으로 판단받을 것이라고 예상하는 것만으로도 수치를 형성할 수 있기 때문이다.
원시 개수보다 비율, 비, 코호트를 선호하라
“닫힌 티켓”과 같은 원시 개수는 저가치의 무언가를 더 많이 함으로써 게임할 수 있다. “첫 접촉에서 해결된 티켓의 비율”과 같은 비율은 물량이 아니라 근본적인 행동을 보상한다. 코호트, 즉 특정 주의 모든 배포처럼 공유된 시작점으로 정의된 그룹은 최근의 나쁜 추세가 좋게 보이는 장기 집계 안에 숨는 것을 막는다. 동일한 근본 행동을 포착하는 개수와 비율 중에서 선택해야 할 때는 언제나 비율을 선택하라.
인센티브가 부여된 모든 메트릭을 가드레일과 짝지어라
가드레일 메트릭은 주 메트릭이 개선되는 동안 절대 악화되어서는 안 되는 짝을 이루는 대응 메트릭이다. 배포 빈도는 변경 실패율과 짝을 이루고, 리드 타임은 결함 누락률과 짝을 이루며, 지원 팀의 처리 시간은 고객 만족도와 짝을 이룬다. 가드레일은 값싼 게임을 눈에 띄게 비싸게 만드는 요소다. 가드레일을 악화시켜 인센티브가 부여된 수치를 개선하는 팀은 운이 아니라 그 짝짓기에 의해 발각된다. 가드레일은 게임이 이미 발견된 후 뒤늦게 생각해 내는 것이 아니라 주 메트릭과 동시에 설계하라.
네 가지 고전적인 게임 패턴을 경계하라
굿하트의 법칙 아래서의 왜곡은 소수의 알아볼 수 있는 형태로 수렴하는 경향이 있다. 임계값 게임은 목표까지 바로 최적화하고 멈춘다(95% 테스트 커버리지 목표는 진정한 커버리지가 아니라 정확히 95%에 도달하기 위한 사소한 테스트를 낳는다). 정의 게임은 무슨 일이 일어났는지가 아니라 무엇이 집계되는지를 바꾼다(“해결됨”의 정의를 재정의해 어려운 사례를 제외한다). 타이밍 게임은 작업이 실제로 언제 일어났는지가 아니라 언제 기록되는지를 바꾼다(보고 기간이 끝나기 직전에 배포를 몰아넣는다). 대체 게임은 메트릭의 의도를 버리면서 문구는 충족한다(배포 빈도를 부풀리기 위해 하나의 실제 변경을 여러 사소한 변경으로 쪼갠다). 이러한 패턴에 명시적으로 이름을 붙여 팀과 공유하면, 그것이 당신 자신의 수치에 나타났을 때 훨씬 더 쉽게 알아챌 수 있다.
가능한 곳에서는 측정을 보상으로부터 분리하라
가장 강력한 가드레일은 구조적인 것이다: 메트릭을 개인 보상으로부터 분리하라. 순전히 시스템을 이해하기 위해 사용되며 어떤 사람의 급여나 평가, 지위도 그 방향에 걸려 있지 않은 메트릭은 평가에 결부된 메트릭보다 훨씬 약한 게임 압력을 받는다. 바로 이것이 주제 1.1의 진단-대-평가 구분이 실무에서 그토록 중요한 이유다: 메트릭을 진단용으로 유지하는 것은 흔히 사후에 적용하는 그 어떤 양의 가드레일 공학보다 더 저렴하고 효과적이다.
트레이드오프: 장단점
| 접근법 | 장점 | 단점 |
|---|---|---|
| 원시 개수 | 계산하고 설명하기 단순함 | 물량으로 매우 쉽게 게임됨 |
| 비율과 비 | 올바른 행동을 보상하고 물량 게임에 저항 | 줄어드는 분모 문제를 숨길 수 있음 |
| 가드레일 짝짓기 | 값싼 게임을 눈에 띄게 비싸게 만듦 | 정의, 소유, 유지해야 할 메트릭이 두 배가 됨 |
| 진단 전용 (개인 보상 없음) | 어떤 옵션보다도 가장 낮은 게임 압력 | 리더십이 당길 수 있는 직접적인 동기 부여 수단이 약함 |
| 강하게 인센티브화된 메트릭 | 강력하고 빠른 행동 반응 | 흔히 단 하나의 보고 주기 안에서도 높은 왜곡 위험 |
핵심 긴장은 동기 부여력 대 왜곡 위험이다. 보상에 수치를 직접 결부시켜 행동을 가장 빠르게 움직이는 메트릭이야말로 굿하트의 법칙에 가장 크게 노출된 메트릭이다. 값싸게 게임하기가 진정으로 어려운 결과 메트릭에만 강한 인센티브를 예약하고, 인센티브를 부여하는 무엇이든 첫 왜곡이 나타난 후 덧붙이는 것이 아니라 동시에 설계된 가드레일과 짝지음으로써 이 긴장을 해결하라.
팀과 논의할 질문
누군가의 보상이 걸려 있는 각 메트릭에 대해, 그것을 게임하는 가장 값싼 방법은 무엇이며, 오늘 우리가 그 게임을 잡아낼 수 있을까? 대시보드에 있는 인센티브가 부여된 모든 수치에 대해 앉아서 의도적으로 그 악용 방법을 설계해 보라: 합리적이고 선의를 가진 팀이라면 근본적인 작업을 하지 않고도 어떻게 이것을 좋아 보이게 만들까? 그 게임을 잡아낼 방법의 이름을 댈 수 없다면, 아직 그 메트릭에 인센티브를 부여할 준비가 되지 않은 것이다. 이 훈련은 불편하며, 그 불편함이 핵심이다.
우리의 현재 메트릭 중 어느 것이 아무도 지적하지 않은 채 네 가지 게임 패턴, 즉 임계값, 정의, 타이밍, 혹은 대체 게임 중 하나로 이미 표류했는가? 왜곡은 좀처럼 스스로를 알리지 않는다. 그것은 근본적인 불만, 장애, 혹은 고객 피드백이 다른 이야기를 전하는 동안 훌륭해 보이는 수치로 나타난다. 대시보드를 각 패턴의 이름에 비추어 훑고 일치하는 것에 대해 솔직해져라.
우리 대시보드의 모든 인센티브가 부여된 메트릭에 짝을 이루는 가드레일이 있으며, 그 가드레일은 메트릭과 동시에 설계되었는가? 게임이 발견된 후에야 추가된 가드레일은 설계 선택이 아니라 수리이며, 보통 신뢰에 대한 첫 손상을 막기에는 너무 늦게 도착한다. 인센티브가 부여된 메트릭에 대해 이 짝짓기를 구체적으로 감사하라.
이 메트릭은 그 의도를 이해하는 사람으로부터 그 행동을 형성하는 사람에게 도달하기까지 얼마나 멀리 이동하는가? 플랫폼 팀이 만들어 세 개의 관리 계층 떨어진 곳에서 소비되거나, 계측을 본 적 없는 사람들이 읽는 공개 보고서에 게시된 메트릭은 팀이 스스로를 위해 설계한 메트릭보다 문구-아닌-정신 게임에 훨씬 더 많이 노출된다. 가장 중요한 메트릭에 대해 그 거리를 지도로 그려 보라.
게임당하고 있다는 것을 발견한 후 메트릭에서 인센티브를 제거한 적이 있으며, 그것을 고치는 데 신뢰 측면에서 우리에게 어떤 비용이 들었는가? 조직은 흔히 한 분기 혹은 일 년 동안 왜곡된 행동을 겪은 후에야 굿하트의 법칙을 어려운 방식으로 발견하며, 수리 비용은 예방했을 경우보다 더 크다. 실제 사례가 있다면 가져와서, 조용히 넘어가는 대신 명시적으로 교훈을 추출하라.
게임이 잘못 설계된 인센티브에 대한 합리적인 반응이 아니라 개인의 성실성 문제라고 가정한 곳은 어디인가? 당신이 만든 인센티브에 예측 가능하게 반응한 개인을 탓하는 것은 좀처럼 아무것도 고치지 못하며 흔히 신뢰를 더 훼손한다. 떠올릴 수 있는 모든 게임 사건을 사람의 성격 문제가 아니라 메트릭의 설계 문제로 재구성하고, 어떤 재설계가 그것을 막았을지 물어보라.
분야별 관점
스타트업. 아주 작은 팀에서는 가장 빠른 가드레일은 직접적인 대화다: 모두가 수치를 볼 수 있고 즉시 “잠깐, 저게 왜 튀었지”라고 물을 수 있다. 진짜 위험은 창업자가 짝을 이루는 가드레일 없이 메트릭을 자금 조달 서사(무슨 수를 써서라도 성장)에 결부시키는 것인데, 외부 투자자가 바로 그런 종류의 멀고 높은 판돈의 압력을 가해 게임을 매력적으로 만들기 때문이다.
중소기업. 기성 도구는 흔히 개수(닫힌 티켓, 처리된 전화) 중심의 기본 대시보드를 제공하는데, 개수가 계산하기 쉽기 때문이다. 도구가 허용하는 곳마다 이를 적극적으로 비율로 전환하고, 먼저 가드레일을 식별하지 않은 채 어떤 단일 수치도 보너스나 평가에 결부시키려는 유혹을 물리쳐라.
엔터프라이즈. 거리가 지배적인 위험이다: 내부 진단을 위해 플랫폼 팀이 설계한 메트릭이 세 계층 후의 관리 단계에서 채택되어 그것을 만든 사람이라면 아무도 알아보지 못할 KPI로 바뀐다. 이것을 명시적으로 거버넌스하라(주제 1.4): 성과 평가나 임원 스코어카드에 사용되도록 승인되기 전에 문서화된 가드레일을 요구하라.
정부. 공개된 성과 지표는 이 책의 어떤 범주보다도 강한 게임 압력을 받는데, 놓친 목표가 예산이나 정치적 결과를 초래할 수 있기 때문이다. 수치뿐 아니라 정의 그 자체를 정해진 주기로 감사하라. 고전적인 공공 부문 게임 패턴은 근본적인 서비스를 개선하는 것이 아니라 누가 집계되는지를 조용히 재정의하는 것이기 때문이다(누가 대기 중인지 재분류함으로써 대기 목록이 “해결됨”이 된다).
사례
엔터프라이즈. 한 소매 기술 회사는 분기별 평가에 쓰이는 팀 단위 품질 점수에 결부된, 모든 서비스에 걸친 99% 자동화 테스트 커버리지 목표를 설정했다. 두 분기 만에 커버리지는 99%에 도달했고, 장애율은 올라갔다. 감사 결과, 팀들이 함수가 던지지 않고 반환한다는 것만 단언하는 사소한 테스트를 순전히 커버리지 도구를 만족시키기 위해 작성하고 있었으며, 진정한 경계 사례 테스트는 전혀 개선되지 않았다는 것이 드러났다. 해결책은 원시 커버리지 목표를 짝을 이루는 메트릭으로 대체했다: 테스트가 실제로 주입된 결함을 잡아내는지 측정하는 뮤테이션 테스트 점수(주제 4.2)를 결합한 커버리지였으며, 이는 값싸게 게임하기가 훨씬 더 어렵다.
정부. 한 주의 실업 보험 기관은 첫 지급까지의 중앙값 일수로 평가받았고, 이는 주 입법부에 게시되었다. 목표를 달성하라는 압박 아래, 한 지역 사무소는 처리하기 더 어려운 청구를 조용히 “불완전”으로 재분류하여 분모에서 제외하기 시작했고, 이는 일부 청구인이 보고서가 시사하는 것보다 훨씬 더 오래 기다리는 동안 게시된 중앙값을 훌륭하게 보이도록 만들었다. 수치뿐 아니라 정의 그 자체에 대한 독립적인 감사가 그 관행을 발견했다. 그 기관의 해결책은 정의를 고정하고, 제외 기준을 공개적으로 게시했으며, 재분류의 급증이 이제 숨겨지지 않고 보이도록 불완전 청구율 자체를 추적하는 가드레일 메트릭을 추가했다.
비즈니스 사례: 동기, ROI, TCO
굿하트의 법칙을 진지하게 받아들이는 것의 수익은 재작업을 피하는 것이다. 가드레일을 미리 설계하는 조직은 첫 메트릭과 함께 두 번째 메트릭을 정의하는 데 적당한 양의 추가 노력을 들인다. 이 단계를 건너뛰는 조직은 흔히 왜곡이 드러나기까지 온전한 한 분기 혹은 그 이상의 잘못된 방향으로 향한 노력을 소비한 다음, 게임당한 행동을 되돌리고 그 이후 수치에 대한 신뢰를 재건하는 훨씬 더 어려운 비용을 치른다. 위의 소매 사례가 전형적이다: 예방하기는 저렴하고, 수리하기는 비싸다.
가드레일의 총 소유 비용은 공짜가 아니다: 정의하고, 계측하고, 검토해야 할 두 번째 메트릭이다. 하지만 그 비용은 아무도 눈치채기 전에 몇 달 동안 조용히 잘못된 행동을 보상하는 인센티브의 무한한 비용에 비하면 작고 고정적이다. 이 주제 이후의 모든 주제는 이 트레이드오프를 반영하며, 이것이 가드레일 짝짓기가 이 책의 나머지 전체에 걸쳐 여기뿐 아니라 계속 권장 사항으로 등장하는 이유다.
안티패턴과 함정
- 가드레일 없이 인센티브가 부여된 메트릭을 게시하기: 이 책에서 왜곡된 대시보드의 가장 흔한 단일 근본 원인.
- 게임을 개인적 결함으로 취급하기: 잘못 설계된 인센티브에 대한 합리적인 반응을 이유로 개인을 탓하며 아무것도 고치지 못한다.
- 수치는 감사하지만 정의는 결코 감사하지 않기: 누가 집계되는지가 조용히 바뀌어서 메트릭이 괜찮아 보이는 고전적인 공공 부문 실패 양상.
- 진단으로 작동했던 메트릭이 평가적이 된 후에도 안전하게 유지될 것이라고 가정하기: 메트릭에 관한 다른 것이 전혀 바뀌지 않더라도, 보상이 붙는 순간 노출도가 바뀐다.
- 첫 게임 사건 이후에야 가드레일을 설계하기: 신뢰에 대한 손상이 이미 이루어진 후에야 도착하는 수리.
- 거리를 무시하기: 메트릭이 여러 관리 계층이나 공개 보고서만큼 설계자로부터 떨어져 이동한 후에도 여전히 설계자가 의도한 대로 읽힐 것이라고 가정하기.
성숙도 모델
- 1단계, 시작: 메트릭은 게임 위험에 대한 고려 없이 즉흥적으로 인센티브가 부여되며, 왜곡은 품질이나 신뢰가 눈에 띄게 손상된 후에야 발견된다.
- 2단계, 개발: 일부 팀은 사후에 게임을 인식하고 비공식적으로 조정하지만, 사전에 가드레일을 설계하는 일관된 관행은 없다.
- 3단계, 표준화: 조직 전체에서 인센티브가 부여된 모든 메트릭은 승인 전에 문서화된 가드레일을 요구하며, 네 가지 게임 패턴이 명명되고 교육된다.
- 4단계, 관리: 게임 위험이 능동적으로 모니터링된다: 정의는 정기적으로 감사되고, 가드레일 짝은 여전히 왜곡을 잡아내는지 검토되며, 게임 사건은 그 자체로 하나의 메트릭으로 추적된다.
- 5단계, 조율: 조직은 굿하트의 법칙을 새로운 메트릭이 제안될 때마다 자동으로 검토되는 상시적인 설계 제약으로 취급하며, 사후가 아니라 사전에 왜곡을 막은 구체적인 재설계 사례를 제시할 수 있다.
논의를 위한 아이디어
- 오늘날 우리 조직에서 가드레일이 없는 가장 중요한 메트릭은 무엇인가?
- 근본적인 현실은 나빠지는데 수치는 개선되는 것을 본 적이 있는가?
- 우리의 공개 메트릭 중 하나의 배후에 있는 정의가 조용히 바뀐다면 누가 알아챌 것인가?
- 네 가지 게임 패턴(임계값, 정의, 타이밍, 대체) 중 우리 조직이 가장 취약한 것은 무엇인가?
- 주요 메트릭이 일 년 동안 게임당해 왔다는 것을 발견한다면, 신뢰 측면에서 우리에게 어떤 비용이 들 것인가?
핵심 요약
- 굿하트의 법칙: 목표가 되는 측정 지표는 좋은 측정 지표이기를 멈추며, 이는 이 책의 모든 메트릭을 지배한다.
- 게임은 성격적 결함이 아니라 인센티브에 대한 합리적 반응이다. 사람이 아니라 인센티브 설계를 고쳐라.
- 동일한 행동을 포착하는 곳이라면 원시 개수보다 비율, 비, 코호트를 선호하라.
- 인센티브가 부여된 모든 메트릭에는 왜곡이 발견된 후 추가되는 것이 아니라 동시에 설계되는 가드레일이 필요하다.
- 네 가지 게임 패턴을 이름으로 경계하라: 임계값, 정의, 타이밍, 대체 게임.
- 메트릭 설계자와 그 행동이 형성되는 사람 사이의 거리는 왜곡 위험을 높인다. 가능한 곳에서는 그 거리를 짧게 유지하라.
참고 문헌 및 추가 자료
- Goodhart, C. A. E. “Problems of Monetary Management: The UK Experience.” 1975.
- Strathern, Marilyn. “‘Improving Ratings’: Audit in the British University System.” 1997.
- Scott, James C. Seeing Like a State: How Certain Schemes to Improve the Human Condition Have Failed. Yale University Press, 1998.
- Muller, Jerry Z. The Tyranny of Metrics. Princeton University Press, 2018.
- Croll, Alistair, and Benjamin Yoskovitz. Lean Analytics: Use Data to Build a Better Startup Faster. O’Reilly Media, 2013.
- U.S. Government Accountability Office (GAO): 성과 측정 및 GPRA 현대화법 관련 지침.