6.0 6부 소개: 신뢰성, 운영, 보안 메트릭
2부는 변경이 커밋에서 프로덕션까지 가는 방법을 다루었다. 이 부는 그것이 일단 거기서 실행되고 나서, 팀이 완전히 통제할 수 없는 실제 조건 아래서 무기한으로, 무슨 일이 일어나는지를 다룬다. 신뢰성, 운영, 보안 메트릭은 소프트웨어 엔지니어링의 약속이 지속된 현실과 마주하는 곳이다: “이 배포가 성공했는가”가 아니라 “이 시스템이 밤마다, 부하 아래서, 공격 아래서, 그리고 다음 인시던트만이 아니라 몇 년 동안 지속 가능해야 하는 온콜 로테이션의 부담 아래서 계속 작동하는가.”
이 부의 네 주제는 의도적인 흐름을 따른다. 서비스 수준 지표와 목표(주제 6.1)는 이 부의 나머지 모든 것이 의존하는 용어와 목표 설정 규율을 확립한다. 인시던트 메트릭(주제 6.2)은 그 목표가 놓쳤을 때 무슨 일이 일어나는지 측정한다. 온콜과 용량 메트릭(주제 6.3)은 그 목표를 충족시키는 것을 유지하는 인간과 인프라 비용을 측정한다. 보안과 취약점 메트릭(주제 6.4)은 같은 신뢰성 규율을 구별되지만 밀접하게 관련된 위험으로 확장한다: “이것이 스스로 실패할 것인가”가 아니라 “누군가가 고의로 이것을 실패하게 만들 것인가.” 네 주제 모두 이 책의 핵심 규율을 공유한다: 메트릭에 이름을 붙이고, 그것이 어떻게 게임화되는지 이름을 붙이고, 그 게임화를 포착하는 가드레일과 짝을 지어라.
대규모 팀에게 이 부의 메트릭은 엔지니어링의 약속이 계약적이고, 정부 맥락에서는 때때로 법적인 것이 되는 곳이다. 엔터프라이즈 조직은 주제 6.1이 소개하는 메트릭에 맞서 서비스 수준 계약을 작성하며, 그것을 놓쳤을 때 실제 재무적 벌금이 따른다. 정부 조직은 신뢰성이나 보안 실패가 단일 회사의 대차대조표를 훨씬 넘어서는 결과를 가져오는 중요한 공공 인프라를 운영한다. 이 부는 그 무게를 내내 진지하게 다룬다.
이 부의 주제
- 6.1 서비스 수준 지표, 목표, 오류 예산: 사이트 신뢰성 엔지니어링 전체의 기초가 되는 용어와 목표 설정 규율, 그리고 오류 예산이 어떻게 신뢰성을 도달할 수 없는 절대치가 아니라 소비 가능하고 관리 가능한 자원으로 바꾸는지.
- 6.2 인시던트 메트릭: 감지, 대응, 복구: 조직이 실패를 얼마나 빨리 알아채고, 대응하고, 해결하는지 측정하는 것, 그리고 그 측정을 정직하게 유지하는 비난 없는 규율.
- 6.3 온콜, 용량, 운영 부담 메트릭: 신뢰성을 지속하는 인간과 인프라 비용, 그리고 지속 불가능한 온콜 부담이 결국 왜 그 자체로 신뢰성 문제로 나타나는지.
- 6.4 보안과 취약점 관리 메트릭: 발견부터 교정까지, 같은 규율적이고 가드레일이 짝지어진 접근법을 보안 위험으로 확장하기.
이 주제들이 어떻게 상호 연관되는가
주제 6.1은 이 부의 모든 후속 주제가 구축하는 기초를 설정한다: 명확한 서비스 수준 목표 없이는, “이 인시던트가 얼마나 나빴는가”(주제 6.2)와 “우리의 온콜 부담이 지속 가능한가”(주제 6.3)는 그것에 맞서 측정할 공유된 기준점이 없다. 주제 6.2의 인시던트 메트릭은, 실질적인 의미에서, 주제 6.1이 소개하는 오류 예산 지출의 기록이다. 주제 6.3은 그 지출을 예산 안에 유지하는 책임을 지는 인간 시스템의 지속 가능성을 측정한다. 그리고 주제 6.4는 같은 목표와 예산 사고를, 측정되지 않은 채로 두면 인시던트 후 반응적으로만 주의를 받는 경향이 있는 보안 태세에 적용한다.
이 부는 2부로 직접 다시 연결된다: DORA의 변경 실패율과 실패한 배포 복구 시간(둘 다 주제 2.10에서 다룸)은, 각각, 이 부의 인시던트 메트릭에 대한 선행 지표이자 그 인스턴스이다. 그것은 또한 8부로 앞서 연결되는데, 거기서 대시보드와 프로그램 성숙도 지침은 추상적인 목표(신뢰성, 보안)를 팀이 매일 실제로 관리할 수 있는 구체적이고 추적 가능하며 절대적이지 않은 목표로 바꾸는 실무 예시로서 이 부의 오류 예산 모델을 많이 끌어온다.