7.2

7.2 AI 지원 소프트웨어 개발 측정하기

개요 및 동기

주제 7.1은 여러 기존 메트릭이 AI 지원 개발 아래서 왜 더 이상 그것들이 전에 측정하던 것을 신뢰성 있게 측정하지 않는지 확립했다. 이 주제는 대신 무엇을 측정해야 하는지에 대한 것이다: 인상이나 벤더 마케팅이 아니라 실제 증거로, AI 코딩 지원이 당신의 조직에 실제로 도움이 되고 있는지, 그리고 얼마나 도움이 되는지 어떻게 아는가다. 이것은 실제 예산 결과를 가진 진정으로 중요한 질문이다. AI 도구 라이선스는 실제이고 지속적인 비용을 나타내며, 주제 5.4의 단위 경제성 규율이 직접 적용된다. 그것을 증거로 답할 수 없는 조직은 도움이 되지 않는 도구에 과도하게 지불하고 있거나 진정으로 도움이 되는 도구에 과소 투자하고 있는 것이다.

이 주제의 접근법은 이제 특별히 AI 도구 평가에 적용된 주제 1.3의 산출보다 결과 원칙을 직접 끌어온다. 가장 흔한 순진한 접근법은 AI 지원 개발을 산출량, 생성된 코드 줄 수, 수락된 제안, 개발자가 자가 보고한 작업당 절약된 시간으로 측정하는데, 이는 정확히 주제 7.1이 이 전환에 가장 노출되어 있다고 경고한 메트릭이다. 이 주제가 권장하는 더 엄격한 접근법은 결과를 측정한다: AI 지원이 품질을 저하시키지 않으면서 진정으로 주기 시간을 줄였는가, 진정으로 낮은 가치의 반복적인 작업에 소비되는 시간을 줄여 더 높은 가치의 작업을 위한 역량을 해방시켰는가, 그리고 5부의 비즈니스와 제품 결과에 측정 가능하게 영향을 미쳤는가.

대규모 팀에게 이 측정을 올바르게 하는 것은 AI 도구 투자 결정이 증거에 기반해 내려지는지 아니면 벤더 주장과 조직적 관성에 기반해 내려지는지를 결정한다. 대규모 AI 도구 계약을 협상하는 엔터프라이즈 조직은 지출을 정당화하고 경쟁 도구를 공정하게 비교하기 위해 진정한 가치 증거가 필요하다. 흔히 기술 지출에 대해 특별한 정밀 조사를 받는 정부 조직은 공공 자금을 대규모 AI 도구 채택에 전념하기 전에 엄격하고 방어 가능한 평가 방법론이 필요하다.

핵심 원칙

  • 산출량이나 벤더가 보고한 사용 통계가 아니라 결과로 AI 지원을 측정하라. 주제 1.3의 규율이 여기서 완전한 힘으로 적용된다.
  • 가능한 경우 진정한 비교 집단을 사용하라, 상승하는 업계 전반 기준선이 교란시킬 수 있는 전후 비교만이 아니다.
  • 자가 보고된 시간 절약은 그 자체로 약한 신호다. 그것을 객관적인 주기 시간과 품질 데이터와 짝지어라.
  • 생성 속도만이 아니라 리뷰와 수정 시간을 포함한 전체 비용을 측정하라.
  • 다른 작업과 다른 엔지니어는 매우 다른 AI 지원 가치를 볼 수 있다. 이 변동을 숨기는 단일하고 혼합된 조직 전체 숫자를 피하라.

권장 사항

전후 스냅샷만이 아니라 진정한 비교를 구축하라

가능한 경우, AI 지원 효과를 다른 모든 동시적 변경의 효과와 구별할 수 없는 자신의 조직의 전후 숫자만 비교하기보다(주제 1.6의 교란 변수 주의가 직접 적용된다), 같은 기간 동안 AI 지원을 사용하는 집단과 그것을 사용하지 않는 비교 가능한 집단 사이의 결과를 비교하라. 진정한 비교 집단이 비현실적인 경우, 최소한 평균으로의 회귀나 관련 없는 동시적 변경에 취약한 단일 전후 스냅샷이 아니라 더 긴 과거 기준선(주제 1.6에 따른 관리도)에 맞서 비교하라.

주기 시간과 품질을 함께 측정하고, 결코 AI 지원의 속도 주장만 측정하지 마라

주제 2.6과 주제 2.10의 규율을 직접 적용하라: AI 지원 작업이 주기 시간 단계를 더 빨리 통과하는지, 그리고 동시에 그 작업에 대한 변경 실패율이나 누락된 결함율(주제 5.1)이 잘못된 방향으로 움직이는지를 추적하라. 진정한 생산성 이득은 안정적이거나 개선된 품질과 함께 더 빠른 주기 시간을 보여 준다. 거짓된 이득은 악화되는 품질과 함께 더 빠른 주기 시간을 보여 주며, 이는 정확히 주제 7.1이 경고했던 거래이며, 여기서는 이 책이 내내 적용하는 같은 짝지어진 메트릭 규율을 통해 발견된다.

전체 비용 회계에 리뷰와 수정 시간을 포함하라

생성하기는 더 빠르지만 검토하기는 더 느린, 혹은 초기 생성 후 더 많은 수정과 재작업이 필요한 AI 생성 코드는, 전체 파이프라인이 측정되면 초기 코드 생성 단계가 개별 엔지니어에게 극적으로 더 빠르게 느껴졌더라도 순 주기 시간 개선을 보여 주지 않을 수 있다. 코딩 단계만이 아니라 전체 주기 시간 사슬(주제 2.6)을 측정하여, 느껴지지만 불완전한 속도 감각에 근거해 AI 지원에 공로를 돌리기보다 이것을 정직하게 포착하라.

자가 보고된 시간 절약을 결론이 아니라 시작 가설로 취급하라

“이것이 내게 한 시간을 절약해 주었다”는 개발자의 자가 보고는 초기 신호와 정성적 맥락으로 유용하지만(주제 5.3의 결합된 정량-정성 접근법이 여기에도 적용된다), 주제 1.5가 자가 보고된 데이터에 대해 경고하는 것과 같은 회상 및 바람직함 편향의 대상이며, 다운스트림 리뷰나 수정 비용에 대해서는 아무것도 말해 주지 않는다. 자가 보고를 사용해 AI 지원이 가장 도움이 되는 곳에 대한 가설을 만들어 내고, 확고한 결론을 내리기 전에 그 가설을 객관적인 주기 시간과 품질 데이터에 맞서 검증하라.

작업 유형별로 측정을 분할하고 단일하고 혼합된 숫자를 피하라

AI 코딩 지원은 아마도 진정으로 새롭고 복잡한 문제 해결보다 보일러플레이트적이고 잘 이해된 작업에 매우 다른 가치를 제공할 것이다. 단일하고 혼합된 조직 전체 평균이 아니라 작업 범주별로 측정하고 보고하라. 혼합된 숫자는 지원이 한 범주에서는 강한 가치를 제공하면서 다른 범주에서는 거의 가치가 없거나 심지어 부정적인 가치를 제공한다는 사실을 숨길 수 있으며, 이는 혼합된 숫자가 완전히 모호하게 만들 정보다.

트레이드오프: 장단점

접근법장점단점
자가 보고된 시간 절약만빠르고 수집하기 쉬움약한 신호; 편향에 취약함; 다운스트림 리뷰 비용을 무시함
전후 비교만설정하기 단순함다른 동시적 변경이나 업계 전반 추세에 의해 교란됨
진정한 비교 집단가장 강력하고 가장 방어 가능한 증거마련하기 더 어려움; 전면 채택 롤아웃에 비현실적일 수 있음
작업 분할 결과 측정가치가 진정으로 어디에 집중되는지 드러냄더 세분화된 추적과 분류 노력이 필요함

핵심 긴장은 측정 엄격함 대 실용적 실현 가능성이다. 진정하고 통제된 비교 집단은 가장 강력한 증거이지만, 통제 집단을 남겨 두지 않은 채 조직 전체에 도구가 롤아웃된 후에는 흔히 비현실적이다. 자가 보고된 인상은 빠르고 쉽지만 그 자체로는 약하다. 가능하다면 초기 시범 단계 중의 진정한 통제 집단, 그렇지 않다면 과거 기준선 관리도 등 실제 롤아웃이 허용하는 가장 강력한 비교 설계를 사용하고, 어떤 비교 설계를 사용하든 자가 보고를 최종 결론이 아니라 가설 생성 도구로 취급함으로써 긴장을 해결하라.

팀과 논의할 질문

  1. 우리는 AI 도구 채택을 평가하기 위한 진정한 비교 집단을 가지고 있거나 여전히 구축할 수 있는가, 아니면 전적으로 전후 비교에 의존하고 있는가? 진정한 비교 집단이 결코 확립된 적이 없다면, 과거 기준선 관리도가 여전히 합리적으로 엄격한 대안을 제공할 수 있는지 논의하라.

  2. 우리는 AI 지원 작업에 대해 주기 시간과 품질을 함께 측정했는가, 아니면 상응하는 품질 확인 없이 속도 주장만 가지고 있는가? 존재하는 데이터를 끌어와서 이 특정한 짝짓기를 확인하라. 그것이 존재하지 않는다면, 그 간극이 이 주제의 단일하고 최우선인 수정 사항이다.

  3. AI 지원 작업에 대한 우리의 주기 시간 측정은 리뷰와 수정 시간을 포함하는가, 아니면 초기 생성 단계만 포함하는가? 다운스트림 리뷰 비용을 무시하고 생성 시간에만 근거한 속도 주장은 이 주제가 직접 경고하는 불완전한 회계 함정의 위험이 있다.

  4. 우리가 수집한 자가 보고 시간 절약 주장은 무엇이며, 그중 어느 것이라도 객관적인 데이터에 맞서 검증했는가? 특정하고 흔히 반복되는 주장을 골라 객관적인 데이터가 실제로 그것을 뒷받침하는지 확인하라.

  5. 우리의 현재 측정은 모든 작업 유형을 하나의 숫자로 혼합하는가, 아니면 어떤 특정 작업 범주가 가장 강한 AI 지원 가치를 보이는지 아는가? 혼합되어 있다면, 작업 분할 세분이 현재 숫자가 숨기고 있는 무엇을 드러낼 수 있는지 논의하라.

  6. 오늘 회의적인 재무 이해관계자에게 인상이 아니라 증거를 사용해 우리의 AI 도구 투자를 방어해야 한다면, 우리는 실제로 그들에게 무엇을 보여 줄 수 있을까? 이 구체적인 테스트는 당신의 조직이 현재 AI 지원 가치에 대해 믿는 것과 증거로 실제로 입증할 수 있는 것 사이의 간극을 드러낸다.

분야별 관점

스타트업. 공식적인 비교 집단 연구는 보통 소규모에서는 비현실적이지만, 작업이 얼마나 빠르게 느껴지는지에만 순전히 의존하기보다 주기 시간과 결함율에 대한 단순하고 정직한 전후 살펴보기조차 인상만보다 의미 있게 더 신뢰할 수 있는 신호를 준다.

중소기업. 모든 종류의 작업에 걸친 포괄적인 평가를 시도하기보다, AI 지원 가치가 명확하고 측정 가능할 가능성이 가장 높은 가장 높은 가치의 가장 반복적인 작업 범주에 먼저 측정 노력을 집중하라.

엔터프라이즈. 전면적인 조직 전체 롤아웃 전 초기 시범 단계 중의 진정하고 통제된 비교는 흔히 여기서 달성 가능하며 마련하는 의도적인 노력을 기울일 가치가 있다. 그것이 일반적으로 성공적인 시범 운영 다음에 오는 대규모 도구 투자 결정에 대해 훨씬 더 방어 가능한 증거를 만들어 내기 때문이다.

정부. AI 도구 조달을 포함한 공공 기술 지출 결정은 흔히 특별한 정밀 조사에 직면하며 공식적인 비용 편익 정당화(주제 5.5)가 필요할 수 있다. 엄격하고 문서화된 평가 방법론이 결국의 자금 지원이나 조달 사례를 상당히 강화하기 때문에, 처음부터 모든 시범 단계에 이 주제가 권장하는 측정 규율을 구축하라.

사례

엔터프라이즈. 한 소프트웨어 회사는 의도적인 시범 운영으로 엔지니어링 팀의 절반에 AI 코딩 보조 도구를 롤아웃하고, 전면 롤아웃 전 한 분기 동안 나머지 절반을 비교 집단으로 유지했다. 시범 집단은 잘 정의되고 보일러플레이트가 많은 작업에 대해 진정하고 통계적으로 의미 있는 주기 시간 개선을 보였지만, 복잡하고 새로운 아키텍처 작업에 대해서는 측정 가능한 개선을 보이지 않았고 오히려 다소 상승한 리뷰 반복 수(주제 2.9)를 보였다. 진정한 비교 설계와 작업 범주 세분 덕분에만 보일 수 있었던 이 작업 분할 발견은 그 회사가 모든 작업에 걸친 균일한 생산성 향상으로 제시하기보다, AI 지원이 입증 가능하게 도움이 되었던 작업 범주를 향해 AI 지원 롤아웃 메시지와 교육을 특별히 표적으로 삼도록 이끌었다.

정부. 현대화 프로그램 팀의 일부에 대해 AI 코딩 지원을 시범 운영하는 한 연방 기관은 처음에는 열정적이고 균일하게 긍정적인 응답을 보인 자가 보고된 시간 절약 설문에 의존했다. 비슷한 시스템 구성 요소에서 작업하는 시범 팀과 비교 가능한 비시범 코호트 사이의 주기 시간과 누락된 결함율을 비교하는 후속 객관적 분석은, 객관적인 주기 시간 개선이 실재했지만 자가 보고된 추정치가 시사했던 것보다 현저하게 더 작았다는 것을 발견했고, 생성 속도 이득의 일부를 상쇄하고 있었던 완만하지만 실재하는 리뷰 시간 증가를 확인했는데, 이는 자가 보고 데이터만으로는 완전히 놓쳤을 발견이었다. 이 더 정확하고 증거에 기반한 그림은 그 도구의 지속적이고 확장된 조달에 대한 더 겸손하고 더 방어 가능한 비즈니스 사례를 직접 알려 주었다.

비즈니스 사례: 동기, ROI, TCO

AI 지원 개발을 엄격하게 측정하는 수익은 자신 있고 증거에 기반한 투자 결정이다: AI 지원이 정확히 어디서 진정으로 도움이 되는지 아는 조직은 그곳에서 그것을 확장하는 데 투자할 수 있고 거의 가치를 제공하지 않는 작업 범주에서 라이선스에 과도하게 지불하는 것을 피할 수 있으며, 이는 정확히 위의 소프트웨어 회사 사례가 입증하는 작업 분할 통찰이다. 이것은 주제 5.4의 단위 경제성과 주제 5.5의 ROI 규율에 직접 연결되는데, 흔히 좌석당 라이선스가 부여되는 AI 도구 비용은 이 책이 다른 모든 주요 엔지니어링 투자에 적용하는 것과 같은 엄격한 비용 편익 취급이 필요하기 때문이다.

총 소유 비용은 진정한 비교를 구축하고, 리뷰와 수정을 포함한 전체 주기 시간을 측정하고, 작업 유형별로 분할하는 분석 노력이며, 이는 벤더가 보고한 사용 통계나 자가 보고된 인상을 액면 그대로 받아들이는 것보다 더 많은 작업이다. 그 노력은 큰 조직 전반에 걸친 AI 도구 라이선스 비용의 규모와 데이터가 아니라 인상에 근거한 증거가 부족하고 비싼 조직 전체 헌신의 위험으로 직접 정당화된다.

안티패턴과 함정

  • 산출량이나 벤더 사용 통계만으로 AI 지원 측정하기: 주제 7.1의 핵심 경고를 직접 반복한다.
  • 전적으로 자가 보고된 시간 절약에 의존하기: 편향에 취약하고 다운스트림 리뷰 및 수정 비용에 맹목적인 약한 신호다.
  • 생성 속도 단계만 측정하고 전체 주기 시간을 무시하기: 실제 생산성 효과에 대한 불완전하고 잠재적으로 오도하는 회계를 만들어 낸다.
  • 단일하고 혼합된 조직 전체 숫자 보고하기: 다른 작업 범주에 걸친 가치의 실제 변동을 숨긴다.
  • 비교 집단이나 과거 기준선 없음: AI 지원의 실제 효과를 다른 모든 동시적 변경과 구별할 수 없다.
  • 열정적인 자가 보고 설문 결과를 대규모 투자 결정에 충분한 증거로 취급하기: 위의 연방 기관 사례가 더 엄격한 비교를 구축한 후에야 발견한 바로 그 간극의 위험이 있다.

성숙도 모델

  • 1단계, 시작: AI 지원 개발 가치가 평가된다면 오직 자가 보고된 인상과 벤더 사용 통계만을 통해 평가된다.
  • 2단계, 개발: 일부 주기 시간이나 품질 데이터가 존재하지만, 진정한 비교 집단이나 과거 기준선이 없고 작업 분할 분석도 없다.
  • 3단계, 표준화: 짝지어진 주기 시간과 품질 측정을 가진 진정한 비교 설계(통제 집단 또는 과거 기준선)가 작업 유형별로 분할되어 일관되게 적용된다.
  • 4단계, 관리: 리뷰와 수정 시간을 포함한 전체 주기 시간 회계가 추적되며, 자가 보고된 주장이 객관적인 데이터에 맞서 체계적으로 검증된다.
  • 5단계, 조율: 조직은 AI 지원이 정확히 어디서 진정으로 도움이 되는지에 대한 성숙하고 증거에 기반한 이해를 가지고 있으며, 입증되고 방어 가능한 ROI로 표적 롤아웃, 교육 투자, 조달 결정을 알린다.

논의를 위한 아이디어

  1. 우리의 현재 AI 도구 채택에 대해 우리는 어떤 진정한 비교를, 있다면, 가지고 있는가?
  2. 우리는 주기 시간과 품질을 함께 측정했는가, 아니면 속도 주장만 측정했는가?
  3. 우리는 어떤 자가 보고된 AI 지원 주장을 객관적인 데이터에 맞서 검증해야 하는가?
  4. 어떤 특정 작업 범주가 우리에게 진정한 AI 지원 가치의 가장 강한 증거를 보이는가?
  5. 우리는 현재 회의적인 재무 이해관계자에게 증거로 우리의 AI 도구 투자를 방어할 수 있을까?

핵심 요약

  • 산출량이나 벤더가 보고한 사용 통계가 아니라 결과로 AI 지원 개발을 측정하라.
  • 교란에 취약한 전후 스냅샷만이 아니라 진정한 비교 집단이나 과거 기준선을 사용하라.
  • 생성 속도만이 아니라 전체 파이프라인, 리뷰와 수정 시간을 포함해 주기 시간과 품질을 함께 측정하라.
  • 자가 보고된 시간 절약을 결론이 아니라 가설로 취급하고 객관적인 데이터에 맞서 검증하라.
  • 작업 유형별로 분할하라. 단일하고 혼합된 숫자는 가치가 진정으로 어디에 집중되고 어디에 집중되지 않는지를 숨긴다.

참고 문헌 및 추가 자료

  • Accelerate: The Science of Lean Software and DevOps, by Nicole Forsgren, Jez Humble, and Gene Kim.
  • GitHub’s research on AI pair programming and developer productivity.
  • Forsgren, Nicole, Margaret-Anne Storey, Chandra Maddila, Thomas Zimmermann, Brian Houck, and Jenna Butler, “The SPACE of Developer Productivity,” ACM Queue (2021).
  • How to Measure Anything, by Douglas W. Hubbard.