무슨 일

Hamel Husain과 Shreya Shankar가 Lenny’s에 올린 고급 이밸 가이드입니다. 50곳 넘는 AI 제품 경험에서, 대부분 팀이 오류 발견(error discovery)을 건너뛰고 지표부터 만들어 “잘못된 실패”를 측정한다고 지적합니다.

워크플로

핵심은 criteria drift를 인정하는 인간-인-더-루프입니다. 다양한 프로덕션 트레이스를 먼저 리뷰·주석한 뒤, 코딩 에이전트가 active learning으로 주석을 확장하게 합니다. npx skills로 설치하는 evals-skills 플러그인이 데이터 스키마에 맞춘 리뷰 앱을 만들고 error-discovery로 라우팅합니다.

사례

Shopify·Cursor·Ramp·Harvey 등에서 이밸 투자가 품질·비용에 미친 영향을 인용합니다. “이밸이 새 PRD”라는 업계 담론을, 실행 가능한 30분 워크플로로 구체화한 글입니다.

왜 지금

에이전트 제품이 사람보다 빨리 바뀌는 국면에서, 측정 전에 “무엇을 실패로 볼지”를 찾는 단계를 PM·엔지니어 공통 플레이북으로 고정합니다.