커버리지 뷰
Datasets → Coverage 탭. 두 투영 표시:- 데이터셋에 있는 것 — 기능 (인텐트, 태그, 엔티티, 난이도) 에 걸친 예시 분포.
- 프로덕션에 있는 것 — 실제 트레이스에서 같은 분포.
자동 계산 차원
Nora 가 데이터셋과 프로덕션 트레이스 둘 다 (임베딩 사용) 주제 클러스터로 그룹화한 다음 양쪽 밀도 표시. 흔한 패턴:- 과소 대표 클러스터 — 프로덕션이 “환불” 에 30% 트래픽인데 데이터셋은 5%. 환불 예시 추가.
- 과대 대표 클러스터 — 데이터셋이 “인사” 20% 인데 프로덕션은 1%. 가지치기나 재가중.
- 누락 클러스터 — 프로덕션이 “결제 분쟁” 10% 인데 데이터셋은 0. 완전 갭.
차원 추가
커스텀 차원 따라 커버 가능:- Difficulty — 쉬운 것으로 시드했으면 어려운 케이스가 과소 대표될 수 있음.
- Language — 프로덕션의 30% 가 한국어인데 데이터셋은 전부 영어.
- User tier — enterprise 사용자가 free 사용자와 다른 동작 테스트.
갭 채우기
커버리지 뷰가 추가할 특정 트레이스 제안:- 데이터셋에 과소 대표된 프로덕션 클러스터 식별.
- 각 클러스터에서 대표 트레이스 선택.
- 원클릭 시드용 Add to dataset 제공.
커버리지 비율
단일 숫자: 커버리지 비율 = 1 - (데이터셋이 설명하는 프로덕션 엔트로피). 1.0 = 완벽 커버리지; 0.5 = 프로덕션 다양성 절반 캡처; 0.0 = 데이터셋이 프로덕션을 전혀 대표 안 함. 프로덕션 품질 게이트에 쓰는 데이터셋은 > 0.7 목표. 0.5 아래 = 시뮬레이션이 주는 숫자가 거의 의미 없음.커버리지가 상관없을 때
일부 데이터셋은 커버리지 필요 없음 — 특별히 좁음:- 회귀 스위트 — 고쳐진 패턴 을 커버해야지 모든 프로덕션 아님. 커버리지가 의도적으로 낮음.
- 기능 집중 테스트 — “환불 플로우” 테스트가 “로그인 플로우” 커버리지 필요 없음.
narrow 태그로 커버리지 경고 억제.
시간에 걸친 커버리지
트렌드 차트: 최근 N 개월의 커버리지 비율. 평평하거나 상승 유지해야 함. 하락 커버리지는 프로덕션이 드리프트하고 데이터셋이 정적으로 남았다는 뜻 — 새로고침 시간.자동 커버리지 새로고침
Coverage refresh 켜서 Nora 가 커버리지 갭 기반으로 새 프로덕션 트레이스를 주간 자동 샘플. 추가된 모든 예시가 주석용needs review 로 표시 — 커버리지가 채워지지만 기대 출력은 여러분이 결정.
수동 데이터셋 큐레이션보다 프로덕션이 빠르게 진화하는 장기 Flow 에 유용.