데이터셋 사용 시점
- 회귀 테스트 — 모든 배포가 데이터셋 실행, 사용자보다 먼저 회귀 잡음.
- 시뮬레이션 — 제안된 개선이 프로덕션이 아닌 데이터셋에서 테스트.
- 벤치마킹 — Flow 버전·모델 선택·프롬프트 변형 비교.
- 커버리지 — Flow 가 다룰 입력 범위 처리하는지 확인.
데이터셋 종류
Golden set
손 큐레이션된 올바른 예. 작고 고품질.
Holdout
따로 둔 테스트 데이터 — 훈련/개선에 안 쓰고 평가에만.
회귀 스위트
이전 수정된 실패의 예. 회귀 방어.
프로덕션 샘플
프로덕션의 실제 트레이스 — 실제 트래픽 품질 확인.
구축 방법
데이터셋 만들기
프로덕션 트레이스·손 저작·임포트·클러스터에서.
예시 주석
기대 출력·루브릭·판정 라벨 추가.
커버리지와 버전
커버리지
예시가 프로덕션을 대표하나?
버전
데이터셋은 시간에 따라 변함 — 버전 추적.
데이터셋 라이프사이클
- 시드 — 10-30 예시의 작은 수동 세트.
- 성장 — 고쳐진 모든 클러스터의 실패 트레이스를 새 예시로 추가.
- 가지치기 — 더 이상 관련 없는 예시 은퇴 (사장된 기능, 오래된 케이스).
- 분할 — 커지면 아무것도 훈련 안 하고 평가만 하는 홀드아웃 유지.
데이터셋이 사는 곳
워크스페이스의 Reliable → Datasets 아래. 각 데이터셋이 표시:- 예시 카운트.
- 마지막 업데이트.
- 어느 Flow / 개선이 사용했는지.
- 커버리지 통계 (커버리지 참고).