Skip to main content
데이터셋 은 에이전트를 실행할 예시 컬렉션입니다. 각 예시는 입력 (질문, 작업, 페이로드) 과 기대 출력 (올바른 답, 또는 “이 중 아무거나 수용 가능”, 또는 그냥 루브릭) 쌍. 데이터셋은 에이전트 품질을 객관적으로 측정하는 방법. 데이터셋 없으면 “변경이 도움 됐나” 는 감각. 있으면 숫자.

데이터셋 사용 시점

  • 회귀 테스트 — 모든 배포가 데이터셋 실행, 사용자보다 먼저 회귀 잡음.
  • 시뮬레이션 — 제안된 개선이 프로덕션이 아닌 데이터셋에서 테스트.
  • 벤치마킹 — Flow 버전·모델 선택·프롬프트 변형 비교.
  • 커버리지 — Flow 가 다룰 입력 범위 처리하는지 확인.

데이터셋 종류

Golden set

손 큐레이션된 올바른 예. 작고 고품질.

Holdout

따로 둔 테스트 데이터 — 훈련/개선에 안 쓰고 평가에만.

회귀 스위트

이전 수정된 실패의 예. 회귀 방어.

프로덕션 샘플

프로덕션의 실제 트레이스 — 실제 트래픽 품질 확인.
각각 목적이 다른 데이터셋일 뿐. Nora 는 별도 타입 강제 안 함 — 역할로 데이터셋 태그하면 적절히 쓰기 쉬움.

구축 방법

데이터셋 만들기

프로덕션 트레이스·손 저작·임포트·클러스터에서.

예시 주석

기대 출력·루브릭·판정 라벨 추가.

커버리지와 버전

커버리지

예시가 프로덕션을 대표하나?

버전

데이터셋은 시간에 따라 변함 — 버전 추적.

데이터셋 라이프사이클

  1. 시드 — 10-30 예시의 작은 수동 세트.
  2. 성장 — 고쳐진 모든 클러스터의 실패 트레이스를 새 예시로 추가.
  3. 가지치기 — 더 이상 관련 없는 예시 은퇴 (사장된 기능, 오래된 케이스).
  4. 분할 — 커지면 아무것도 훈련 안 하고 평가만 하는 홀드아웃 유지.
건강한 Flow 는 주요 인텐트당 100-1000 예시. 성장은 유기적 — 개선 플로우가 클러스터 고칠 때마다 예시 추가.

데이터셋이 사는 곳

워크스페이스의 Reliable → Datasets 아래. 각 데이터셋이 표시:
  • 예시 카운트.
  • 마지막 업데이트.
  • 어느 Flow / 개선이 사용했는지.
  • 커버리지 통계 (커버리지 참고).