> ## Documentation Index
> Fetch the complete documentation index at: https://docs.platform.nora.my/llms.txt
> Use this file to discover all available pages before exploring further.

# 데이터셋 개요

> 큐레이션된 예시 컬렉션 — 시뮬레이션·테스트·개선의 연료.

**데이터셋** 은 에이전트를 실행할 예시 컬렉션입니다. 각 예시는 입력 (질문, 작업, 페이로드) 과 기대 출력 (올바른 답, 또는 "이 중 아무거나 수용 가능", 또는 그냥 루브릭) 쌍.

데이터셋은 에이전트 품질을 객관적으로 측정하는 방법. 데이터셋 없으면 "변경이 도움 됐나" 는 감각. 있으면 숫자.

## 데이터셋 사용 시점

* **회귀 테스트** — 모든 배포가 데이터셋 실행, 사용자보다 먼저 회귀 잡음.
* **시뮬레이션** — 제안된 개선이 프로덕션이 아닌 데이터셋에서 테스트.
* **벤치마킹** — Flow 버전·모델 선택·프롬프트 변형 비교.
* **커버리지** — Flow 가 다룰 입력 범위 처리하는지 확인.

## 데이터셋 종류

<CardGroup cols={2}>
  <Card title="Golden set" icon="star">
    손 큐레이션된 올바른 예. 작고 고품질.
  </Card>

  <Card title="Holdout" icon="lock">
    따로 둔 테스트 데이터 — 훈련/개선에 안 쓰고 평가에만.
  </Card>

  <Card title="회귀 스위트" icon="shield">
    이전 수정된 실패의 예. 회귀 방어.
  </Card>

  <Card title="프로덕션 샘플" icon="chart-column">
    프로덕션의 실제 트레이스 — 실제 트래픽 품질 확인.
  </Card>
</CardGroup>

각각 목적이 다른 데이터셋일 뿐. Nora 는 별도 타입 강제 안 함 — 역할로 데이터셋 태그하면 적절히 쓰기 쉬움.

## 구축 방법

<CardGroup cols={2}>
  <Card title="데이터셋 만들기" icon="plus" href="/ko/reliable/datasets/create">
    프로덕션 트레이스·손 저작·임포트·클러스터에서.
  </Card>

  <Card title="예시 주석" icon="pen" href="/ko/reliable/datasets/annotate">
    기대 출력·루브릭·판정 라벨 추가.
  </Card>
</CardGroup>

## 커버리지와 버전

<CardGroup cols={2}>
  <Card title="커버리지" icon="chart-pie" href="/ko/reliable/datasets/coverage">
    예시가 프로덕션을 대표하나?
  </Card>

  <Card title="버전" icon="clock-rotate-left" href="/ko/reliable/datasets/versioning">
    데이터셋은 시간에 따라 변함 — 버전 추적.
  </Card>
</CardGroup>

## 데이터셋 라이프사이클

1. **시드** — 10-30 예시의 작은 수동 세트.
2. **성장** — 고쳐진 모든 클러스터의 실패 트레이스를 새 예시로 추가.
3. **가지치기** — 더 이상 관련 없는 예시 은퇴 (사장된 기능, 오래된 케이스).
4. **분할** — 커지면 아무것도 훈련 안 하고 평가만 하는 홀드아웃 유지.

건강한 Flow 는 주요 인텐트당 100-1000 예시. 성장은 유기적 — 개선 플로우가 클러스터 고칠 때마다 예시 추가.

## 데이터셋이 사는 곳

워크스페이스의 **Reliable → Datasets** 아래. 각 데이터셋이 표시:

* 예시 카운트.
* 마지막 업데이트.
* 어느 Flow / 개선이 사용했는지.
* 커버리지 통계 ([커버리지](/ko/reliable/datasets/coverage) 참고).
