Skip to main content
시뮬레이션이 타겟이 어떻게 했는지 보여줌. Before/after베이스라인과 비교해서 어떻게 했는지. 중요한 숫자.

비교 뷰

모든 데이터셋 예시에:
  • 왼쪽: 베이스라인 출력.
  • 가운데: 타겟 출력.
  • 오른쪽: 기대 출력.
  • 판정: improvement / regression / same / both failed.
판정으로 정렬:
  • 개선 우선 — 타겟이 베이스라인 이긴 곳.
  • 회귀 우선 — 타겟이 베이스라인이 처리한 것 깬 곳.
  • Diff 점수 — 어느 방향으로든 가장 큰 변화.

요약 지표

상단:
  • 통과율 델타 — 타겟 통과율 - 베이스라인 통과율.
  • 개선 — “타겟이 베이스라인 이김” 카운트.
  • 회귀 — “타겟이 베이스라인보다 나쁨” 카운트.
  • Wash — “같은 판정” 카운트.
  • 비용 델타 — 타겟이 더 비싼가 저렴한가?
  • 지연 델타 — 타겟이 더 느린가 빠른가?
큰 개선, 작은 회귀, 사소한 비용 증가 → 출시 가능성. 큰 회귀 → 안 함.

회귀 드릴다운

회귀는 딜브레이커. View regressions 클릭으로 그 예시만 보기. 각 회귀에:
  • 베이스라인이 뭐라 했는지.
  • 타겟이 이제 뭐라 하는지 (나빠짐).
  • 왜 바뀌었나 — Nora 의 자동 트레이스 diff 가 어느 스텝이 갈라졌는지 표시.
흔한 원인:
  • 새 프롬프트가 더 간결해 필수 면책 조항 드롭.
  • 새 리트리벌 프리셋이 베이스라인이 의존한 소스 드롭.
  • 모델 스왑이 엣지 동작 변경.

개선 드릴다운

개선에 대한 비슷한 뷰. 타겟이 이겼는지 이해해 일반화 가능:
  • 변경이 타겟한 특정 패턴 때문이었나?
  • 아니면 여러 예시를 넓게 올렸나?
넓은 개선이 좁은 것보다 출시 안전.

통계적 유의성

< 50 예시 데이터셋은 Nora 가 “high variance — proceed with caution” 플래그 표시. 작은 샘플은 잡음을 시그널로 보기 쉬움.
50 예시는 적절한 유의성 테스트 표시: 통과율 델타의 p-값, 신뢰 구간. 잡음 바닥 밖 델타만 신뢰.

귀속된 변경

개선 플로우가 모든 시뮬레이션에 타겟을 생성한 특정 제안 태깅. Before/after 가 그 태그 상속, 그래서 추적 가능:
“Improvement #42 (리트리벌 프리셋 변경): +8% 통과율, +1 회귀, +0.02s 지연”
무엇이 바뀌고 왜인지의 감사 트레일 구축에 좋음.

다중 타겟 비교

한 번에 둘 이상 버전 비교. 비교에 최대 5 타겟 추가 — 뷰가 컬럼으로 확장. 세 모델 선택이나 세 프롬프트 변형 나란히 비교에 유용.

비교 공유

모든 시뮬레이션 비교가 퍼머링크 가짐. 출시 전 리뷰어와 공유. 같은 뷰 봄 — 데이터 추출 불필요. 승인자가 비교 뷰에서 직접 변경 승인 가능 (승인 참고).