비교 뷰
모든 데이터셋 예시에:- 왼쪽: 베이스라인 출력.
- 가운데: 타겟 출력.
- 오른쪽: 기대 출력.
- 판정:
improvement/regression/same/both failed.
- 개선 우선 — 타겟이 베이스라인 이긴 곳.
- 회귀 우선 — 타겟이 베이스라인이 처리한 것 깬 곳.
- Diff 점수 — 어느 방향으로든 가장 큰 변화.
요약 지표
상단:- 통과율 델타 — 타겟 통과율 - 베이스라인 통과율.
- 개선 — “타겟이 베이스라인 이김” 카운트.
- 회귀 — “타겟이 베이스라인보다 나쁨” 카운트.
- Wash — “같은 판정” 카운트.
- 비용 델타 — 타겟이 더 비싼가 저렴한가?
- 지연 델타 — 타겟이 더 느린가 빠른가?
회귀 드릴다운
회귀는 딜브레이커. View regressions 클릭으로 그 예시만 보기. 각 회귀에:- 베이스라인이 뭐라 했는지.
- 타겟이 이제 뭐라 하는지 (나빠짐).
- 왜 바뀌었나 — Nora 의 자동 트레이스 diff 가 어느 스텝이 갈라졌는지 표시.
- 새 프롬프트가 더 간결해 필수 면책 조항 드롭.
- 새 리트리벌 프리셋이 베이스라인이 의존한 소스 드롭.
- 모델 스왑이 엣지 동작 변경.
개선 드릴다운
개선에 대한 비슷한 뷰. 타겟이 왜 이겼는지 이해해 일반화 가능:- 변경이 타겟한 특정 패턴 때문이었나?
- 아니면 여러 예시를 넓게 올렸나?
통계적 유의성
< 50 예시 데이터셋은 Nora 가 “high variance — proceed with caution” 플래그 표시. 작은 샘플은 잡음을 시그널로 보기 쉬움.50 예시는 적절한 유의성 테스트 표시: 통과율 델타의 p-값, 신뢰 구간. 잡음 바닥 밖 델타만 신뢰.
귀속된 변경
개선 플로우가 모든 시뮬레이션에 타겟을 생성한 특정 제안 태깅. Before/after 가 그 태그 상속, 그래서 추적 가능:“Improvement #42 (리트리벌 프리셋 변경): +8% 통과율, +1 회귀, +0.02s 지연”무엇이 바뀌고 왜인지의 감사 트레일 구축에 좋음.