주석 종류
정확 매치
Agent 답변이 기대 출력과 정확히 같을 때만 통과. 구조화 출력 (JSON, enum, ID) 에만 유용.퍼지 매치
임계값 이상 유사도 (편집 거리·시맨틱 유사도·혼합) 일 때 통과. 표현 유연성 OK 인 짧은 사실 답변에 좋음.루브릭
Agent 답변이 채점되는 체크리스트:참조 답변 + 판사
“좋은” 예시 답변 제공. 판사 모델이 Agent 답변을 참조와 비교하고 충실도·완전성·정확성 점수. 정확 매치가 너무 엄격하고 전체 루브릭이 너무 많은 작업일 때 좋은 중간.커스텀 판사 (코드)
Agent 답변 받아 점수 + 판정 반환하는 작은 JS/Python 함수 작성. 완전 통제 — 채점이 도메인 로직 관련될 때 유용 (예: “답변의 SQL 이 기대와 같은 로우 생성해야”).어느 것 언제 사용
- 구조화 출력 (함수 호출, JSON) — 구조화 필드에 정확·퍼지 매치.
- 짧은 사실 (“반품 정책이 뭐”) — 퍼지 매치나 참조 + 판사.
- 긴 텍스트 (설명, 요약) — 루브릭.
- 도메인 특화 (SQL, 코드, 계산) — 커스텀 판사.
다중 주석자 합의
주석이 주관적인 데이터셋은 여러 주석자 추가. 데이터셋 뷰어가 합의 통계 표시 — 불합의 높은 예시는 재방문 가치. Nora 는 합의 강제 안 함. 모든 주석 표시하고 시뮬레이션이 어느 주석자 판정을 쓸지 선택하게 함.주석 추가
예시별 주석 에디터. 또는 벌크 주석:- 하위집합으로 필터 (태그·점수·“미주석”).
- 모두에 같은 루브릭이나 참조 적용.
- 필요하면 개별 리뷰.
피드백에서 주석
시그널이 텍스트 교정 포함하면, 데이터셋에 저장할 때 교정이 기대 출력에 자동 채워짐. 기존 피드백 있는 것의 주석 스텝 절약.주석 리뷰
리뷰 중인 데이터셋 표시:- Unannotated — 타겟 없는 예시. 시뮬레이션에서 채점 안 됨.
- Needs review — 피드백에서 자동 채워짐, 사람이 검증해야.
- Ready — 사람 주석되고 확인됨.
ready 예시만 채점. 더 넓은 테스트 원하면 needs review 포함 토글.