Skip to main content
타겟 없는 예시는 그냥 질문. 품질 측정하려면 각 예시가 Agent 답변을 채점할 어떤 방법 필요. Nora 는 여러 주석 스타일 지원 — 도메인에 맞는 것 선택.

주석 종류

정확 매치

Agent 답변이 기대 출력과 정확히 같을 때만 통과. 구조화 출력 (JSON, enum, ID) 에만 유용.

퍼지 매치

임계값 이상 유사도 (편집 거리·시맨틱 유사도·혼합) 일 때 통과. 표현 유연성 OK 인 짧은 사실 답변에 좋음.

루브릭

Agent 답변이 채점되는 체크리스트:
루브릭은 판사 모델로 채점. 텍스트 답변에 저렴하고 신뢰할 만.

참조 답변 + 판사

“좋은” 예시 답변 제공. 판사 모델이 Agent 답변을 참조와 비교하고 충실도·완전성·정확성 점수. 정확 매치가 너무 엄격하고 전체 루브릭이 너무 많은 작업일 때 좋은 중간.

커스텀 판사 (코드)

Agent 답변 받아 점수 + 판정 반환하는 작은 JS/Python 함수 작성. 완전 통제 — 채점이 도메인 로직 관련될 때 유용 (예: “답변의 SQL 이 기대와 같은 로우 생성해야”).

어느 것 언제 사용

  • 구조화 출력 (함수 호출, JSON) — 구조화 필드에 정확·퍼지 매치.
  • 짧은 사실 (“반품 정책이 뭐”) — 퍼지 매치나 참조 + 판사.
  • 긴 텍스트 (설명, 요약) — 루브릭.
  • 도메인 특화 (SQL, 코드, 계산) — 커스텀 판사.
한 데이터셋 안에서 섞을 수 있음 — 다른 예시가 다른 주석 타입.

다중 주석자 합의

주석이 주관적인 데이터셋은 여러 주석자 추가. 데이터셋 뷰어가 합의 통계 표시 — 불합의 높은 예시는 재방문 가치. Nora 는 합의 강제 안 함. 모든 주석 표시하고 시뮬레이션이 어느 주석자 판정을 쓸지 선택하게 함.

주석 추가

예시별 주석 에디터. 또는 벌크 주석:
  • 하위집합으로 필터 (태그·점수·“미주석”).
  • 모두에 같은 루브릭이나 참조 적용.
  • 필요하면 개별 리뷰.

피드백에서 주석

시그널이 텍스트 교정 포함하면, 데이터셋에 저장할 때 교정이 기대 출력에 자동 채워짐. 기존 피드백 있는 것의 주석 스텝 절약.

주석 리뷰

리뷰 중인 데이터셋 표시:
  • Unannotated — 타겟 없는 예시. 시뮬레이션에서 채점 안 됨.
  • Needs review — 피드백에서 자동 채워짐, 사람이 검증해야.
  • Ready — 사람 주석되고 확인됨.
시뮬레이션은 기본으로 ready 예시만 채점. 더 넓은 테스트 원하면 needs review 포함 토글.

나중 편집

주석은 버전 관리됨. 편집하면 새 버전 생성; 시뮬레이션 결과는 쓴 주석 버전에 고정. 그래서 주석이 진화해도 옛 시뮬레이션 결과가 유효 유지.