Skip to main content
Enrich 스테이지는 청크가 리트리벌에 쓰일 메타데이터를 얻는 곳입니다. 이 스테이지의 블록은 추가형 — 각각 새 필드를 붙임.

강화 블록

Embed

각 청크의 텍스트를 밀집 벡터로 변환. 데이터에 맞는 임베딩 제공자 선택 (비영어는 다국어, 큰 청크는 긴 컨텍스트, 비용은 작은 차원). 픽커가 차원·컨텍스트 윈도우·1k 토큰당 비용을 보여줘 비교 가능. 임베딩이 시맨틱 검색을 가능하게 함 — 공간에서 더 가까운 벡터가 서로 더 관련. 모든 청크는 Output 스토어에 쓰인 vector 필드를 얻음.

자동 태그 (LLM)

작은 모델에게 각 청크를 태깅하라고 요청. 가능한 태그 목록과 짧은 지시 제공. 흔한 용도:
  • Domain: billing, auth, pricing, security
  • Audience: internal, customer, developer
  • Content type: how-to, reference, troubleshooting
태그는 필터 가능한 메타데이터가 됨. 필터 참고.

엔티티 추출

명명 엔티티 탐지·정규화:
  • 사람, 조직, 위치.
  • 제품, SKU, 프로젝트 코드.
  • 날짜와 기간.
  • regex 또는 작은 분류기로 커스텀 엔티티.
탐지된 각 엔티티는 검색 가능 필드로 추가됨. “Acme Corp 언급된 모든 청크 보여줘” 같은 검색-리트리벌 쿼리에 좋음.

언어 감지

청크의 언어를 감지하고 메타데이터 필드로 씀. Agent 별 언어 필터 활성화.

요약 생성기

각 청크에 한 단락 요약 추가. 리트리벌은 전체 청크 외에 요약으로도 검색 가능 — 짧고 키워드 많은 쿼리에 리콜이 더 나을 수 있음.

감성 / 유해성

감성 점수와 유해성 플래그 추가. 지식에 고객 메시지가 포함되고 감정 시그널로 필터·라우팅하고 싶을 때 유용.

커스텀 강화기 (인라인)

JS/Python 인라인 함수. 청크를 받아 붙일 추가 메타데이터 반환. 자체 스코어링 서비스 호출에 좋음.

비용 관리

강화는 비용이 쌓이는 곳 — 모든 LLM 호출, 모든 임베딩. 두 레버:
  • Batch size — 임베딩 API 는 배치가 훨씬 저렴. 기본 100.
  • Skip if unchanged — 기본 켜짐. 같은 콘텐츠 해시의 청크는 파이프라인 재실행에도 재강화되지 않음.
실행 로그가 블록별 강화 비용을 보여줌.

순서

강화기는 배선 순서대로 실행. 일부 강화기는 이전 것의 출력을 소비할 수 있음 — 예: 추출된 엔티티를 하류 태그 분류기의 입력으로. 의존성이 없으면 블록은 속도를 위해 자동 병렬 실행.

Enrich 가 하지 않는 것

강화 블록은 청크 텍스트 자체를 수정하지 않음 — 메타데이터만 추가. 텍스트를 바꿔야 하면 (번역, 본문으로 요약) Normalize 에서 커스텀 변환으로 하세요.