강화 블록
Embed
각 청크의 텍스트를 밀집 벡터로 변환. 데이터에 맞는 임베딩 제공자 선택 (비영어는 다국어, 큰 청크는 긴 컨텍스트, 비용은 작은 차원). 픽커가 차원·컨텍스트 윈도우·1k 토큰당 비용을 보여줘 비교 가능. 임베딩이 시맨틱 검색을 가능하게 함 — 공간에서 더 가까운 벡터가 서로 더 관련. 모든 청크는 Output 스토어에 쓰인vector 필드를 얻음.
자동 태그 (LLM)
작은 모델에게 각 청크를 태깅하라고 요청. 가능한 태그 목록과 짧은 지시 제공. 흔한 용도:- Domain:
billing,auth,pricing,security - Audience:
internal,customer,developer - Content type:
how-to,reference,troubleshooting
엔티티 추출
명명 엔티티 탐지·정규화:- 사람, 조직, 위치.
- 제품, SKU, 프로젝트 코드.
- 날짜와 기간.
- regex 또는 작은 분류기로 커스텀 엔티티.
언어 감지
청크의 언어를 감지하고 메타데이터 필드로 씀. Agent 별 언어 필터 활성화.요약 생성기
각 청크에 한 단락 요약 추가. 리트리벌은 전체 청크 외에 요약으로도 검색 가능 — 짧고 키워드 많은 쿼리에 리콜이 더 나을 수 있음.감성 / 유해성
감성 점수와 유해성 플래그 추가. 지식에 고객 메시지가 포함되고 감정 시그널로 필터·라우팅하고 싶을 때 유용.커스텀 강화기 (인라인)
JS/Python 인라인 함수. 청크를 받아 붙일 추가 메타데이터 반환. 자체 스코어링 서비스 호출에 좋음.비용 관리
강화는 비용이 쌓이는 곳 — 모든 LLM 호출, 모든 임베딩. 두 레버:- Batch size — 임베딩 API 는 배치가 훨씬 저렴. 기본 100.
- Skip if unchanged — 기본 켜짐. 같은 콘텐츠 해시의 청크는 파이프라인 재실행에도 재강화되지 않음.