업로드 방법
드래그·드롭
문서 컬렉션 열기. 페이지 어디든 파일 드롭. 업로드는 백그라운드에서 실행 — 파일별 진행과 완료 상태 표시. 지원 포맷:- 텍스트:
.txt,.md,.mdx,.rst,.tex - 문서:
.pdf,.docx,.doc,.pages,.rtf - 웹:
.html,.htm - 데이터:
.csv,.tsv,.xlsx,.json - 프레젠테이션:
.pptx,.key - 이메일:
.eml,.msg - 코드:
.js,.ts,.py,.go,.rs,.java,.rb,.php,.cpp,.c,.sql
URL 붙여넣기
Import URL 클릭 후 링크 붙여넣기. Nora 가 fetch 하고 읽기 좋은 콘텐츠 추출 (내비·광고·쿠키 배너 드롭) 후 문서로 추가. 지원:- 공개 웹페이지 (readability 추출).
- 공개 Google Docs.
- 공개 Notion 페이지.
- 원시 파일 URL (응답의 파일 타입 사용).
CLI 에서
업로드 후
- 추출 — 파일에서 텍스트·표 끌어냄.
- 중복 제거 — 컬렉션에 대한 콘텐츠 해시 체크. 동일 업로드는 스킵.
- 청크 — 컬렉션의 기본 청커로 리트리벌 가능한 조각으로 분할.
- 강화 — 임베딩, 자동 태깅, 엔티티 추출.
- 인덱스 — 리트리벌 인덱스에 쓰임. 몇 초 안에 라이브.
uploading → extracting → chunking → indexing → ready.
컬렉션 기본값 설정
각 컬렉션은 기본 청커 설정과 기본 강화기를 가짐. Collection settings → Ingest defaults 에서 변경. 새 업로드는 현재 기본값 사용; 기존 청크는 Reprocess 를 누르지 않는 한 재처리되지 않음.메타데이터
업로드 중 메타데이터 추가:- Tags — 자유 형식 또는 워크스페이스 태그 팔레트에서.
- Folder — 컬렉션 안에서 정리.
- Source URL — 문서가 원래 산 곳. 인용으로 표시.
- 커스텀 필드 — 워크스페이스에서 정의한 필드.
벌크 업로드
100 개 이상 파일은 CLI 또는 Foundry 파이프라인. 웹 업로드는 한 번에 수십 개까지 괜찮지만 그 이상은 느려짐.실패한 업로드
흔한 원인:- 암호화된 PDF — Nora 가 텍스트 추출 못 함. 먼저 해독.
- 이미지 전용 PDF — 컬렉션 설정에서 OCR 활성화 (지연 추가, 작은 비용).
- 100 MB 넘는 파일 — 분할 또는 파이프라인 사용.
- 손상된 파일 — 추출기가 한 번 재시도 후 실패. 파일을 깔끔하게 재익스포트.