Embedding Pipeline
The embedding pipeline transforms raw files into searchable vectors through a 7-step process. Each step can be customized with pluggable strategies while maintaining sensible defaults.
Pipeline Overview
Opinionated Pipeline Defaults:
- Document Loader:
aktorAzureDocumentIntelligenceLoaderStrategy- Advanced document parsing with layout analysis - Chunking:
aktorMarkdownChunkingStrategy- Semantic chunking based on markdown structure - Other Steps: Use standard default strategies for text cleaning, metadata enrichment, embedding generation, and post-processing