Dokumenten-Parsing: Unstructured, LlamaParse, Reducto, Docling, Azure Document Intelligence, AWS Textract
Chunking-Strategien: Semantisches Chunking, Late Chunking, layoutbewusst, kontextangereichert (Anthropic-Muster für kontextuelles Retrieval)
Embedding-Modelle: OpenAI text-embedding-3-large, Voyage voyage-3, Cohere Embed v3, BGE, Nomic, Jina v3, BM25 hybrid
Vektordatenbanken: Pinecone, Weaviate, Qdrant, Chroma, pgvector, MongoDB Atlas Vector Search, Turbopuffer
Hybrides Retrieval: BM25 + Dense + Reciprocal Rank Fusion, Query Expansion, HyDE, Multi-Query, Parent-Document-Retrieval
Reranker: Cohere Rerank 3, Voyage rerank-2, BGE reranker, Jina reranker, ColBERT v2 für hochpräzises Retrieval
Generierung: OpenAI (GPT-5-Familie), Anthropic Claude (Sonnet 4.5, Opus), Gemini, Open Source über Together / Groq / vLLM
Berechtigungsbewusstes Retrieval: ACL-Filter pro Dokument in der Vektor-DB, Berechtigungsprüfungen nach dem Retrieval, OAuth-basierter Quellenzugriff
Evals und Qualität: Ragas, TruLens, LangSmith, LangFuse, Promptfoo, Phoenix – automatisierte Bewertung von Retrieval- und Antwortqualität
Observability: LangFuse, Helicone, Sentry, OpenTelemetry – vollständiger Prompt- und Retrieval-Trace pro Anfrage
Deployment: AWS, Modal, Vercel, Cloudflare Workers, On-Prem (Air-Gap), Kubernetes