
Teams im Gesundheitswesen, in der Finanzbranche und im Rechtsbereich wollen dieselbe KI-Unterstützung wie alle anderen. Sie möchten Fragen zu Richtlinien, Fallakten, Verträgen und Berichten stellen und in Sekunden eine Antwort mit Quellenangabe erhalten. Viele dürfen diese Dokumente aber nicht an einen öffentlichen KI-Dienst senden. An Patientenakten, Mandantenunterlagen und Finanzdaten hängen Verträge, Aufsichtsbehörden und der eigene Ruf.
Das Ergebnis ist oft ein stiller Stillstand. Mitarbeitenden wird gesagt, keine KI-Tools zu nutzen, oder sie nutzen sie trotzdem über private Konten. Beides ist nicht gut. Privates RAG bietet einen Mittelweg: den nützlichen Teil der KI, betrieben auf Infrastruktur, die Sie kontrollieren.
Was dieser Assistent leistet
Retrieval-Augmented Generation (RAG) bedeutet, dass das System zuerst Ihre Dokumente durchsucht und dann ein Sprachmodell nur auf Basis der gefundenen Textstellen antworten lässt. In einem privaten Setup gilt:
- Dokumente bleiben in Ihrer Umgebung. Index, Embedding-Modell und Sprachmodell laufen in Ihrem Cloud-Konto, in Ihrem Rechenzentrum oder auf einzelnen Laptops.
- Auch Fragen bleiben in Ihrer Umgebung. Prompts und Antworten werden nicht an einen öffentlichen KI-Dienst gesendet.
- Antworten nennen ihre Quellen und berücksichtigen die Dokumentberechtigungen jedes Nutzers.
- Alles wird protokolliert, in Ihrem eigenen Audit-System und nach Ihren eigenen Aufbewahrungsregeln.
Deployment-Optionen
„Privat“ umfasst eine Reihe von Möglichkeiten. Von der geringsten zur größten Kontrolle:
- Gehostete API unter Geschäftsbedingungen. Ein großer Modellanbieter mit Auftragsverarbeitungsvertrag, regionalem Hosting und begrenzter Datenspeicherung. Am einfachsten, aber die Daten verlassen trotzdem Ihr Netzwerk.
- Open-Source-Modell in Ihrem Cloud-Konto. GPU-Instanzen innerhalb Ihres eigenen virtuellen Netzwerks. Die Daten bleiben in Ihrem Konto, und Sie verwalten die Server.
- On-Premise-Server. Modelle auf Hardware in Ihrem eigenen Rechenzentrum. Maximale Kontrolle, bei größtem Betriebsaufwand.
- Auf dem Gerät. Kleinere Modelle auf den Laptops der Mitarbeitenden, für die individuelle Arbeit mit hochsensiblen Dateien.
Viele Organisationen kombinieren sie. Inhalte mit geringem Risiko können ein gehostetes Modell nutzen, während regulierte Inhalte auf privater Infrastruktur bleiben.
Die richtige Option wählen
Einige Fragen klären die Wahl in der Regel:
- Erlauben Ihre Verträge oder Aufsichtsbehörden überhaupt, dass diese Daten von einem Dritten verarbeitet werden?
- Falls ja, welche Regionen und welche Arten von Vereinbarungen sind akzeptabel?
- Wie viele Personen werden das System nutzen, und wie oft?
- Haben Sie Mitarbeitende, die GPU-Server betreiben können, oder übernimmt das ein Partner?
- Wie viel Antwortqualität sind Sie bereit, gegen Kontrolle einzutauschen?
Ihre Teams für Sicherheit, Datenschutz und Recht sollten sich auf die Antworten einigen, bevor die Umsetzung beginnt.
So funktioniert es, Schritt für Schritt
- Dokumente einlesen. Connectoren lesen aus Ihrem Dokumentenmanagementsystem, aus Dateifreigaben oder Datenbanken innerhalb Ihres Netzwerks. Sensible Felder können vor der Indexierung maskiert werden, wo sie nicht benötigt werden.
- Aufteilen und indexieren. Dokumente werden in Abschnitte aufgeteilt und von einem lokal gehosteten Embedding-Modell in Embeddings umgewandelt, also numerische Darstellungen ihrer Bedeutung. Diese werden mit Berechtigungs-Metadaten in einer verschlüsselten Vektordatenbank gespeichert.
- Für jede Frage abrufen. Das System prüft, wer fragt, und durchsucht nur Dokumente, die diese Person lesen darf.
- Mit Quellenangaben antworten. Ein privates Sprachmodell formuliert die Antwort aus den gefundenen Textstellen und verlinkt jede Quelle.
- Protokollieren und verbessern. Anfragen und Quellen werden innerhalb Ihrer Umgebung für Audit und Qualitätsprüfung protokolliert.
Eingesetzte Tools
- Backend: Python mit FastAPI, bereitgestellt in Ihrem Cloud-Konto oder auf Ihren Servern.
- Vektordatenbank: pgvector in Ihrem bestehenden Postgres oder Qdrant, beide selbst gehostet.
- Modelle: Open-Weight-Modellfamilien wie Llama, Mistral oder Qwen, bereitgestellt mit Tools wie vLLM oder Ollama, dazu lokale Embedding-Modelle.
- Infrastruktur: GPU-Instanzen auf AWS, Azure oder Google Cloud in der Region Ihrer Wahl oder On-Premise-Hardware.
Prüfen Sie vor der Planung Modelllizenzen, Cloud-Preise und GPU-Verfügbarkeit. Die Lizenzbedingungen unterscheiden sich je nach Modell, und die GPU-Kapazität variiert je nach Region.
Abwägungen gegenüber gehosteten APIs
Qualität
Gutes Retrieval leistet bei der Beantwortung von Fragen zu Dokumenten einen Großteil der Arbeit, und aktuelle Open-Weight-Modelle bewältigen das gut. Bei komplexem Schlussfolgern liegen die größten gehosteten Modelle meist noch vorn. Testen Sie beide mit Ihren eigenen Fragen, bevor Sie sich entscheiden.
Kosten
Gehostete APIs werden nach Nutzung abgerechnet. Private Modelle kosten Geld für Hardware oder GPU-Zeit, ob ausgelastet oder im Leerlauf. Bei gleichmäßig hohem Volumen kann privates Hosting günstiger sein. Wir haben für einen Unternehmenskunden aus einer regulierten Branche ein privates KI-Deployment direkt auf dem Gerät umgesetzt. Es hat OpenAI-Ausgaben von 4,2K USD pro Monat eingespart, und keine Kundendaten verlassen den Laptop. Ihre Zahlen hängen von Ihrem Volumen ab.
Wartung
Mit einem privaten Modell sind Sie selbst für Updates, Sicherheitspatches, Monitoring und Kapazitätsplanung verantwortlich. Planen Sie dafür Zeit ein oder einen Partner, der das übernimmt.
Neue Open-Weight-Modelle erscheinen häufig. Ein Modell auszutauschen ist meist einfach, aber jeder Austausch muss vor dem Release erneut mit Ihrem Evaluierungsset getestet werden. Behandeln Sie Modellwechsel wie jede andere Änderung in der Produktion.
Was Sie für den Start brauchen
- Einen klaren Anwendungsfall und die Dokumentquellen, die er benötigt.
- Eine mit Sicherheits- und Rechtsabteilung abgestimmte Entscheidung, welche Deployment-Option akzeptabel ist.
- Zugang zu einem Cloud-Konto oder zu Servern, bei Bedarf einschließlich GPU-Kapazität.
- Eine Reihe echter Fragen mit bekannten Antworten für die Evaluierung.
Typischer Umfang und Zeitrahmen
Eine erste Version dauert typischerweise 2 bis 4 Wochen, abhängig von Quellen, Infrastruktur und Integrationen. Das ist eine Schätzung. Wartezeiten auf GPU-Kapazität oder Sicherheitsfreigaben können sie verlängern, kümmern Sie sich daher frühzeitig darum.
Wie wir Antworten korrekt halten
- Ein Evaluierungsset mit echten Fragen, das vor jeder Änderung an Modell oder Prompt durchlaufen wird.
- Quellenangaben bei jeder Antwort, damit Fachleute schnell prüfen können.
- Verweigerung bei Unsicherheit, insbesondere bei klinischen, finanziellen oder rechtlichen Fragen.
- Monitoring unbeantworteter Fragen, von Feedback und Antwortzeiten, vollständig innerhalb Ihrer Umgebung.
Risiken und wie wir damit umgehen
- Datenschutz und Compliance: Privates Hosting hilft, ist für sich allein aber noch keine Compliance. HIPAA, PIPEDA und DSGVO stellen jeweils Anforderungen an Zugriff, Sicherheit und Aufbewahrung. Prüfen Sie diese mit Ihrer eigenen Rechtsberatung. Technische Muster finden Sie unter RAG mit Privacy by Design.
- Berechtigungen: werden beim Retrieval anhand Ihres Identity Providers durchgesetzt und nie dem Modell überlassen.
- Falsche Antworten: Quellenangaben, Verweigerungsregeln und Prüfung durch Fachleute bei allem, was einen Mandanten oder Patienten betrifft.
- Veraltete Dokumente: planmäßige Neuindexierung und Entfernung ausgemusterter Dokumente.
- Sicherheit des Stacks: Verschlüsselung, Netzwerkisolation, Patching und Zugriffsprotokolle für jede Komponente.
Wann Sie das nicht bauen sollten
- Ihre Daten sind eigentlich nicht sensibel, oder eine gehostete API unter Geschäftsbedingungen ist akzeptabel. Das ist einfacher und oft besser.
- Ihr Volumen ist gering, und die Hardware würde ungenutzt herumstehen.
- Niemand kann die Infrastruktur warten, und Sie möchten auch keinen Partner damit beauftragen.
- Sie brauchen das stärkste verfügbare Schlussfolgerungsvermögen dringender als die Kontrolle über Ihre Daten.
Wie UnlockLive Sie unterstützt
Wir konzipieren und betreiben private RAG-Systeme, von der Modellauswahl und GPU-Dimensionierung bis zu berechtigungsbewusstem Retrieval und Evaluierung. Sehen Sie sich unsere Services RAG-Entwicklung und KI- und ML-Entwicklung an.
Weiterführende Artikel: der Q&A-Assistent für HR-Richtlinien und Verträge, die Sicherheits-Checkliste für MCP-Server und selbst gehostetes n8n vs. Zapier vs. Make. Um Ihre Daten und Optionen zu besprechen, buchen Sie ein kostenloses 30-minütiges Gespräch.
Häufig gestellte Fragen
Was ist privates RAG?
Privates RAG ist Retrieval-Augmented Generation, bei der Dokumentindex, Embedding-Modell und Sprachmodell vollständig auf Infrastruktur laufen, die Sie kontrollieren, etwa in Ihrem eigenen Cloud-Konto, auf Ihren Servern oder auf den Laptops Ihrer Mitarbeitenden. Dokumente und Fragen werden nicht an einen öffentlichen KI-Dienst gesendet.
Sind private Open-Source-Modelle so gut wie gehostete Modelle?
Bei vielen Aufgaben, in denen Fragen zu Dokumenten beantwortet werden, schneiden aktuelle Open-Weight-Modelle gut ab, besonders wenn das Retrieval gut ist. Die größten gehosteten Modelle sind bei komplexem Schlussfolgern und langen, differenzierten Antworten meist noch stärker. Der einzig verlässliche Weg zur Entscheidung ist, beide mit Ihren eigenen Evaluierungsfragen zu testen.
Ist privates RAG günstiger als eine gehostete API?
Das hängt vom Volumen ab. Gehostete APIs werden nach Nutzung abgerechnet und sind daher bei geringem Volumen günstig. Private Modelle brauchen Hardware oder GPU-Instanzen, die Geld kosten, ob sie ausgelastet sind oder nicht, dazu kommt Wartungsaufwand. Bei gleichmäßig hohem Volumen kann privates Hosting günstiger sein; bei geringem Volumen kostet es meist mehr.
Macht uns der Betrieb von KI auf eigenen Servern HIPAA- oder DSGVO-konform?
Nein, nicht für sich allein. Wenn Daten im Haus bleiben, sind weniger Dritte beteiligt, was die Compliance vereinfachen kann. Sie brauchen trotzdem Zugriffskontrolle, Verschlüsselung, Audit-Logs, Aufbewahrungsregeln, Verträge und Richtlinien. Prüfen Sie die für Sie geltenden Anforderungen mit Ihrer eigenen Rechtsberatung.
Können wir stattdessen ein gehostetes Modell mit sensiblen Daten nutzen?
Manchmal. Große Anbieter bieten Geschäftsbedingungen, Auftragsverarbeitungsverträge, regionales Hosting und Optionen zur Begrenzung der Datenspeicherung. Für manche Organisationen ist das akzeptabel; bei anderen verlangen Verträge oder Aufsichtsbehörden, dass die Daten auf der eigenen Infrastruktur bleiben. Diese Entscheidung liegt bei Ihren Teams für Sicherheit, Datenschutz und Recht.
Wie betreibt man ein LLM on premise?
Wählen Sie ein Open-Weight-Modell, das zu Ihrer Aufgabe und Hardware passt, betreiben Sie es mit einem Inferenzserver auf eigenen GPU-Servern oder einer privaten Cloud-Instanz und halten Sie Dokumentenindex und Embedding-Modell in derselben Umgebung. Ergänzen Sie Zugriffskontrolle, Verschlüsselung, Logging und Monitoring und planen Sie Updates ein. Testen Sie die Antwortqualität mit Ihren eigenen Dokumenten, bevor Sie sich entscheiden.
So können wir helfen
- Individuelle RAG- & Enterprise-Search-EntwicklungProduktive Retrieval-Augmented-Generation-Systeme auf Ihrer Wissensbasis. Hybride Suche, Reranking, Quellenangaben, Evals und On-Premises-Deployment.
- KI- & Machine-Learning-EntwicklungIndividuell trainierte Modelle – Computer Vision, Predictive Analytics, NLP-Klassifikatoren, Empfehlungen, Fine-Tuning – mit vollständigen MLOps-Pipelines.
- Cybersicherheits- und KI-SicherheitsleistungenPenetrationstests, SOC-Monitoring, Vorbereitung auf SOC 2 / ISO 27001 / PCI DSS / HIPAA sowie Arbeit in neuen Bereichen wie LLM-Red-Teaming und Sicherheit von KI-Agenten.
Sprechen Sie mit einem Entwickler über Ihr Projekt
Erzählen Sie uns, was Sie entwickeln. Wir antworten innerhalb eines Werktags mit einer ehrlichen Einschätzung zu Umfang, Vorgehen und Aufwand.
Kostenloses Strategiegespräch buchenVerfasst vom Engineering-Team von UnlockLive IT. UnlockLive IT Limited arbeitet mit Kunden über den Hauptsitz in Toronto und liefert die Entwicklung aus dem Delivery-Center in Dhaka. Über uns