Zurück zum Blog Webentwicklung

Interner KI-Assistent mit RAG 2026: Unternehmenswissen sicher nutzen

3. Oktober 2026 Dominik Baurhenn 9 Min. Lesezeit
Interner KI-Assistent durchsucht freigegebene Unternehmensdokumente mit rollenbasiertem Zugriff und Quellenbelegen
Beitragsbild mit generativer KI erstellt; Motiv dient der Illustration.

Kurzantwort: Ein interner KI-Assistent mit Retrieval-Augmented Generation, kurz RAG, beantwortet Fragen auf Basis freigegebener Unternehmensdokumente und kann die verwendeten Quellen anzeigen. Er ersetzt keine Berechtigungen und macht ein Sprachmodell nicht automatisch fehlerfrei. Ein sicherer Einstieg beginnt deshalb mit einem klaren Anwendungsfall, klassifizierten Daten, rollenbasiertem Zugriff, messbaren Testfragen und menschlicher Freigabe für wichtige Entscheidungen. Für einen fokussierten Prototyp sollten Unternehmen 2026 häufig mit einem mittleren vierstelligen Budget rechnen; produktive Integrationen und sensible Daten erhöhen Aufwand und Prüfbedarf.

In vielen Unternehmen ist Wissen vorhanden, aber schwer auffindbar. Richtlinien liegen im Intranet, Produktinformationen in PDFs, Projektwissen in Wikis und Antworten in alten Tickets. Mitarbeitende suchen lange oder fragen immer wieder dieselben Personen. Ein interner KI-Assistent kann diese Informationen über eine natürliche Frage zugänglich machen.

Dieser Leitfaden erklärt, wie RAG funktioniert, welche Risiken häufig unterschätzt werden und wie aus einer Demo ein verantwortbar nutzbares Werkzeug wird.

Was ist ein interner KI-Assistent mit RAG?

RAG verbindet ein großes Sprachmodell mit ausgewählten externen Wissensquellen. Statt nur auf dem allgemeinen Modellwissen zu antworten, sucht das System zunächst relevante Ausschnitte aus freigegebenen Dokumenten. Diese Ausschnitte werden zusammen mit der Frage an das Modell übergeben. Die Antwort kann anschließend Quellen oder Dokumentstellen nennen.

Ein vereinfachter Ablauf:

  1. Dokumente werden eingelesen und in sinnvolle Abschnitte geteilt.
  2. Die Abschnitte erhalten durch Embeddings eine mathematische Repräsentation.
  3. Eine Nutzerfrage wird mit den gespeicherten Inhalten verglichen.
  4. Passende Abschnitte werden abgerufen.
  5. Das Sprachmodell formuliert auf dieser Grundlage eine Antwort.
  6. Quellen, Unsicherheit und erlaubte Folgeaktionen werden angezeigt.

Das Ziel ist nicht, das Modell mit sämtlichen Unternehmensdaten zu trainieren. RAG soll zur jeweiligen Frage kontrolliert den passenden Kontext bereitstellen.

Welche Anwendungsfälle eignen sich?

Ein guter Anwendungsfall hat wiederkehrende Fragen, belastbare Quellen und einen begrenzten Risikorahmen. Typische Beispiele sind:

  • interne Suche in Handbüchern, Richtlinien und Prozessdokumentationen,
  • Unterstützung für Support-Mitarbeitende mit geprüften Lösungsartikeln,
  • Produkt- und Vertriebswissen aus Datenblättern und freigegebenen Unterlagen,
  • Onboarding neuer Mitarbeitender,
  • Zusammenfassung und Vergleich interner Dokumente,
  • Vorbereitung von Entwürfen mit nachvollziehbaren Quellen,
  • Recherche in technischen oder fachlichen Wissenssammlungen.

Weniger geeignet ist ein unkontrollierter Assistent, der rechtsverbindliche, medizinische, finanzielle oder personelle Entscheidungen selbst trifft. Je größer die mögliche Auswirkung eines Fehlers, desto stärker müssen Fachprüfung, Protokollierung und menschliche Entscheidung verankert sein.

Warum ist RAG mehr als ein Chatfenster?

Die sichtbare Unterhaltung ist nur die Oberfläche. Der eigentliche Aufwand liegt in Datenzugriff, Berechtigungen, Aktualisierung, Qualität und Betrieb. Eine optisch überzeugende Demo kann mit wenigen Dokumenten schnell entstehen. Ein produktives System muss dagegen über Monate korrekte Datenstände, getrennte Nutzerrechte und nachvollziehbare Ergebnisse liefern.

Ein belastbares System benötigt mindestens:

  • eine definierte Quelle für jedes Wissensgebiet,
  • einen geregelten Import- und Aktualisierungsprozess,
  • Dokumenten- und Abschnittsmetadaten,
  • serverseitige Berechtigungsprüfung vor der Suche,
  • Quellenanzeige und einen Weg zur Originalstelle,
  • Grenzen für Dateitypen, Größe, Eingaben und Nutzung,
  • Testfälle, Monitoring und einen Abschalt- oder Rückfallweg.

Deshalb ist ein RAG-Assistent eher eine individuelle Webanwendung mit KI-Komponente als ein austauschbares Chat-Widget.

Wie werden Unternehmensdokumente vorbereitet?

Dateninventar und Klassifizierung

Zuerst wird festgelegt, welche Quellen genutzt werden dürfen. Öffentlich, intern, vertraulich und besonders sensibel sollten getrennt betrachtet werden. Dokumente mit personenbezogenen Daten, Geschäftsgeheimnissen oder vertraglichen Einschränkungen benötigen zusätzliche Prüfung.

Qualität und Gültigkeit

Widersprüchliche oder veraltete Dokumente werden durch RAG nicht automatisch korrekt. Verantwortliche, Freigabestatus und Gültigkeitsdatum sollten als Metadaten verfügbar sein. Ein Assistent darf einen veralteten Entwurf nicht gleich gewichten wie eine freigegebene Richtlinie.

Sinnvolle Abschnittsbildung

Zu große Abschnitte verwässern die Suche; zu kleine Abschnitte verlieren Zusammenhang. Überschriften, Tabellen, Seitenbezug und Dokumenthierarchie müssen erhalten bleiben. Die beste Strategie hängt von Sprache, Dokumentart und typischen Fragen ab.

Aktualisierung und Löschung

Wenn eine Quelle geändert oder entfernt wird, müssen Suchindex, Cache und gespeicherte Ableitungen zuverlässig aktualisiert werden. Sonst antwortet das System weiter mit Informationen, die im Ursprung bereits gelöscht wurden.

Wie funktionieren Rollen und Berechtigungen?

Ein häufiger Fehler ist, zunächst alle Dokumente gemeinsam zu indexieren und Berechtigungen erst in der Oberfläche zu berücksichtigen. Das kann zu Datenlecks führen. Die Suche selbst muss nur Inhalte berücksichtigen, die der angemeldete Nutzer sehen darf.

Die OWASP GenAI Security Project beschreibt bei Vektor- und Embedding-Schwächen ausdrücklich das Risiko, dass Inhalte mit unterschiedlichen Zugriffsrechten vermischt und dadurch unbefugt offengelegt werden.

Praktische Schutzmaßnahmen sind:

  • Rechte aus einem führenden Identitäts- oder Anwendungssystem übernehmen,
  • Dokumente und Abschnitte mit überprüfbaren Zugriffsmerkmalen versehen,
  • Berechtigungen serverseitig vor jedem Retrieval anwenden,
  • Mandanten, Abteilungen oder Projekte technisch sauber trennen,
  • Testkonten für erlaubte und verbotene Zugriffe verwenden,
  • Änderungen an Rollen zeitnah im Index abbilden.

Welche Sicherheitsrisiken bleiben trotz RAG?

RAG reduziert bestimmte Wissenslücken, beseitigt aber weder Halluzinationen noch Prompt Injection. Die OWASP-Empfehlungen zu Prompt Injection weisen darauf hin, dass auch externe Inhalte oder Dokumente Anweisungen enthalten können, die das Verhalten eines Systems beeinflussen.

Relevante Risiken sind:

  • vertrauliche Informationen werden in Antworten oder Protokollen offengelegt,
  • manipulierte Dokumente beeinflussen spätere Antworten,
  • das Modell behauptet mehr, als die Quellen belegen,
  • Quellen werden zwar genannt, stützen die konkrete Aussage aber nicht,
  • Nutzer umgehen über Formulierungen vorgesehene Grenzen,
  • externe Modelle oder Dienste verarbeiten Daten an unerwarteten Orten,
  • automatisierte Aktionen werden ohne ausreichende Kontrolle ausgelöst.

Das Bundesamt für Sicherheit in der Informationstechnik empfiehlt bei KI-Systemen unter anderem zu klären, welche Daten übertragen werden, wie personenbezogene Informationen geschützt bleiben und wie Entscheidungen nachvollziehbar werden. Die BSI-Übersicht zu sicherer KI bietet dafür einen hilfreichen Ausgangspunkt.

Wie wird Antwortqualität gemessen?

Ein Assistent sollte nicht nur nach Bauchgefühl getestet werden. Vor dem Pilotbetrieb entsteht ein Testkatalog mit realen Fragen, erwarteten Quellen und akzeptablen Antworten.

Retrieval-Qualität

Findet das System die relevanten Dokumentstellen? Werden aktuelle und freigegebene Quellen priorisiert? Werden unzulässige Inhalte zuverlässig ausgeschlossen?

Antworttreue

Bleibt die Antwort bei den bereitgestellten Quellen? Markiert sie fehlende Informationen, statt sie zu erfinden? Stimmen Zitate und Verweise tatsächlich mit der Aussage überein?

Nutzbarkeit

Erhalten Mitarbeitende schneller eine bessere Antwort als über die bisherige Suche? Verstehen sie Grenzen und können sie die Originalquelle leicht öffnen?

Sicherheitstests

Gezielte Prüfungen versuchen, Berechtigungen zu umgehen, vertrauliche Daten abzurufen oder schädliche Anweisungen aus Dokumenten einzuschleusen. Fehler werden dokumentiert und vor der Freigabe behoben.

Das NIST AI Risk Management Framework ordnet KI-Risikomanagement in die Funktionen Govern, Map, Measure und Manage ein. Für ein Unternehmensprojekt ist diese Logik wertvoll: Zuständigkeiten festlegen, Kontext verstehen, Risiken messen und Maßnahmen dauerhaft betreiben.

Welche Rolle spielt der EU AI Act?

Die rechtliche Einordnung hängt vom konkreten Zweck, den betroffenen Personen und den Entscheidungen ab. Ein interner Wissensassistent ist nicht automatisch ein Hochrisiko-System. Trotzdem gelten bereits organisatorische Anforderungen, die auch kleine Projekte betreffen können.

Artikel 4 der EU-Verordnung 2024/1689 verlangt von Anbietern und Betreibern Maßnahmen für ein ausreichendes Maß an KI-Kompetenz der Personen, die KI-Systeme in ihrem Auftrag einsetzen. Mitarbeitende benötigen daher nicht nur eine Bedienoberfläche, sondern verständliche Informationen zu Zweck, Grenzen, Daten und richtiger Kontrolle.

Artikel 50 enthält unter anderem Transparenzpflichten für bestimmte Systeme, die direkt mit Menschen interagieren. Welche Pflicht im Einzelfall gilt, sollte vor dem Einsatz geprüft werden. Technische Umsetzung und rechtliche Bewertung gehören zusammen, ersetzen einander aber nicht.

Cloud, eigenes Hosting oder hybrider Betrieb?

Die passende Architektur hängt von Daten, Budget, Geschwindigkeit und vorhandener IT ab.

  • Cloud-Dienst: schneller Einstieg und leistungsfähige Modelle, aber Verträge, Datenflüsse, Regionen und Protokollierung müssen geprüft werden.
  • eigenes Hosting: mehr Kontrolle, dafür höhere Anforderungen an Hardware, Betrieb, Updates und Modellkompetenz.
  • hybrid: Dokumente, Rechte oder Retrieval bleiben in eigener Infrastruktur, während ausgewählte Kontexte kontrolliert an einen Modelldienst gehen.

„Lokal“ ist nicht automatisch sicher und „Cloud“ nicht automatisch ungeeignet. Entscheidend ist ein dokumentierter Datenfluss: Welche Information verlässt welches System, zu welchem Zweck, für wie lange und unter welcher vertraglichen Grundlage?

Wie läuft ein RAG-Projekt ab?

1. Anwendungsfall und Grenzen definieren

Eine Nutzergruppe, ein Wissensgebiet und ein messbares Ziel werden ausgewählt. Gleichzeitig wird festgelegt, welche Fragen der Assistent ausdrücklich nicht beantworten oder entscheiden soll.

2. Daten und Rechte prüfen

Quellen, Qualität, Verantwortliche, Aktualisierung und Berechtigungen werden dokumentiert. Sensible Inhalte kommen nicht beiläufig in den ersten Prototyp.

3. Prototyp mit Testkatalog entwickeln

Retrieval, Modell, Quellenanzeige und Oberfläche werden mit repräsentativen Dokumenten aufgebaut. Reale Testfragen liefern eine Ausgangsmessung.

4. Pilot mit ausgewählten Nutzern

Eine kleine Gruppe arbeitet in einem begrenzten Zeitraum mit dem System. Feedback, Fehlantworten, nicht gefundene Inhalte und Missbrauchsversuche werden ausgewertet.

5. Produktiver Betrieb und Verbesserung

Monitoring, Kostenlimits, Update-Prozess, Berechtigungsprüfung, Incident-Verfahren und Verantwortlichkeiten werden dauerhaft verankert. Neue Datenquellen folgen erst nach kontrollierter Freigabe.

Was kostet ein interner KI-Assistent mit RAG 2026?

Die Kosten hängen nicht nur vom Modell ab. Datenaufbereitung, Rechte, Integrationen, Testtiefe und Betrieb sind häufig größere Faktoren als die reine Chatoberfläche. Unverbindliche Orientierung:

  • fokussierter Prototyp mit wenigen geprüften Quellen: häufig etwa 3.000 bis 8.000 Euro;
  • interner Assistent mit Anmeldung, Rollen und geregeltem Datenimport: häufig etwa 8.000 bis 20.000 Euro;
  • mehrere Systeme, sensible Daten oder automatisierte Folgeprozesse: häufig ab 20.000 Euro;
  • laufender Betrieb: Modellnutzung, Hosting, Monitoring, Wartung und Qualitätssicherung.

Ein gutes Angebot trennt Konzept, Prototyp, produktive Absicherung und laufenden Betrieb. So lässt sich nach dem Pilot bewusst entscheiden, ob der gemessene Nutzen eine weitere Investition rechtfertigt.

Häufige Fragen zu internen KI-Assistenten

Verhindert RAG Halluzinationen vollständig?

Nein. RAG kann Antworten besser begründen und auf aktuelle Quellen ausrichten, aber das Modell kann Inhalte weiterhin falsch verbinden oder überinterpretieren. Quellenprüfung und geeignete Grenzen bleiben notwendig.

Müssen unsere Dokumente zum Training verwendet werden?

Nicht zwangsläufig. Bei RAG werden relevante Ausschnitte typischerweise zur Anfrage bereitgestellt. Ob und wie ein Dienst Daten speichert oder für Training verwendet, hängt vom Anbieter, Vertrag und technischen Setup ab und muss konkret geprüft werden.

Kann der Assistent unterschiedliche Abteilungen trennen?

Ja, wenn Rechte bereits beim Abruf der Dokumente durchgesetzt werden. Eine bloße Anweisung im Prompt ist kein ausreichendes Berechtigungssystem.

Wie aktuell sind die Antworten?

So aktuell wie die eingebundenen und erfolgreich verarbeiteten Quellen. Importstatus, Gültigkeitsdatum und letzte Aktualisierung sollten sichtbar und überwachbar sein.

Kann RAG mit SharePoint, einem Wiki oder einem DMS verbunden werden?

Grundsätzlich ja, sofern geeignete Schnittstellen und Rechte vorhanden sind. Der Aufwand hängt von Datenstruktur, API, Änderungslogik und gewünschter Zugriffstrennung ab.

Fazit: Der sichere Assistent beginnt bei Daten und Verantwortung

Ein interner RAG-Assistent kann Wissenssuche deutlich verbessern, wenn Quellen, Rechte und Qualitätsmessung wichtiger genommen werden als eine schnelle Demo. Der beste Start ist ein begrenzter Anwendungsfall mit realen Fragen, geprüften Dokumenten und einem klaren menschlichen Verantwortlichen.

Du möchtest herausfinden, ob ein interner Assistent, eine andere KI-Automatisierung oder eine klassische Suche für deinen Prozess sinnvoll ist? Beschreibe über die Projektanfrage das Wissensgebiet, die Nutzergruppen und die heute verwendeten Systeme. Du erhältst eine technische Ersteinschätzung mit sinnvollem Pilotumfang und den wichtigsten Risiken.

Transparenzhinweis: Dieser Beitrag wurde redaktionell und teilweise KI-gestützt erstellt und anschließend fachlich geprüft. Er ersetzt keine individuelle Rechts-, Datenschutz- oder Informationssicherheitsberatung. Preise sind unverbindliche Orientierungswerte und hängen vom konkreten Projektumfang ab.

Teilen:

Wert 150 € · für dich kostenlos

Was kostet deine Website gerade Kunden?

Ich prüfe deine Website persönlich auf SEO, Performance, Nutzerführung und Conversion. Du erhältst innerhalb von 48 Stunden drei konkrete Empfehlungen – ohne Bot und ohne Verkaufsdruck.

  • Von mir persönlich geprüft
  • 3 klare Empfehlungen
  • Antwort per E-Mail
Kostenlosen Check anfordern Oder sofort selbst testen

Kostenlos · unverbindlich · Antwort in 48 Stunden