Ömer CoskunIT Services

Wissenssuche mit Quellenangabe: zitieren oder ablehnen

Veröffentlicht

Kurz beantwortet

Was soll eine KI-Wissenssuche tun, wenn ihre Dokumente keine Antwort hergeben?

Ablehnen. Eine verlässliche Wissenssuche belegt jede Antwort mit ihrer Quelle, also mit Datei, Seite und Zeile, und sagt offen, wenn der Bestand keine Stelle enthält, die die Antwort trägt. Eine flüssige Antwort ohne Beleg ist gefährlicher als gar keine, weil niemand merkt, dass sie falsch ist.

Die gefährlichste Antwort

Die gefährlichste Antwort einer Wissenssuche ist nicht die falsche. Es ist die falsche, die überzeugend klingt.

Ein Beispiel: Jemand fragt nach der Kündigungsfrist im Rahmenvertrag. Die Suche findet keine passende Stelle und antwortet trotzdem, flüssig und mit einer konkreten Zahl. Sprachmodelle formulieren auch dann plausibel, wenn ihnen die Grundlage fehlt. Niemand merkt es, bis es teuer wird.

Eine einfache Regel

  1. Jede Antwort nennt ihre Quelle: Datei, Seite und Zeilenbereich.
  2. Findet die Suche keine Stelle, die die Antwort trägt, sagt sie das, ohne Ausnahme.
  3. Eine Antwort ohne Beleg wird gar nicht erst angezeigt.

Das macht die Suche nicht schlechter. Es macht sie überprüfbar: Wer eine Antwort liest, kann nachsehen, worauf sie beruht.

Wie das technisch aussieht

Die Grundlage ist ein Verfahren, das als Retrieval-Augmented Generation bekannt ist: Erst werden passende Abschnitte aus Ihren Dokumenten gesucht, dann formuliert ein Sprachmodell die Antwort auf ihrer Grundlage. Damit daraus eine belegte Antwort wird, braucht es drei Dinge.

  1. Herkunft beim Einlesen: Jeder Textabschnitt wird mit Datei, Seite und Zeilenbereich gespeichert. Ein Abschnitt ohne Herkunft wird gar nicht erst gespeichert.
  2. Rechte vor der Suche: Gesucht wird nur in Abschnitten, die die fragende Person sehen darf.
  3. Prüfung vor der Ausgabe: Trägt keiner der gefundenen Abschnitte die Antwort, lehnt das System ab, statt zu raten.

Wie Sie prüfen, ob es funktioniert

Eine solche Suche lässt sich messen. Man stellt ihr Fragen, deren Antwort im Bestand steht, und Fragen, deren Antwort dort nicht steht. Gemessen wird beides: wie oft eine Antwort richtig belegt ist und wie oft die Suche zu Recht ablehnt.

Auch die Schutzmechanismen selbst brauchen Tests. Im Open-Source-Projekt cite-or-decline wird jede der 36 Schutzprüfungen einzeln absichtlich entfernt, um zu zeigen, dass der zugehörige Test anschlägt.

Warum Ablehnen Vertrauen schafft

Eine Suche, die auch einmal sagt, dass sie in den Unterlagen nichts findet, wirkt zunächst weniger hilfreich. Tatsächlich wissen Sie bei ihr, woran Sie sind: Jede Antwort bringt ihren Beleg mit, und jede Lücke wird benannt. Eine Suche, der man vertraut, wird auch genutzt.

Quellen und Belege

  1. cite-or-decline auf GitHub
  2. Lewis u. a. (2020): Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
  3. OWASP GenAI Security Project: Top 10 der Risiken für Anwendungen mit Sprachmodellen (2025)
  4. Werkverzeichnis: cite-or-decline und green-but-blind(eigener Beleg)

Warum Rechte vor das Modell gehören und nicht in den PromptSchwerpunkt: Wissenssuche und Assistenten

Sie planen etwas in dieser Richtung? Beschreiben Sie kurz Ihr Vorhaben, Sie erhalten eine ehrliche Einschätzung.

Weitere Beiträge

Alle Beiträge