RAG-Vergiftung
Bei der RAG-Vergiftung werden präparierte Dokumente so gestaltet, dass sie für bestimmte Fragen zuverlässig abgerufen werden und dort ihre Anweisungen oder Falschinformationen ausspielen. Schon sehr wenige eingeschleuste Dokumente genügen für hohe Erfolgsquoten.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind RAG (Retrieval-Augmented Generation), Gespeicherte Prompt Injection, Datenvergiftung.
Bezug zu Prompt Injection
Die PoisonedRAG-Arbeit zeigte, dass bereits eine Handvoll gezielt eingeschleuster Texte je Zielfrage genügt, um die Antwort einer sehr großen Wissensbasis zuverlässig zu bestimmen. Der Angriff ist attraktiv, weil er dauerhaft wirkt und nicht am Modell, sondern am Datenbestand ansetzt — ein Modellwechsel behebt ihn nicht. Die Gegenmaßnahmen liegen im Schreibpfad: Wer darf indexieren, wird der Inhalt geprüft, gibt es eine Herkunftskennzeichnung.
Beispiel
Ein öffentlich beschreibbares Wiki, das in den Index einer Support-KI läuft, erhält einen Absatz, der die Standardantwort auf eine häufige Frage umdefiniert.
Verwandte Begriffe
- RAG (Retrieval-Augmented Generation) — RAG erweitert ein Sprachmodell um eine Suchkomponente, die zur Anfrage passende Dokumente abruft und in den Kontext stellt…
- Gespeicherte Prompt Injection — Bei der gespeicherten Prompt Injection liegt der Payload dauerhaft in einem Datenspeicher und wirkt bei jedem erneuten Abruf…
- Datenvergiftung — Datenvergiftung manipuliert Trainings-, Feintuning- oder Wissensdaten, um Verhalten oder Hintertüren in ein Modell einzubauen…
Quellen
- RAG-Vergiftung — Beleg: https://arxiv.org/abs/2402.07867