Kontextvergiftung
Bei der Kontextvergiftung wird der Gesprächs- oder Datenkontext schrittweise mit Inhalten angereichert, die spätere Antworten in die gewünschte Richtung lenken. Kein einzelner Schritt wirkt schädlich — die Wirkung entsteht erst aus der Summe.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Echo Chamber, Crescendo, Gespeicherte Prompt Injection.
Bezug zu Prompt Injection
Der Angriff unterläuft jede Prüfung, die einzelne Nachrichten isoliert bewertet — die Schadwirkung liegt in der Abfolge, nicht im einzelnen Satz. Erkennung erfordert deshalb eine Betrachtung des gesamten Verlaufs, etwa über eine Messung der Abweichung von der ursprünglichen Aufgabe. In RAG-Systemen entsteht dieselbe Wirkung über den Datenbestand statt über den Dialog. Praktisch hilft, den Verlauf zu begrenzen: kurze Sitzungen, Zurücksetzen des Kontexts nach abgeschlossenen Aufgaben und kein unbegrenztes Gedächtnis über Sitzungen hinweg.
Beispiel
Über mehrere Turns hinweg wird eine harmlose Prämisse etabliert, auf die sich das Modell später beruft, um eine sonst abgelehnte Auskunft zu geben.
Verwandte Begriffe
- Echo Chamber — Echo Chamber ist eine mehrstufige Jailbreak-Technik, die harmlose Anknüpfungspunkte setzt und das Modell die eigenen Aussagen…
- Crescendo — Crescendo ist ein mehrstufiger Angriff, der harmlos beginnt und sich in kleinen, jeweils plausiblen Schritten zum Ziel steigert…
- Gespeicherte Prompt Injection — Bei der gespeicherten Prompt Injection liegt der Payload dauerhaft in einem Datenspeicher und wirkt bei jedem erneuten Abruf…
Quellen
- Kontextvergiftung — Beleg: https://neuraltrust.ai/blog/echo-chamber-context-poisoning-jailbreak