Many-Shot-Jailbreaking
Many-Shot-Jailbreaking füllt das Kontextfenster mit vielen fingierten Dialogbeispielen, in denen ein Assistent regelwidrig antwortet, worauf das Modell das Muster fortsetzt. Die Wirksamkeit steigt messbar mit der Zahl der Beispiele und damit mit der Größe des Kontextfensters.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Kontextfenster, In-Context-Learning, Jailbreak.
Bezug zu Prompt Injection
Anthropic veröffentlichte den Befund 2024 zusammen mit der Beobachtung, dass die Wirksamkeit mit der Beispielzahl systematisch zunimmt und mehrere Anbietermodelle betrifft. Der Angriff ist eine direkte Folge größerer Kontextfenster — dieselbe Fähigkeit, die lange Dokumente ermöglicht, trägt auch die Attacke. Praktikable Gegenmaßnahmen sind Begrenzung und Klassifikation des eingehenden Kontexts vor der Übergabe an das Modell. Für Betreiber ist zudem relevant, wie viel Kontext Nutzer überhaupt einbringen dürfen: Eine harte Obergrenze für die Eingabelänge ist eine einfache, wirksame Bremse.
Beispiel
Ein sehr langer Prompt enthält Dutzende erfundener Frage-Antwort-Paare, in denen ein Assistent bereitwillig antwortet — das Modell setzt das Muster fort.
Wo der Begriff auftaucht
- Kontext-Überflutung — Der Angreifer füllt das Kontextfenster mit sehr viel Text, sodass die eigentlichen Sicherheitsanweisungen an Gewicht verlieren oder aus dem Kontext…
- Echo Chamber — Von NeuralTrust beschriebene Kontextvergiftung: Harmlose „Saat"-Aussagen werden gesetzt und über mehrere Turns vom Modell selbst wiederholt, bis der…
- Many-Shot-Jailbreaking — Von Anthropic veröffentlichte Technik: Sehr viele fingierte Dialogbeispiele, in denen ein „Assistent" regelwidrig antwortet, werden in den Prompt…
Verwandte Begriffe
- Kontextfenster — Das Kontextfenster ist die maximale Textmenge, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann. In ihm liegen…
- In-Context-Learning — In-Context-Learning bezeichnet die Fähigkeit eines Modells, aus Beispielen im Prompt eine Aufgabe zu erschließen, ohne neu…
- Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es normalerweise…
Quellen
- Many-Shot-Jailbreaking — Beleg: https://www.anthropic.com/research/many-shot-jailbreaking