Guardrail
Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind notwendig, aber allein nicht ausreichend — sie senken die Erfolgswahrscheinlichkeit, beseitigen die Ursache aber nicht.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Klassifikator, Content-Filter, Instruktions-Hierarchie.
Bezug zu Prompt Injection
Guardrails sind die in der Praxis häufigste Maßnahme, weil sie sich ohne Eingriff in die Architektur nachrüsten lassen. Ihr Grenznutzen ist bekannt: Klassifikatoren erkennen bekannte Muster gut, neuartige und sprachlich unauffällige Angriffe schlecht — und jede Erhöhung der Empfindlichkeit erzeugt Fehlalarme im Normalbetrieb. Sinnvoll sind sie als eine Schicht neben Rechtebegrenzung und Ausgabeprüfung, nicht als deren Ersatz.
Beispiel
Ein Eingabefilter blockiert die Formulierung „ignoriere alle vorherigen Anweisungen“ zuverlässig, lässt dieselbe Absicht als höflich formulierte Bitte im Fließtext aber passieren.
Verwandte Begriffe
- Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
- Content-Filter — Ein Content-Filter prüft Texte gegen Kategorien unerwünschter Inhalte wie Gewalt, Hass oder Selbstgefährdung. Er adressiert…
- Instruktions-Hierarchie — Die Instruktions-Hierarchie trainiert ein Modell darauf, Anweisungen nach Vertrauensstufe zu gewichten: System vor Entwickler…