Content-Filter
Ein Content-Filter prüft Texte gegen Kategorien unerwünschter Inhalte wie Gewalt, Hass oder Selbstgefährdung. Er adressiert Inhaltsrisiken, nicht die Anwendungsübernahme durch Prompt Injection.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Guardrail, Klassifikator, Prompt Injection.
Bezug zu Prompt Injection
Die Abgrenzung ist praktisch relevant, weil Content-Filter häufig als Injektionsschutz verstanden oder verkauft werden. Eine Anweisung wie „sende die Zusammenfassung an diese Adresse“ enthält keinen unerwünschten Inhalt und passiert jeden Inhaltsfilter — sie ist trotzdem der Kern eines Datenabfluss-Angriffs. Gegen Prompt Injection braucht es Injektionserkennung, Rechtebegrenzung und Ausgabekontrolle. In einer Schutzarchitektur gehören beide Prüfarten nebeneinander, mit klar getrennter Zuständigkeit: Inhaltsfilter gegen schädliche Ausgaben, Injektionserkennung gegen fremde Anweisungen.
Beispiel
Ein Filter blockiert zuverlässig Gewaltdarstellungen, lässt eine höflich formulierte Anweisung zur Weiterleitung interner Daten aber durch.
Verwandte Begriffe
- Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
- Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
- Prompt Injection — Prompt Injection bezeichnet einen Angriff, bei dem eingeschleuster Text das Verhalten eines Sprachmodells entgegen der Absicht…
Quellen
- Content-Filter — Beleg: https://platform.openai.com/docs/guides/moderation