CaMeL
Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen. Die Sicherheitsaussage folgt aus der Architektur und nicht aus der Modellqualität und gilt damit unabhängig vom eingesetzten Sprachmodell.
- Anbieter
- Google DeepMind (Forschung)
- Typ
- Forschungs-Referenz
- Lizenzmodell
- Forschungsarbeit
- Primärquelle
- github.com
CaMeL ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.
Wofür es sich eignet
Vorbild für Agenten-Architekturen, die Sicherheit nicht dem Modell überlassen, sondern einer deterministischen Policy-Schicht. Es handelt sich um eine Forschungsreferenz, nicht um ein einsatzfertiges Produkt: Aufgaben, deren Ablauf sich erst aus den Daten ergibt, lassen sich nur eingeschränkt abbilden.
Was es nicht leistet
Forschungsarbeiten liefern das Prinzip, keinen betriebsfertigen Baustein. Die Übertragung in ein Produktivsystem ist eigene Ingenieursarbeit.
Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.
Vergleichbare Werkzeuge
-
SecAlign
Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten. Die Autoren berichten gegenüber dem Vorgängerverfahren StruQ eine nochmals deutlich gesenkte Erfolgsquote optimierungsfreier Angriffe.
Forschungsarbeit -
StruQ
Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren. Damit die Trennung hält, müssen die reservierten Sondertoken aus allen Nutzer- und Dokumentdaten zuverlässig entfernt werden.
Forschungsarbeit -
Jatmo
Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen. Der Schutz entsteht durch eine weggelassene Fähigkeit: Ein Modell ohne Instruktions-Tuning besitzt keinen Mechanismus, über den eine eingebettete Anweisung wirken könnte.
Forschungsarbeit
Quellen
- CaMeL — Anbieter- oder Projektquelle: https://github.com/google-research/camel-prompt-injection