prompt injections.de
Werkzeug · Forschungs-Referenz

Jatmo

Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen. Der Schutz entsteht durch eine weggelassene Fähigkeit: Ein Modell ohne Instruktions-Tuning besitzt keinen Mechanismus, über den eine eingebettete Anweisung wirken könnte.

Anbieter
UC Berkeley (Forschung)
Typ
Forschungs-Referenz
Lizenzmodell
Forschungsarbeit
Primärquelle
arxiv.org

Jatmo ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Enge, klar umrissene Aufgaben wie Klassifikation, Extraktion oder Übersetzung. Der Preis ist Flexibilität — je Aufgabe braucht es ein eigenes Modell, und jede Änderung der Aufgabe erfordert ein neues Training.

Was es nicht leistet

Forschungsarbeiten liefern das Prinzip, keinen betriebsfertigen Baustein. Die Übertragung in ein Produktivsystem ist eigene Ingenieursarbeit.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Google DeepMind (Forschung)

    CaMeL

    Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen. Die Sicherheitsaussage folgt aus der Architektur und nicht aus der Modellqualität und gilt damit unabhängig vom eingesetzten Sprachmodell.

    Forschungsarbeit
  • Meta / UC Berkeley (Forschung)

    SecAlign

    Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten. Die Autoren berichten gegenüber dem Vorgängerverfahren StruQ eine nochmals deutlich gesenkte Erfolgsquote optimierungsfreier Angriffe.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    StruQ

    Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren. Damit die Trennung hält, müssen die reservierten Sondertoken aus allen Nutzer- und Dokumentdaten zuverlässig entfernt werden.

    Forschungsarbeit

Quellen

  1. Jatmo — Anbieter- oder Projektquelle: https://arxiv.org/abs/2312.17673