prompt injections.de
Werkzeug · Scanner

garak

Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination. Die Prüfmodule sind einzeln wählbar und liefern einen Bericht je Angriffsklasse, was den Vergleich über Modellversionen hinweg erleichtert.

Anbieter
NVIDIA
Typ
Scanner
Lizenzmodell
Open Source
Primärquelle
github.com

garak ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Automatisierte Modellprüfung in der CI-Pipeline vor jedem Modell- oder Prompt-Wechsel. Ein vollständiger Lauf erzeugt viele Modellaufrufe und damit Kosten und Laufzeit; für die CI empfiehlt sich eine feste Teilmenge. Wie jeder Scanner misst er nur, was seine Module abdecken.

Was es nicht leistet

Ein Scanner findet, wonach er sucht. Er belegt keine Sicherheit, sondern die Abwesenheit der geprüften Schwachstellen zum Prüfzeitpunkt.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Vigil (Adam Swanda)

    Vigil

    Python-Bibliothek und REST-API zur Erkennung riskanter LLM-Eingaben — kombiniert Vektorsuche, YARA-Regeln, Transformer-Modell und Canary-Tokens. Die Signaturen lassen sich an eigene Anwendungsfälle anpassen, was das Werkzeug flexibler macht als reine Modellklassifikatoren.

    Open Source
  • Invariant Labs

    mcp-scan

    Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht. Es vergleicht Tool-Beschreibungen zusätzlich gegen einen festgehaltenen Stand und meldet nachträgliche Änderungen, mit denen ein zunächst harmloser Server später Anweisungen nachschiebt.

    Open Source
  • Giskard

    Giskard

    Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt. Die erzeugten Berichte sind auf Nachvollziehbarkeit ausgelegt und eignen sich als Grundlage für Freigabeentscheidungen.

    Open Source

Quellen

  1. garak — Anbieter- oder Projektquelle: https://github.com/NVIDIA/garak