prompt injections.de
Werkzeug · Benchmark

HackAPrompt-Datensatz

Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet. Die Prompts stammen aus einem Wettbewerb und sind entsprechend auf dessen Aufgabenstellungen zugeschnitten.

Anbieter
Learn Prompting
Typ
Benchmark
Lizenzmodell
Open Source
Primärquelle
huggingface.co

HackAPrompt-Datensatz ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Trainings- und Testmaterial für eigene Erkennungsmodelle. Wer ausschließlich darauf trainiert, erhält einen Detektor, der die enthaltenen Muster gut erkennt und neue Formulierungen übersieht — der Datensatz taugt als Ergänzung, nicht als alleinige Grundlage.

Was es nicht leistet

Ein Benchmark misst unter definierten Bedingungen. Werte sind zwischen Systemen nur vergleichbar, wenn Aufbau und Angriffsmenge identisch sind.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • ETH Zürich (SPY Lab)

    AgentDojo

    Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst. Gemessen werden Nützlichkeit und Sicherheit gemeinsam, weil eine Abwehr wertlos ist, die den Agenten für seine eigentliche Aufgabe unbrauchbar macht.

    Open Source
  • University of Illinois (Kang Lab)

    InjecAgent

    Benchmark für indirekte Prompt Injection in werkzeugnutzenden Agenten, unterteilt in Angriffe auf Nutzerdaten und auf Nutzeraktionen. Die Unterteilung macht sichtbar, ob ein Angriff lediglich Daten abgreift oder den Agenten zu eigenen, folgenreichen Handlungen bringt.

    Open Source
  • Duke University (Forschung)

    Open-Prompt-Injection

    Offenes Framework zur systematischen Bewertung von Prompt-Injection-Angriffen und Abwehrmaßnahmen über mehrere Aufgaben und Modelle hinweg. Der modulare Aufbau erlaubt es, Angriffe und Abwehrmaßnahmen unabhängig voneinander auszutauschen und so einzelne Faktoren zu isolieren.

    Open Source