prompt injections.de
Glossar

Alignment

Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über Nachtraining mit menschlichem Feedback. Alignment ist eine statistische Neigung, keine durchsetzbare Regel — deshalb bleiben Jailbreaks möglich.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind RLHF, Constitutional AI, Jailbreak.

Bezug zu Prompt Injection

Für Betreiber ist die Abgrenzung wichtig, weil Alignment häufig mit Sicherheit verwechselt wird: Ein gut ausgerichtetes Modell verweigert unerwünschte Inhalte öfter, aber nicht zuverlässig — und es schützt gar nicht davor, dass eine Injektion die Aufgabe der Anwendung austauscht. Goal Hijacking funktioniert vollständig ohne Regelverstoß. Sicherheitsgarantien müssen deshalb außerhalb des Modells liegen. Nützlich ist die Faustregel, Alignment als Verringerung der Häufigkeit zu lesen und alles, was garantiert gelten muss, technisch außerhalb des Modells durchzusetzen.

Beispiel

Ein Modell weigert sich, Schadsoftware zu schreiben, versendet aber bereitwillig eine E-Mail mit angehängten Kundendaten, weil das keiner Inhaltsregel widerspricht.

Verwandte Begriffe

  • RLHF — RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes…
  • Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
  • Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es normalerweise…

Quellen

  1. Alignment — Beleg: https://arxiv.org/abs/2203.02155