Constitutional AI
Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht, statt allein auf menschliche Einzelurteile zu setzen. Der Ansatz stammt von Anthropic und wurde später um vorgeschaltete Klassifikatoren ergänzt.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Alignment, RLHF, Constitutional Classifiers.
Bezug zu Prompt Injection
Für die Abwehr ist der Ansatz relevant, weil er Regeln explizit macht: Ein schriftlich fixierter Prinzipienkatalog lässt sich prüfen, versionieren und in einem Audit vorlegen — anders als implizit gelernte Präferenzen. Er bleibt jedoch ein Trainingsverfahren und damit statistisch. Anthropic ergänzte ihn später um vorgeschaltete Klassifikatoren, weil Training allein universelle Jailbreaks nicht verhinderte. Für Betreiber ist der übertragbare Teil weniger das Training als das Vorgehen: Regeln ausformulieren und prüfbar machen, statt sie im Prompt nur anzudeuten.
Beispiel
Ein Modell prüft seinen eigenen Antwortentwurf gegen den Grundsatz „keine Anleitungen zu Angriffen gegen Dritte“ und formuliert ihn vor der Ausgabe um.
Verwandte Begriffe
- Alignment — Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über…
- RLHF — RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes…
- Constitutional Classifiers — Constitutional Classifiers sind dem Modell vor- und nachgeschaltete Prüfmodelle, die anhand explizit formulierter Regeln über…
Quellen
- Constitutional AI — Beleg: https://arxiv.org/abs/2212.08073