prompt injections.de
Glossar

Vertrauensgrenze

Eine Vertrauensgrenze ist die Linie, an der Daten aus einer weniger vertrauenswürdigen Quelle in einen geschützten Bereich übertreten. Prompt Injection ist im Kern das Problem, dass Sprachmodelle diese Grenze im Kontextfenster nicht erkennen können.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Prompt Injection, Kontextfenster, Spotlighting.

Bezug zu Prompt Injection

In klassischer Software wird die Grenze durch Typen, Parameter und Schnittstellen markiert; im Prompt existiert sie nur als Konvention, an die sich das Modell halten kann oder nicht. Alle wirksamen Architekturmaßnahmen — Dual-LLM-Muster, CaMeL, Spotlighting, StruQ — versuchen, diese Grenze technisch wiederherzustellen. Für den Entwurf lautet die nützliche Frage: An welcher Stelle betritt fremder Text mein System, und was darf er dort auslösen?

Beispiel

Der Text einer abgerufenen Webseite wird als Datenobjekt behandelt, das eine Ausgabe beeinflussen, aber keinen Werkzeugaufruf auslösen darf.

Verwandte Begriffe

  • Prompt Injection — Prompt Injection bezeichnet einen Angriff, bei dem eingeschleuster Text das Verhalten eines Sprachmodells entgegen der Absicht…
  • Kontextfenster — Das Kontextfenster ist die maximale Textmenge, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann. In ihm liegen…
  • Spotlighting — Spotlighting kennzeichnet externe Inhalte im Prompt eindeutig als Daten — durch Begrenzer, Markierungen oder Kodierung — damit…

Quellen

  1. Vertrauensgrenze — Beleg: https://genai.owasp.org/llmrisk/llm01-prompt-injection/