prompt injections.de
Glossar

Token

Ein Token ist die kleinste Verarbeitungseinheit eines Sprachmodells — meist ein Wortteil, seltener ein ganzes Wort oder ein Zeichen. Weil Modelle auf Token-Ebene arbeiten, lassen sich Filter über ungewöhnliche Schreibweisen und Zeichen umgehen.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Tokenisierung, Kontextfenster, Homoglyph.

Bezug zu Prompt Injection

Filter arbeiten meist auf Zeichenketten, das Modell auf Token — diese Lücke ist die Grundlage vieler Umgehungen. Wird ein gesperrtes Wort durch Sonderzeichen, Leerzeichen oder ähnlich aussehende Zeichen zerlegt, greift die Signatur nicht mehr, während das Modell die Bedeutung weiterhin rekonstruiert. Eingabeprüfung sollte deshalb nach einer Normalisierung des Textes erfolgen, nicht davor. Für die Praxis heißt das, Erkennung und Modell auf derselben Textfassung arbeiten zu lassen — sonst prüft der Filter etwas anderes, als das Modell liest.

Beispiel

Ein gesperrtes Schlüsselwort wird mit eingestreuten Zeichen ohne Breite geschrieben, passiert den Wortfilter und wird vom Modell dennoch als das ursprüngliche Wort gelesen.

Verwandte Begriffe

  • Tokenisierung — Die Tokenisierung zerlegt Text in die Einheiten, die ein Modell tatsächlich verarbeitet. Angriffe wie Homoglyphen- oder…
  • Kontextfenster — Das Kontextfenster ist die maximale Textmenge, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann. In ihm liegen…
  • Homoglyph — Ein Homoglyph ist ein Zeichen, das einem anderen optisch gleicht, aber einen anderen Codepunkt hat — etwa kyrillisches „а" statt…

Quellen

  1. Token — Beleg: https://github.com/openai/tiktoken