Token
Ein Token ist die kleinste Texteinheit, in die ein Text aufgeteilt wird, bevor er von einem Sprachmodell verarbeitet wird. Ein Token entspricht nicht immer einem ganzen Wort – es kann
auch Wortteile, Satzzeichen oder einzelne Buchstaben umfassen. Faustregel: 1 Token ≈ 0,75 Wörter (Englisch) oder ≈ 0,5–0,6 Wörter (Deutsch).
Tokenisierungsarten: wortbasiert (vollständige Wörter), Subword-Tokenisierung (Byte Pair Encoding, WordPiece – am häufigsten), zeichenbasiert (einzelne Buchstaben). Verarbeitung: Tokenisierung → numerische IDs → Einbettungen → Modellverarbeitung.
Bedeutung in der Praxis: Tokenanzahl bestimmt Kosten bei API-Nutzung, Kontextfenstergröße und Verarbeitungsgeschwindigkeit. Das Verständnis von Tokens ist essenziell für effizientes Prompt Engineering und die Kostenkalkulation beim Einsatz von LLM-APIs (Tokenomics).
Beispiel
Ein langer Vertrag verbraucht bei der Analyse mehrere tausend Tokens, was sich direkt in den Nutzungskosten des KI-Dienstes niederschlägt.