Was ist Tokenisierung?
Tokenisierung ist der Prozess, bei dem Text in kleine Einheiten — sogenannte Tokens — zerlegt wird, damit ein Sprachmodell ihn verarbeiten kann. Sprachmodelle "lesen" nämlich keine Buchstaben oder ganze Wörter, sondern arbeiten mit diesen Bausteinen: Ein Token kann ein ganzes Wort sein ("Haus"), ein Wortteil ("Ver" + "sicher" + "ung") oder auch nur ein Satzzeichen. Als Faustregel gilt: Im Deutschen entspricht ein Token etwa 3 bis 4 Zeichen; deutsche Texte benötigen wegen langer Komposita meist mehr Tokens als vergleichbare englische Texte.
Jedem Token ist eine Nummer zugeordnet. Der Satz "KI verändert alles" wird also intern zu einer Zahlenfolge — erst diese Zahlen kann ein Large Language Model mathematisch verarbeiten.
Wie funktioniert Tokenisierung?
Moderne Modelle nutzen Subword-Tokenisierung, meist Varianten des Byte-Pair-Encoding (BPE):
- Vokabular-Erstellung: Vor dem Training wird analysiert, welche Zeichenfolgen in den Trainingsdaten besonders häufig vorkommen. Häufige Wörter erhalten ein eigenes Token, seltene Wörter werden in bekannte Bruchstücke zerlegt.
- Zerlegung: Der Tokenizer wandelt jeden Text deterministisch in eine Token-Sequenz um. "Donaudampfschifffahrt" wird beispielsweise in mehrere Teilstücke zerlegt, während "und" ein einzelnes Token ist.
- Rückumwandlung: Nach der Generierung werden die ausgegebenen Tokens wieder zu lesbarem Text zusammengesetzt.
- Kosten: KI-APIs rechnen pro Token ab, getrennt nach Eingabe- und Ausgabe-Tokens. Wer lange Dokumente verarbeitet, zahlt entsprechend mehr. Deutsche Texte sind wegen der höheren Token-Zahl oft teurer als englische.
- Kontextfenster: Das Kontextfenster eines Modells wird in Tokens gemessen. Ein Modell mit 128.000 Tokens Kontext kann grob 300 bis 400 Seiten deutschen Text auf einmal verarbeiten.
- Geschwindigkeit: Die Generierung erfolgt Token für Token — die Ausgabelänge bestimmt maßgeblich die Antwortzeit.
- Modell-Schwächen: Manche berühmten Fehler von Sprachmodellen (Buchstaben zählen, Wörter rückwärts buchstabieren) entstehen direkt durch die Tokenisierung: Das Modell "sieht" keine einzelnen Buchstaben, sondern nur Token-Blöcke.
Der Vorteil dieses Ansatzes: Das Modell kommt mit einem begrenzten Vokabular (typisch 50.000 bis 200.000 Tokens) aus und kann trotzdem jedes beliebige Wort darstellen — auch Tippfehler, Fachbegriffe und fremde Sprachen.
Warum Tokenisierung in der Praxis wichtig ist
Tokens sind die zentrale Recheneinheit der KI-Welt — mit direkten praktischen Folgen:
Bedeutung für Unternehmen
Für Unternehmen, die KI-Anwendungen betreiben, ist Token-Verständnis bares Geld wert. Wer Kosten optimieren will, sollte Prompts straffen, unnötigen Kontext vermeiden und die Token-Zahlen seiner typischen Anfragen kennen — die Anbieter stellen dafür Tokenizer-Tools bereit, mit denen sich Texte vorab analysieren lassen. Bei der Modellwahl lohnt der Blick auf den Preis pro Million Tokens: Zwischen kleinen und großen Modellen liegen oft Faktoren von 10 bis 100. Und wer Dokumenten-Workflows plant, muss prüfen, ob die Texte überhaupt ins Kontextfenster des gewählten Modells passen.
Passende KI-Tools
Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff Tokenisierung:
Claude
KritischAnthropics KI mit 1M Token Context und überlegener Coding-Qualität
HeyGen
Kritisch4.8/5 - AI Avatars in 175 Sprachen
Fireflies
Kritisch116 Sprachen! - Besser als Otter
Luma Dream Machine
KritischCinematische KI-Videogenerierung auf Hollywood-Niveau von Luma AI
ChatGPT
KritischDas führende KI-Sprachmodell für Konversation und Produktivität
GitHub Copilot
KritischMarktführer mit 15M Usern - spart 2h/Woche