Grundbegriffe

Tokenisierung

Tokenisierung ist der Prozess, bei dem Text in kleine Einheiten (Tokens) zerlegt wird, die ein Sprachmodell verarbeiten kann. Ein Token entspricht etwa 3-4 Zeichen auf Deutsch. Das Wort "Tokenisierung" wäre mehrere Tokens. Tokenisierung beeinflusst direkt die Kosten bei API-Nutzung (Preis pro Token) und das Kontextfenster eines Modells.

Was ist Tokenisierung?

Tokenisierung ist der Prozess, bei dem Text in kleine Einheiten — sogenannte Tokens — zerlegt wird, damit ein Sprachmodell ihn verarbeiten kann. Sprachmodelle "lesen" nämlich keine Buchstaben oder ganze Wörter, sondern arbeiten mit diesen Bausteinen: Ein Token kann ein ganzes Wort sein ("Haus"), ein Wortteil ("Ver" + "sicher" + "ung") oder auch nur ein Satzzeichen. Als Faustregel gilt: Im Deutschen entspricht ein Token etwa 3 bis 4 Zeichen; deutsche Texte benötigen wegen langer Komposita meist mehr Tokens als vergleichbare englische Texte.

Jedem Token ist eine Nummer zugeordnet. Der Satz "KI verändert alles" wird also intern zu einer Zahlenfolge — erst diese Zahlen kann ein Large Language Model mathematisch verarbeiten.

Wie funktioniert Tokenisierung?

Moderne Modelle nutzen Subword-Tokenisierung, meist Varianten des Byte-Pair-Encoding (BPE):

  • Vokabular-Erstellung: Vor dem Training wird analysiert, welche Zeichenfolgen in den Trainingsdaten besonders häufig vorkommen. Häufige Wörter erhalten ein eigenes Token, seltene Wörter werden in bekannte Bruchstücke zerlegt.
  • Zerlegung: Der Tokenizer wandelt jeden Text deterministisch in eine Token-Sequenz um. "Donaudampfschifffahrt" wird beispielsweise in mehrere Teilstücke zerlegt, während "und" ein einzelnes Token ist.
  • Rückumwandlung: Nach der Generierung werden die ausgegebenen Tokens wieder zu lesbarem Text zusammengesetzt.
  • Der Vorteil dieses Ansatzes: Das Modell kommt mit einem begrenzten Vokabular (typisch 50.000 bis 200.000 Tokens) aus und kann trotzdem jedes beliebige Wort darstellen — auch Tippfehler, Fachbegriffe und fremde Sprachen.

    Warum Tokenisierung in der Praxis wichtig ist

    Tokens sind die zentrale Recheneinheit der KI-Welt — mit direkten praktischen Folgen:

  • Kosten: KI-APIs rechnen pro Token ab, getrennt nach Eingabe- und Ausgabe-Tokens. Wer lange Dokumente verarbeitet, zahlt entsprechend mehr. Deutsche Texte sind wegen der höheren Token-Zahl oft teurer als englische.
  • Kontextfenster: Das Kontextfenster eines Modells wird in Tokens gemessen. Ein Modell mit 128.000 Tokens Kontext kann grob 300 bis 400 Seiten deutschen Text auf einmal verarbeiten.
  • Geschwindigkeit: Die Generierung erfolgt Token für Token — die Ausgabelänge bestimmt maßgeblich die Antwortzeit.
  • Modell-Schwächen: Manche berühmten Fehler von Sprachmodellen (Buchstaben zählen, Wörter rückwärts buchstabieren) entstehen direkt durch die Tokenisierung: Das Modell "sieht" keine einzelnen Buchstaben, sondern nur Token-Blöcke.

Bedeutung für Unternehmen

Für Unternehmen, die KI-Anwendungen betreiben, ist Token-Verständnis bares Geld wert. Wer Kosten optimieren will, sollte Prompts straffen, unnötigen Kontext vermeiden und die Token-Zahlen seiner typischen Anfragen kennen — die Anbieter stellen dafür Tokenizer-Tools bereit, mit denen sich Texte vorab analysieren lassen. Bei der Modellwahl lohnt der Blick auf den Preis pro Million Tokens: Zwischen kleinen und großen Modellen liegen oft Faktoren von 10 bis 100. Und wer Dokumenten-Workflows plant, muss prüfen, ob die Texte überhaupt ins Kontextfenster des gewählten Modells passen.

Passende KI-Tools

Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff Tokenisierung: