Sofortantwort
Tokens einfach erklärt
Texteinheiten, die ein Sprachmodell verarbeiten kann.
- Kurz gesagt
- Text wird vor der Verarbeitung in Tokens zerlegt (Tokenisierung)
- Typischer Einsatz
- API-Kostenberechnung, Kontextmanagement, Textanalyse
- Wichtig zu wissen
- Die Anzahl der Tokens bestimmt Kosten und Kontextlänge bei LLM-APIs
Tokens im Überblick
Tokens sind die Grundbausteine, mit denen Sprachmodelle Text verarbeiten. Bevor ein LLM einen Text lesen oder schreiben kann, wird der Text in Tokens zerlegt – dieser Vorgang heißt Tokenisierung.
Was ist ein Token?
Ein Token kann sein:
- Ein ganzes Wort: “Hallo” →
[Hallo] - Ein Wortteil: “unglaublich” →
[un][glaub][lich] - Ein Satzzeichen: ”!” →
[!] - Ein Leerzeichen oder Sonderzeichen
Warum sind Tokens wichtig?
- Kosten: API-Anbieter berechnen pro Token – Input und Output separat
- Kontextlänge: Jedes Modell hat ein maximales Token-Limit – von einigen zehntausend Tokens bis in den Millionenbereich
- Geschwindigkeit: Mehr Tokens = längere Verarbeitungszeit
- Qualität: Die Tokenisierung beeinflusst, wie gut ein Modell eine Sprache versteht
Faustregel für Deutsch:
- 1 Token ≈ 0,6 - 0,8 Wörter (deutsch)
- 1 Token ≈ 0,75 Wörter (englisch)
- 1 Seite Text ≈ 500-700 Tokens
- 1.000 Tokens ≈ 600-800 deutsche Wörter
Technisch betrachtet
Tokenisierungsverfahren
Byte Pair Encoding (BPE):
- Standard bei GPT-Modellen (via tiktoken)
- Startet mit einzelnen Bytes/Zeichen
- Mergt iterativ die häufigsten Paare zu neuen Tokens
- Vokabulargröße: typisch 32K-100K Tokens
WordPiece:
- Verwendet von BERT und ähnlichen Modellen
- Ähnlich wie BPE, aber nutzt Likelihood statt Häufigkeit für Merges
- Markiert Wortfortsetzungen mit ”##” (z.B. “spielen” → “spiel” + “##en”)
SentencePiece (Unigram):
- Verwendet von Llama, T5, Gemini
- Startet mit großem Vokabular und reduziert es
- Sprachunabhängig – arbeitet direkt auf Unicode
Tokenisierung in der Praxis
Beispiel (GPT-4 Tokenizer):
"Künstliche Intelligenz verändert die Welt"
-> ["K", "ünst", "liche", " Intell", "igenz", " ver", "ändert", " die", " Welt"]
-> 9 Tokens
Vergleich Deutsch vs. Englisch:
"Artificial Intelligence" → 2 Tokens
"Künstliche Intelligenz" → 5 Tokens
Deutsche Texte verbrauchen ca. 30-50% mehr Tokens als englische, weil:
- Zusammengesetzte Wörter häufiger sind
- Umlaute und Sonderzeichen extra Tokens brauchen
- Tokenizer primär auf englischen Daten trainiert wurden
Spezielle Tokens
Neben Text-Tokens gibt es spezielle Steuerungs-Tokens:
- BOS (Beginning of Sequence): Markiert den Anfang
- EOS (End of Sequence): Markiert das Ende
- PAD: Füllt kürzere Sequenzen auf gleiche Länge auf
- UNK: Unbekannte Tokens (bei älteren Tokenizern)
- System/User/Assistant: Chat-Rollen-Tokens bei Instruction-Modellen
Token-Limits und Strategien
Kontextfenster im Vergleich (Stand Juli 2026, ändert sich mit jeder Modellgeneration):
- GPT-5.6: mehrere hunderttausend Tokens
- Claude Sonnet 4.6: bis 1M Tokens
- Gemini 3.5 Pro: bis 2M Tokens
- Llama 4 Scout: bis 10M Tokens (nutzbare Qualität sinkt bei sehr langen Kontexten)
Strategien bei Token-Limits:
- Zusammenfassung: Ältere Konversationsteile zusammenfassen
- RAG: Nur relevante Dokumente in den Kontext laden
- Sliding Window: Nur die letzten N Tokens behalten
- Chunking: Lange Dokumente in Teile aufteilen und separat verarbeiten
Kosten-Optimierung
- Kürzere, präzisere Prompts schreiben
- System-Prompts minimieren
- Caching für wiederkehrende Anfragen
- Kleinere Modelle für einfache Aufgaben nutzen
- Output-Tokens begrenzen (max_tokens Parameter)
Schritt für Schritt
Wie Text zu Tokens wird
Bevor ein Sprachmodell Text verarbeitet, zerlegt ein Tokenizer ihn in Einheiten aus seinem eigenen Vokabular.
Text lesen
Eingabe
Der Tokenizer erhält einen String mit Wörtern, Leerzeichen, Satzzeichen und Sonderzeichen.
Text → ZeichenfolgePassende Bausteine wählen
Tokenisierung
Er sucht die längsten oder wahrscheinlichsten Teile, die in seinem Vokabular vorkommen. Ein Wort kann dabei mehrere Tokens ergeben.
unglaublich → un + glaub + lichIDs an das Modell geben
Kodierung
Jedes Token wird durch eine Zahl repräsentiert. Erst diese IDs kann ein Modell in Vektoren übersetzen und weiterverarbeiten.
Tokens → IDs → EmbeddingsAntwort wieder zusammensetzen
Dekodierung
Beim Generieren wandelt der Tokenizer die vorhergesagten IDs wieder in lesbaren Text um.
IDs → Tokens → Text
Konkretes Beispiel
Warum Textlänge nicht gleich Tokenzahl ist
Zwei ähnlich lange Sätze können für ein Modell unterschiedlich teuer sein.
Lesbare Zeichen zählen
Eine Zeichen- oder Wortzählung sieht nur die sichtbare Länge. Sie erkennt nicht, wie das konkrete Modell Wörter, Leerzeichen und Sonderzeichen zerlegt.
Mit dem passenden Tokenizer rechnen
Der Modell-Tokenizer zeigt die tatsächlichen Eingabe- und Ausgabe-Tokens. Erst diese Zahl ist für Kontextlimit, Geschwindigkeit und API-Abrechnung maßgeblich.
Ein Token ist keine feste Spracheinheit. Seine Größe hängt vom verwendeten Tokenizer und damit vom jeweiligen Modell ab.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Subword-Tokens bilden seltene Wörter und neue Zusammensetzungen mit einem begrenzten Vokabular ab.
- Die Tokenzahl gibt eine gemeinsame Recheneinheit für Kontext, Kosten und Modellarbeit.
- Tokenisierung macht Text für Modelle unabhängig von sichtbaren Wortgrenzen verarbeitbar.
- Spezialisierte Tokenizer können mehrere Sprachen und Zeichensysteme effizient behandeln.
Das solltest du beachten
- Die Tokenzahl ist für Menschen nicht intuitiv und variiert zwischen Modellen.
- Ungünstige Zerlegung kann einzelne Sprachen, Namen oder Fachbegriffe benachteiligen.
- Lange Prompts verbrauchen Kontext und erhöhen Kosten, auch wenn sie kurz wirken.
- Tokenlimits verlangen bewusste Auswahl, Kürzung oder Zusammenfassung von Kontext.
Vertiefung · für FortgeschritteneVom Text zur Modell-Eingabe
Der Tokenizer ist die Übersetzungsschicht zwischen lesbarem Text und den Vektoren, mit denen ein Sprachmodell rechnet.
Text zerlegen