Tokens

Die Recheneinheiten eines Sprachmodells

Die kleinsten Texteinheiten, in die ein Sprachmodell Text zerlegt – Wörter, Wortteile oder einzelne Zeichen, die das Modell verarbeiten kann.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Text wird vor der Verarbeitung in Tokens zerlegt (Tokenisierung)
  2. Ein Token ist nicht immer ein ganzes Wort – häufig sind es Wortteile oder Zeichen
  3. Die Anzahl der Tokens bestimmt Kosten und Kontextlänge bei LLM-APIs

Sofortantwort

Tokens einfach erklärt

Texteinheiten, die ein Sprachmodell verarbeiten kann.

Kurz gesagt
Text wird vor der Verarbeitung in Tokens zerlegt (Tokenisierung)
Typischer Einsatz
API-Kostenberechnung, Kontextmanagement, Textanalyse
Wichtig zu wissen
Die Anzahl der Tokens bestimmt Kosten und Kontextlänge bei LLM-APIs

Tokens im Überblick

Tokens sind die Grundbausteine, mit denen Sprachmodelle Text verarbeiten. Bevor ein LLM einen Text lesen oder schreiben kann, wird der Text in Tokens zerlegt – dieser Vorgang heißt Tokenisierung.

Was ist ein Token?

Ein Token kann sein:

  • Ein ganzes Wort: “Hallo” → [Hallo]
  • Ein Wortteil: “unglaublich” → [un][glaub][lich]
  • Ein Satzzeichen: ”!” → [!]
  • Ein Leerzeichen oder Sonderzeichen

Warum sind Tokens wichtig?

  1. Kosten: API-Anbieter berechnen pro Token – Input und Output separat
  2. Kontextlänge: Jedes Modell hat ein maximales Token-Limit – von einigen zehntausend Tokens bis in den Millionenbereich
  3. Geschwindigkeit: Mehr Tokens = längere Verarbeitungszeit
  4. Qualität: Die Tokenisierung beeinflusst, wie gut ein Modell eine Sprache versteht

Faustregel für Deutsch:

  • 1 Token ≈ 0,6 - 0,8 Wörter (deutsch)
  • 1 Token ≈ 0,75 Wörter (englisch)
  • 1 Seite Text ≈ 500-700 Tokens
  • 1.000 Tokens ≈ 600-800 deutsche Wörter

Technisch betrachtet

Tokenisierungsverfahren

Byte Pair Encoding (BPE):

  • Standard bei GPT-Modellen (via tiktoken)
  • Startet mit einzelnen Bytes/Zeichen
  • Mergt iterativ die häufigsten Paare zu neuen Tokens
  • Vokabulargröße: typisch 32K-100K Tokens

WordPiece:

  • Verwendet von BERT und ähnlichen Modellen
  • Ähnlich wie BPE, aber nutzt Likelihood statt Häufigkeit für Merges
  • Markiert Wortfortsetzungen mit ”##” (z.B. “spielen” → “spiel” + “##en”)

SentencePiece (Unigram):

  • Verwendet von Llama, T5, Gemini
  • Startet mit großem Vokabular und reduziert es
  • Sprachunabhängig – arbeitet direkt auf Unicode

Tokenisierung in der Praxis

Beispiel (GPT-4 Tokenizer):

"Künstliche Intelligenz verändert die Welt"
-> ["K", "ünst", "liche", " Intell", "igenz", " ver", "ändert", " die", " Welt"]
-> 9 Tokens

Vergleich Deutsch vs. Englisch:

"Artificial Intelligence" → 2 Tokens
"Künstliche Intelligenz"  → 5 Tokens

Deutsche Texte verbrauchen ca. 30-50% mehr Tokens als englische, weil:

  • Zusammengesetzte Wörter häufiger sind
  • Umlaute und Sonderzeichen extra Tokens brauchen
  • Tokenizer primär auf englischen Daten trainiert wurden

Spezielle Tokens

Neben Text-Tokens gibt es spezielle Steuerungs-Tokens:

  • BOS (Beginning of Sequence): Markiert den Anfang
  • EOS (End of Sequence): Markiert das Ende
  • PAD: Füllt kürzere Sequenzen auf gleiche Länge auf
  • UNK: Unbekannte Tokens (bei älteren Tokenizern)
  • System/User/Assistant: Chat-Rollen-Tokens bei Instruction-Modellen

Token-Limits und Strategien

Kontextfenster im Vergleich (Stand Juli 2026, ändert sich mit jeder Modellgeneration):

  • GPT-5.6: mehrere hunderttausend Tokens
  • Claude Sonnet 4.6: bis 1M Tokens
  • Gemini 3.5 Pro: bis 2M Tokens
  • Llama 4 Scout: bis 10M Tokens (nutzbare Qualität sinkt bei sehr langen Kontexten)

Strategien bei Token-Limits:

  • Zusammenfassung: Ältere Konversationsteile zusammenfassen
  • RAG: Nur relevante Dokumente in den Kontext laden
  • Sliding Window: Nur die letzten N Tokens behalten
  • Chunking: Lange Dokumente in Teile aufteilen und separat verarbeiten

Kosten-Optimierung

  • Kürzere, präzisere Prompts schreiben
  • System-Prompts minimieren
  • Caching für wiederkehrende Anfragen
  • Kleinere Modelle für einfache Aufgaben nutzen
  • Output-Tokens begrenzen (max_tokens Parameter)

Schritt für Schritt

Wie Text zu Tokens wird

Bevor ein Sprachmodell Text verarbeitet, zerlegt ein Tokenizer ihn in Einheiten aus seinem eigenen Vokabular.

  1. Text lesen

    Eingabe

    Der Tokenizer erhält einen String mit Wörtern, Leerzeichen, Satzzeichen und Sonderzeichen.

    Text → Zeichenfolge
  2. Passende Bausteine wählen

    Tokenisierung

    Er sucht die längsten oder wahrscheinlichsten Teile, die in seinem Vokabular vorkommen. Ein Wort kann dabei mehrere Tokens ergeben.

    unglaublich → un + glaub + lich
  3. IDs an das Modell geben

    Kodierung

    Jedes Token wird durch eine Zahl repräsentiert. Erst diese IDs kann ein Modell in Vektoren übersetzen und weiterverarbeiten.

    Tokens → IDs → Embeddings
  4. Antwort wieder zusammensetzen

    Dekodierung

    Beim Generieren wandelt der Tokenizer die vorhergesagten IDs wieder in lesbaren Text um.

    IDs → Tokens → Text

Konkretes Beispiel

Warum Textlänge nicht gleich Tokenzahl ist

Zwei ähnlich lange Sätze können für ein Modell unterschiedlich teuer sein.

Lesbare Zeichen zählen

Eine Zeichen- oder Wortzählung sieht nur die sichtbare Länge. Sie erkennt nicht, wie das konkrete Modell Wörter, Leerzeichen und Sonderzeichen zerlegt.

Mit dem passenden Tokenizer rechnen

Der Modell-Tokenizer zeigt die tatsächlichen Eingabe- und Ausgabe-Tokens. Erst diese Zahl ist für Kontextlimit, Geschwindigkeit und API-Abrechnung maßgeblich.

Ein Token ist keine feste Spracheinheit. Seine Größe hängt vom verwendeten Tokenizer und damit vom jeweiligen Modell ab.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Subword-Tokens bilden seltene Wörter und neue Zusammensetzungen mit einem begrenzten Vokabular ab.
  • Die Tokenzahl gibt eine gemeinsame Recheneinheit für Kontext, Kosten und Modellarbeit.
  • Tokenisierung macht Text für Modelle unabhängig von sichtbaren Wortgrenzen verarbeitbar.
  • Spezialisierte Tokenizer können mehrere Sprachen und Zeichensysteme effizient behandeln.

Das solltest du beachten

  • Die Tokenzahl ist für Menschen nicht intuitiv und variiert zwischen Modellen.
  • Ungünstige Zerlegung kann einzelne Sprachen, Namen oder Fachbegriffe benachteiligen.
  • Lange Prompts verbrauchen Kontext und erhöhen Kosten, auch wenn sie kurz wirken.
  • Tokenlimits verlangen bewusste Auswahl, Kürzung oder Zusammenfassung von Kontext.
Vertiefung · für Fortgeschrittene

Vom Text zur Modell-Eingabe

Der Tokenizer ist die Übersetzungsschicht zwischen lesbarem Text und den Vektoren, mit denen ein Sprachmodell rechnet.

Wissenskarte

Text zerlegen

Der Tokenizer wählt Einheiten aus seinem Vokabular, kodiert sie als IDs und ermöglicht so die weitere Verarbeitung durch das Modell. Tokenizer gliedert sich in: Text, Vokabular, Tokens, Token-IDs, Embeddings.

01Einsatzbereiche

Wann ist Tokens sinnvoll?

Geeignet für

  • API-KostenberechnungOpenAI und andere Anbieter berechnen Kosten pro verarbeiteten Token
  • KontextmanagementEntwickler müssen Token-Limits beachten, wenn sie Prompts für LLMs erstellen
  • TextanalyseTokenisierung ist der erste Schritt bei jeder NLP-Aufgabe
  • Mehrsprachige VerarbeitungTokenizer müssen verschiedene Sprachen und Schriftsysteme effizient abbilden

↑ Inhalt

02Werkzeuge

Womit Tokens umgesetzt wird

↑ Inhalt

Merksatz

Tokens sind wie Legosteine für Sprache

Ein Wort wie 'unglaublich' wird in kleinere Bausteine zerlegt ('un', 'glaub', 'lich'), die das Modell einzeln verarbeitet und wieder zusammensetzt.

  1. Text wird vor der Verarbeitung in Tokens zerlegt (Tokenisierung)
  2. Ein Token ist nicht immer ein ganzes Wort – häufig sind es Wortteile oder Zeichen
  3. Die Anzahl der Tokens bestimmt Kosten und Kontextlänge bei LLM-APIs

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Tokens spielt.

↑ Inhalt

04Anwenden

Tokens praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Tokens

Wie viele Tokens hat ein deutsches Wort?

Im Durchschnitt 1-3 Tokens. Kurze, häufige Wörter wie 'und' oder 'ist' sind oft ein Token. Längere oder seltenere Wörter werden in Teile zerlegt. Deutsche Wörter brauchen tendenziell mehr Tokens als englische, da die Tokenizer meist auf englischen Texten trainiert wurden.

Warum werden Wörter in Teile zerlegt?

Subword-Tokenisierung ist ein Kompromiss: Ein Tokenizer mit ganzen Wörtern bräuchte ein riesiges Vokabular und könnte unbekannte Wörter nicht verarbeiten. Einzelne Buchstaben wären zu feingranular. Subwords bieten die beste Balance zwischen Vokabulargröße und Ausdruckskraft.

Was kostet ein Token bei der OpenAI API?

Die Preise variieren stark je nach Modell und werden pro Million Tokens abgerechnet, wobei Output meist deutlich teurer ist als Input. Kleinere Schnell-Modelle liegen im niedrigen einstelligen Dollarbereich, Frontier-Modelle deutlich darüber. Da sich Preise regelmäßig ändern, lohnt der Blick in die aktuelle Preisliste des Anbieters. Eine typische Seite Text hat ca. 500-700 Tokens.

Was passiert, wenn das Token-Limit erreicht ist?

Das Modell kann keine weiteren Tokens verarbeiten. Bei Chat-Anwendungen werden ältere Nachrichten abgeschnitten. Entwickler müssen Strategien wie Zusammenfassung oder RAG nutzen, um mit langen Konversationen umzugehen.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Temperatur

    Ein Parameter, der die Kreativität der Textausgabe eines Modells beeinflusst.

  • Technisch vertiefen

    Large Language Model

    Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.

  • In der Praxis anwenden

    ChatGPT Alternativen im Vergleich 2026

    Claude, Gemini, Copilot, Perplexity oder Le Chat – welche ChatGPT-Alternative passt zu dir?

↑ Inhalt