Sofortantwort
Tokenizer einfach erklärt
Algorithmen zerlegen Text in Tokens, wie BPE und SentencePiece.
- Kurz gesagt
- BPE: Lernt häufige Zeichenpaare und fasst sie zusammen – Bottom-up Ansatz
- Typischer Einsatz
- LLM-Preprocessing, Kosten-Berechnung, Multilinguale Modelle
- Wichtig zu wissen
- Vokabulargröße (32K-100K Tokens) beeinflusst Effizienz und Qualität
Tokenizer im Überblick
LLMs lesen keinen Text – sie lesen Zahlen. Der Tokenizer ist der Übersetzer, der Text in eine Sequenz von Token-IDs umwandelt.
Wie funktioniert das?
Häufige Wörter wie “the” bleiben ganz. Seltene Wörter werden in Teile zerlegt:
Text: "Künstliche Intelligenz"
Tokens: ["Kün", "st", "liche", " Int", "ell", "igenz"]
IDs: [42891, 267, 12994, 2558, 484, 23456]
Warum nicht einfach Wörter als Tokens?
- Wörter-Vokabular wäre riesig (Millionen Wörter)
- Unbekannte Wörter könnten nicht verarbeitet werden
- BPE löst das: Festes Vokabular (32K-100K), jedes Wort aus Sub-Tokens zusammensetzbar
Praxis-Tipp:
Deutsche Texte brauchen oft mehr Tokens als englische – die meisten Tokenizer wurden auf Englisch trainiert. “Datenschutzgrundverordnung” wird in viele Sub-Tokens zerlegt, während “privacy” ein Token ist.
Warum ist das wichtig?
API-Kosten werden pro Token berechnet. Mehr Tokens = höhere Kosten. Ein effizienter Tokenizer spart Geld.
Technisch betrachtet
BPE (Byte Pair Encoding)
- Starte mit einzelnen Zeichen als Vokabular
- Finde das häufigste Zeichenpaar → Füge als neues Token hinzu
- Wiederhole bis Vokabulargröße erreicht
Schritt 1: ['t', 'h', 'e'] → 'th' kommt oft vor → neues Token 'th'
Schritt 2: ['th', 'e'] → 'the' kommt oft vor → neues Token 'the'
...
Ergebnis: Häufige Wörter = 1 Token, seltene = mehrere Sub-Tokens
SentencePiece
- Arbeitet direkt auf Rohtext (kein Pre-Tokenizing nötig)
- Behandelt Leerzeichen als normales Zeichen (▁)
- Sprachunabhängig – funktioniert für Japanisch genauso wie für Deutsch
- Standard für LLaMA, Mistral, T5
Vokabulargröße
| Modell | Tokenizer | Vokabular |
|---|---|---|
| GPT-5 | o200k_base (BPE) | 200.019 |
| LLaMA 2 | SentencePiece | 32.000 |
| Mistral | SentencePiece | 32.000 |
| Gemma | SentencePiece | 256.000 |