Kosten & ROI7 Min. Lesezeit
Was sind Tokens bei LLMs? Einfach erklärt
Was Tokens bei LLMs sind, wie Text zerlegt wird, warum Sprachen und Formate sich unterscheiden und wie Tokens Kontextgrenzen, Tempo und API-Kosten bestimmen.
Veröffentlicht
Ein Token ist die grundlegende Texteinheit, die ein großes Sprachmodell (LLM) liest und erzeugt. Bevor ein Modell Ihren Prompt sieht, wird der Text in Tokens zerlegt: Häufige Wörter sind oft ein einzelnes Token, längere oder seltenere Wörter werden in mehrere Teile zerlegt, und auch Leerzeichen, Satzzeichen und Zahlen sind Tokens oder Teile davon. Bei gewöhnlichem englischem Text entspricht ein Token etwa vier Zeichen oder drei Vierteln eines Wortes. Praktisch wichtig sind Tokens, weil sie bestimmen, was eine Anfrage kostet, wie viel Text in das Kontextfenster des Modells passt und wie lange eine Antwort dauert.
Warum Modelle Tokens statt Wörter oder Buchstaben nutzen
Ein Modell braucht ein festes Vokabular an Einheiten, die es intern darstellen kann. Ganze Wörter würden ein riesiges Vokabular erfordern und trotzdem bei neuen Wörtern, Namen und Tippfehlern scheitern. Einzelne Zeichen würden Texte zu sehr langen Sequenzen machen und alles verlangsamen.
Tokens sind der Kompromiss. Ein Tokenizer lernt aus großen Textmengen, welche Zeichenfolgen häufig vorkommen, und macht daraus Einträge im Vokabular. Häufige Wörter werden zu einzelnen Tokens. Seltenere Wörter werden aus kleineren Teilen zusammengesetzt. So kann das Modell jeden Text darstellen, auch erfundene Wörter, und hält gängigen Text trotzdem kompakt.
Jede Modellfamilie hat ihren eigenen Tokenizer, sodass derselbe Satz bei verschiedenen Modellen unterschiedlich viele Tokens ergeben kann. Deshalb sollten exakte Zahlen immer vom Tokenizer des Modells stammen, das Sie tatsächlich nutzen.
Wie Tokenisierung aussieht
Die genaue Zerlegung hängt vom Tokenizer ab, ein typisches Muster sieht aber so aus (zur Veranschaulichung, nicht die Ausgabe eines bestimmten Modells):
| Text | Mögliche Tokens | Anzahl |
|---|---|---|
| The invoice is due | The invoice is due |
4 |
| Unbelievably | Un believ ably |
3 |
| 2026-10-04 | 202 6 - 10 - 04 |
6 |
| Kundenzufriedenheit | K unden zuf ried enheit |
5 |
Einige Muster fallen auf:
- Führende Leerzeichen sind oft Teil des Tokens. „ invoice“ mit Leerzeichen ist ein anderes Token als „invoice“ am Zeilenanfang.
- Lange Wörter werden in Teile zerlegt. Das ist besonders häufig in Sprachen mit zusammengesetzten Wörtern – wie dem Deutschen.
- Zahlen und Daten können überraschend teuer sein. Ziffern werden oft in kleinen Gruppen zusammengefasst.
Faustregeln zum Schätzen von Tokens
Wenn Sie schnell schätzen müssen, reichen diese groben Regeln für die Planung:
| Inhalt | Grobe Schätzung |
|---|---|
| Englischer Fließtext | 1 Token ≈ 4 Zeichen ≈ 0,75 Wörter |
| 1.000 englische Wörter | etwa 1.300–1.400 Tokens |
| Eine Seite englischer Text (rund 500 Wörter) | etwa 650–700 Tokens |
| Deutsch, Französisch, Spanisch | oft spürbar mehr Tokens als derselbe Inhalt auf Englisch |
| Quellcode, JSON, Tabellen | wegen Symbolen und Leerzeichen oft mehr Tokens pro Zeichen als Fließtext |
| Sprachen mit nicht-lateinischen Schriften | je nach Tokenizer teils deutlich mehr |
Das sind nur Schätzungen. Für Budgets messen Sie echte Beispiele. Der LLM-API-Kostenrechner enthält einen Schnellschätzer: Fügen Sie einen typischen Prompt oder eine Antwort ein, und er liefert eine grobe Token-Zahl, die Sie in die Kostenrechnung übernehmen können.
Input-Tokens und Output-Tokens
Jede Anfrage hat zwei Token-Zahlen:
- Input-Tokens: alles, was Sie senden. Dazu gehören der System-Prompt, frühere Gesprächsrunden, eingefügte Dokumente, Tool-Definitionen und die Nachricht des Nutzers.
- Output-Tokens: alles, was das Modell als Antwort erzeugt. Manche Modelle erzeugen vor der sichtbaren Antwort zusätzlich interne Reasoning-Tokens, die als Output abgerechnet werden können.
Die Unterscheidung ist wichtig, weil die meisten Anbieter beide unterschiedlich bepreisen, wobei Output pro Token meist teurer ist. Der Artikel LLM-API-Preise erklärt zeigt mit einem Rechenbeispiel, wie sich beide zu Ihrer Rechnung addieren.
Das Kontextfenster: Tokens als Kapazität
Das Kontextfenster ist die maximale Zahl an Tokens, die ein Modell in einer Anfrage berücksichtigen kann, Input und Output zusammen. Hat ein Modell beispielsweise ein Kontextfenster von 128.000 Tokens, müssen Ihr Prompt und die Antwort zusammen hineinpassen.
Was das in der Praxis bedeutet:
- Lange Dokumente passen womöglich nicht. Eine große Vertragssammlung oder ein langer E-Mail-Verlauf kann das Fenster sprengen.
- Chats haben ein Gedächtnislimit. In einem langen Gespräch müssen ältere Runden irgendwann wegfallen oder zusammengefasst werden.
- Ein größeres Fenster ist nicht gratis. Jeder gesendete Token kostet Geld und Zeit. Ein ganzes Handbuch zu senden, wenn ein Abschnitt relevant ist, ist Verschwendung.
- Mehr Kontext ist nicht immer besser. Modelle können Details übersehen, die in sehr langen Eingaben vergraben sind. Fokussierter Kontext liefert meist verlässlichere Antworten.
Sind Dokumente zu groß oder zu zahlreich, lautet die übliche Lösung Retrieval: zuerst nach den relevanten Passagen suchen und nur diese senden. Wie das funktioniert, erklärt unser Vergleich RAG vs. Fine-Tuning.
Tokens und Geschwindigkeit
Modelle erzeugen den Output Token für Token. Daraus folgen zwei praktische Konsequenzen:
- Lange Antworten dauern länger. Warten Nutzer, verbessert die Bitte um knappe Antworten das Erlebnis.
- Auch lange Eingaben verzögern. Einen sehr langen Prompt zu verarbeiten, braucht Zeit, bevor das erste Output-Token erscheint – wenn auch meist weniger pro Token als die Erzeugung.
Wirkt Ihre Anwendung langsam, prüfen Sie die Token-Zahlen, bevor Sie den Anbieter wechseln.
Warum derselbe Inhalt in anderen Sprachen mehr kosten kann
Tokenizer werden mit großen Textsammlungen trainiert, in denen Englisch meist gut vertreten ist. Deshalb wird englischer Text oft effizient tokenisiert, während andere Sprachen für dieselbe Bedeutung mehr Tokens brauchen können. Sprachen mit vielen zusammengesetzten Wörtern wie das Deutsche oder Sprachen mit reicher Flexion können pro Satz spürbar teurer sein.
Für ein Unternehmen, das in mehreren Sprachen arbeitet, hat das zwei Folgen:
- Budget pro Sprache planen. Ein Support-Assistent, der auf Deutsch antwortet, kann pro Gespräch mehr Tokens verbrauchen als derselbe Assistent auf Englisch.
- Mit echten lokalen Inhalten testen. Rechnen Sie nicht von englischen Beispielen hoch.
Rechenbeispiel: von Wörtern zu Kosten
Angenommen, ein interner Assistent fasst Berichte zusammen. Alle Zahlen sind Beispielannahmen.
- Berichtslänge: 3.000 englische Wörter, also etwa 4.000 Tokens.
- Anweisungen: 300 Tokens.
- Zusammenfassung: 250 Wörter, also etwa 330 Tokens.
- Volumen: 400 Berichte pro Monat.
Input pro Anfrage: etwa 4.300 Tokens. Output: etwa 330 Tokens.
Mit Beispielpreisen von 1,00 € pro Million Input-Tokens und 4,00 € pro Million Output-Tokens:
- Input: 4.300 × 1,00 € ÷ 1.000.000 = 0,0043 €
- Output: 330 × 4,00 € ÷ 1.000.000 = 0,00132 €
- Pro Bericht: etwa 0,0056 €
- Pro Monat: etwa 2,25 €
Die Kosten sind hier gering, doch dieselbe Rechnung für einen Kundenchat mit hohem Volumen oder einen Agenten, der pro Aufgabe viele Aufrufe macht, erreicht schnell größere Summen. Deshalb lohnt es sich, Tokens früh zu messen. Wie Sie die Zahl senken, lesen Sie unter LLM-API-Kosten senken.
Tokens genau zählen
- Tools der Anbieter: Die meisten Anbieter bieten einen Tokenizer, einen Endpunkt zum Zählen von Tokens oder eine Testumgebung, die Token-Zahlen anzeigt.
- API-Antworten: Jede Antwort enthält meist die Zahl der genutzten Input- und Output-Tokens. Diese zu protokollieren, ist der verlässlichste Weg, Ihren tatsächlichen Verbrauch zu kennen.
- Open-Source-Tokenizer-Bibliotheken: Für manche Modellfamilien gibt es den Tokenizer als Bibliothek, die Sie lokal ausführen können.
Für die Planung reichen Faustregeln. Für Budgets und Monitoring nutzen Sie echte Zahlen.
Verbreitete Missverständnisse
- „Ein Token ist ein Wort.“ Oft, aber nicht immer. Viele Wörter bestehen aus mehreren Tokens, und auch Leerzeichen und Satzzeichen zählen.
- „Nur meine Frage zählt.“ System-Prompts, Verlauf und Dokumente zählen bei jeder Anfrage als Input.
- „Ein größeres Kontextfenster löst alles.“ Es erhöht die Kapazität, nicht den Fokus, und treibt die Kosten, wenn es genutzt wird.
- „Token-Zahlen sind bei allen Modellen gleich.“ Jeder Tokenizer ist anders.
- „Kürzere Prompts sind immer besser.“ Wer nötigen Kontext streicht, spart Tokens, zahlt aber womöglich mehr durch schlechte Ergebnisse und Korrekturen.
Das Wichtigste in Kürze
Tokens sind die Währung von LLMs: Sie bestimmen Preis, Kapazität und Geschwindigkeit. Schätzen Sie mit Faustregeln, messen Sie mit echten Beispielen und denken Sie daran, dass der Input alles umfasst, was Sie senden, nicht nur die Worte des Nutzers. Was Ihre eigenen Mengen kosten würden, zeigt der LLM-API-Kostenrechner; das vollständige Bild der Abrechnung liefert LLM-API-Preise erklärt.
Häufige Fragen
Was ist ein Token bei einem LLM?
Ein Token ist die Texteinheit, die ein Sprachmodell liest und schreibt. Das kann ein ganzes Wort sein, ein Wortteil, ein Satzzeichen oder ein Leerzeichen. Modelle verarbeiten und erzeugen Text Token für Token.
Wie viele Wörter sind 1.000 Tokens?
Bei typischem englischem Text etwa 700 bis 800 Wörter, nach der gängigen Faustregel, dass ein Token etwa drei Viertel eines Wortes entspricht. Andere Sprachen wie Deutsch, aber auch Code und Zahlen brauchen für denselben Inhalt oft mehr Tokens.
Warum sind Tokens für Unternehmen wichtig?
Die API-Nutzung wird pro Token abgerechnet, Kontextfenster werden in Tokens gemessen, und die Antwortzeit wächst mit der Zahl der erzeugten Tokens. Tokens bestimmen also Kosten, Kapazität und Geschwindigkeit.
Wie zähle ich Tokens genau?
Nutzen Sie den Tokenizer oder den Token-Zähl-Endpunkt des konkreten Modells, das Sie einsetzen wollen, oder lesen Sie die Nutzungsangaben, die jede API-Antwort mitliefert. Faustregeln sind nur Schätzungen.
Ähnliche Artikel
Kosten & ROI8 Min. Lesezeit
LLM-API-Preise erklärt: So entstehen die Token-Kosten
So funktionieren LLM-API-Preise: Input- und Output-Tokens, Kontext, Caching, Batch-Rabatte und versteckte Kostentreiber – mit Rechenbeispiel für einen Monat.
Kosten & ROI8 Min. Lesezeit
ROI von KI-Automatisierung berechnen: So geht's
Schritt für Schritt den ROI von KI-Automatisierung berechnen: gesparte Zeit, Prüfaufwand, laufende und einmalige Kosten, Amortisation – mit Rechenbeispiel.
Kosten & ROI8 Min. Lesezeit
LLM-API-Kosten senken: 12 praxiserprobte Taktiken
Zwölf praktische Wege, LLM-API-Kosten ohne Qualitätsverlust zu senken: Modell-Routing, Prompt-Caching, kürzerer Kontext, Output-Limits, Batching, Monitoring.