Kosten & ROI8 Min. Lesezeit

LLM-API-Preise erklärt: So entstehen die Token-Kosten

So funktionieren LLM-API-Preise: Input- und Output-Tokens, Kontext, Caching, Batch-Rabatte und versteckte Kostentreiber – mit Rechenbeispiel für einen Monat.

LLM-API-Preise sind nutzungsabhängig: Sie zahlen für die Tokens, die Sie an das Modell senden (Input), und für die Tokens, die es erzeugt (Output), jeweils zu einem eigenen Preis, meist pro Million Tokens angegeben. Die Kosten einer Anfrage sind Input-Tokens × Input-Preis plus Output-Tokens × Output-Preis. Ihre Monatsrechnung ist dieser Betrag multipliziert mit der Zahl der Anfragen, zuzüglich Extras wie Tool-Aufrufen oder Speicher. Der Rest dieses Leitfadens erklärt, was jeden Teil der Formel treibt und wo Schätzungen typischerweise danebenliegen.

Dies ist der zentrale Artikel unserer Reihe zu KI-Kosten. Wenn Sie beim Lesen mitrechnen möchten, öffnen Sie den LLM-API-Kostenrechner in einem zweiten Tab.

Das grundlegende Preismodell

Sprachmodelle lesen keine Wörter, sondern Tokens: Textstücke wie ganze kurze Wörter, Teile längerer Wörter, Satzzeichen oder Leerzeichen. Wenn Tokens neu für Sie sind, lesen Sie zuerst, was Tokens in LLMs sind. Für die Preise zählen drei Fakten:

  1. Jede Anfrage wird nach Tokens abgerechnet. Beide Richtungen zählen.
  2. Input und Output haben unterschiedliche Preise. Output ist pro Token meist um ein Mehrfaches teurer.
  3. Preise werden pro Million Tokens angegeben. Ein Preis von 2,00 € pro Million Input-Tokens bedeutet 0,000002 € pro Token.

Die Kernformel lautet also:

Kosten pro Anfrage = (Input-Tokens × Input-Preis + Output-Tokens × Output-Preis) ÷ 1.000.000

Die Preise unterscheiden sich stark zwischen Anbietern und zwischen Modellen desselben Anbieters. Kleinere, schnellere Modelle können einen Bruchteil der größten kosten. Da sich diese Preise häufig ändern, prüfen Sie vor der Budgetplanung die offizielle Preisseite des Anbieters; jede Zahl in einem Artikel, auch die Beispiele hier, ist als Illustration zu verstehen.

Was als Input zählt

Input ist alles, was Sie mit einer Anfrage senden, nicht nur die Frage des Nutzers. In einer typischen Geschäftsanwendung gehören dazu:

  • System-Prompt: die festen Anweisungen, die Rolle, Regeln und Format des Assistenten festlegen.
  • Gesprächsverlauf: In einem Chat werden frühere Nachrichten meist in jeder Runde erneut gesendet, damit das Modell den Kontext hat.
  • Abgerufener Kontext: Dokumente, Passagen aus einer Wissensdatenbank oder Datensätze, die in den Prompt eingefügt werden, etwa bei Retrieval-Augmented Generation (RAG).
  • Tool-Definitionen: Kann das Modell Funktionen aufrufen, sind deren Beschreibungen Teil des Inputs.
  • Bilder oder Dateien: Viele Modelle wandeln auch diese in Tokens um, oft mit einer beträchtlichen Zahl pro Bild oder Seite.
  • Die eigentliche Nutzernachricht.

Deshalb macht der Input oft den größeren Teil der Kosten aus, obwohl sein Preis pro Token niedriger ist. Eine kurze Nutzerfrage kann mit Tausenden Tokens an Anweisungen und Kontext unterwegs sein.

Was als Output zählt

Output ist der Text, den das Modell in seiner Antwort erzeugt. Zwei Dinge führen leicht zur Unterschätzung:

  • Ausführliche Antworten. Ohne Vorgaben zur Länge sind Modelle eher großzügig. Eine klare Formatanweisung kann den Output deutlich verringern.
  • Reasoning-Tokens. Manche Modelle „denken“ vor der Antwort und erzeugen interne Reasoning-Tokens. Je nach Anbieter werden diese als Output abgerechnet, auch wenn Sie sie in der Antwort nicht sehen. Prüfen Sie, wie Ihr gewähltes Modell sie ausweist und abrechnet.

Preisfunktionen, die die Rechnung verändern

Über die Grundpreise hinaus bieten die meisten Anbieter Preismechanismen, die Ihre Kosten senken oder erhöhen können. Bezeichnungen und Bedingungen unterscheiden sich, lesen Sie also die Dokumentation Ihres Anbieters.

Funktion Was sie bewirkt Wirkung auf die Kosten
Prompt-Caching Nutzt einen identischen Prompt-Anfang über mehrere Anfragen Gecachter Input wird günstiger abgerechnet; das Schreiben in den Cache kann extra kosten
Batch-Verarbeitung Anfragen werden asynchron statt in Echtzeit verarbeitet Oft günstiger als Standardanfragen
Staffelung nach Kontextlänge Manche Modelle berechnen ab einer bestimmten Prompt-Länge mehr Sehr lange Prompts können pro Token mehr kosten
Tool- und Suchaufrufe Integrierte Websuche, Codeausführung oder Dateisuche Oft pro Aufruf oder Nutzung zusätzlich zu den Tokens berechnet
Feinabgestimmte Modelle Modelle, die mit Ihren Daten trainiert wurden Trainingskosten plus meist andere Nutzungspreise
Priorisierte oder reservierte Kapazität Garantierter Durchsatz Höhere oder fest zugesagte Ausgaben

Caching verdient besondere Aufmerksamkeit. Teilen viele Anfragen einen langen System-Prompt oder dasselbe Referenzdokument, kann Caching die Input-Kosten dieses gemeinsamen Teils erheblich senken. Im Rechner können Sie den Anteil des Inputs aus dem Cache und einen separaten Cache-Preis eingeben. Unser Artikel, wie Sie LLM-API-Kosten senken, zeigt, wie Sie Prompts so aufbauen, dass Caching tatsächlich greift.

Ein Rechenbeispiel

Schätzen wir einen Kundenservice-Assistenten. Alle Zahlen sind Annahmen zur Veranschaulichung, und die Preise sind Beispielwerte, nicht die eines realen Anbieters.

Annahmen zur Nutzung

  • System-Prompt und Regeln: 800 Tokens
  • Abgerufene Passagen aus dem Hilfecenter: 1.200 Tokens
  • Gesprächsverlauf (Durchschnitt): 600 Tokens
  • Nutzernachricht: 100 Tokens
  • Antwort: 300 Tokens
  • Anfragen: 1.000 pro Tag, 30 Tage pro Monat

Pro Anfrage

  • Input: 800 + 1.200 + 600 + 100 = 2.700 Tokens
  • Output: 300 Tokens

Beispielpreise: 1,00 € pro Million Input-Tokens, 4,00 € pro Million Output-Tokens.

  • Input-Kosten: 2.700 × 1,00 € ÷ 1.000.000 = 0,0027 €
  • Output-Kosten: 300 × 4,00 € ÷ 1.000.000 = 0,0012 €
  • Kosten pro Anfrage: 0,0039 €

Pro Monat: 0,0039 € × 1.000 × 30 = 117 €

Beachten Sie, dass der Input etwa 70 % der Kosten ausmacht, obwohl Output-Tokens viermal so teuer sind. Den abgerufenen Kontext zu kürzen oder den System-Prompt zu cachen, hätte hier mehr Wirkung, als die Antworten zu kürzen.

Ändern Sie nun eine Annahme. Wechselt das Team zu einem größeren Modell mit Beispielpreisen von 5,00 € und 20,00 €, kostet dieselbe Nutzung 585 € pro Monat. Mit einem kleineren Modell zu 0,20 € und 0,80 € sind es etwa 23 €. Diese Spanne ist typisch: Die Modellwahl ist oft der größte einzelne Kostenhebel. Deshalb ist es teilweise eine Preisentscheidung, das richtige LLM auszuwählen.

Abos oder API-Preise

Viele lernen KI zuerst über Chat-Abos mit fester Monatsgebühr pro Nutzer kennen. Der API-Zugang ist anders:

Chat-Abo API
Abrechnung Feste Gebühr pro Nutzer und Monat Bezahlung pro genutztem Token
Am besten für Mitarbeitende, die einen Assistenten direkt nutzen Anwendungen, Automatisierungen, Integrationen
Planbarkeit der Kosten Hoch Nutzungsabhängig, braucht Monitoring
Kontrolle über Prompts und Datenfluss Begrenzt Vollständig, im Rahmen der Anbieterbedingungen
Nutzungsgrenzen Fair-Use-Grenzen des Anbieters Rate Limits und Ausgabenlimits, die Sie konfigurieren können

Unternehmen nutzen oft beides: Abos für Wissensarbeiter und die API für automatisierte Prozesse. Vergleichen Sie sie nicht nur nach Preis. Mit einem Abo bauen Sie keinen Workflow, und eine API gibt Mitarbeitenden keine fertige Oberfläche.

Versteckte Kostentreiber, die Sie einplanen sollten

Die Formel ist einfach, die reale Nutzung nicht. Diese Faktoren treiben die tatsächlichen Kosten regelmäßig über die erste Schätzung:

  • Wiederholungen und Fehler. Fehlgeschlagene oder verworfene Ergebnisse, die neu erzeugt werden, kosten doppelt Tokens.
  • Agenten-Schleifen. Ein KI-Agent ruft das Modell für eine Aufgabe womöglich viele Male auf: planen, Tools aufrufen, Ergebnisse lesen, die eigene Arbeit prüfen. Eine Nutzeranfrage kann zehn oder mehr Modellaufrufe bedeuten. Wie sich das auf Designentscheidungen auswirkt, lesen Sie unter KI-Agenten vs. Workflow-Automatisierung.
  • Wachsender Gesprächsverlauf. In langen Chats wird bei jeder Runde der Verlauf erneut gesendet, die Kosten pro Nachricht steigen also im Gesprächsverlauf.
  • Mehrere Schritte pro Prozess. Eine Pipeline, die klassifiziert, dann extrahiert, dann entwirft und dann prüft, macht vier Aufrufe pro Dokument.
  • Entwicklung und Tests. Prompt-Experimente und Evaluierungsläufe kosten Geld, bevor der erste echte Nutzer kommt.
  • Wachstum. Erfolgreiche Funktionen werden häufiger genutzt. Planen Sie Wachstum ein, nicht nur den Pilot.

Eine praktische Regel: Messen Sie echte Token-Zahlen an einer Stichprobe von Testanfragen, statt aus Wortzahlen zu schätzen, und rechnen Sie einen Puffer für die genannten Punkte hinzu.

So schätzen Sie Ihre eigenen Kosten

  1. Beispielanfragen sammeln. Nehmen Sie zehn bis zwanzig realistische Beispiele dessen, was die Anwendung senden und empfangen wird.
  2. Tokens messen. Nutzen Sie das Token-Zähl-Tool Ihres Anbieters oder die Nutzungsangaben, die die API zurückgibt. Für eine schnelle erste Schätzung liefert der Token-Schätzer im Kostenrechner einen groben Wert aus Beispieltext.
  3. Pro Anfrage rechnen. Durchschnittliche Input- und Output-Tokens, multipliziert mit den aktuellen Preisen.
  4. Mit dem Volumen multiplizieren. Anfragen pro Tag × Tage pro Monat. Berücksichtigen Sie Aufrufe pro Nutzeraktion, nicht nur Nutzeraktionen.
  5. Szenarien vergleichen. Probieren Sie mindestens zwei Modelle aus. Der Rechner zeigt drei nebeneinander.
  6. Puffer einplanen. Für Wiederholungen, Wachstum und Tests.
  7. Ausgabenlimits setzen. Die meisten Anbieter erlauben Budgetwarnungen oder harte Limits. Nutzen Sie sie vom ersten Tag an.

Typische Fehler

  • Nur die Nutzernachricht als Input zählen. System-Prompt und Kontext sind meist größer.
  • Mit Preisen vom letzten Jahr rechnen. Preise ändern sich oft, bei älteren Modellen häufig nach unten, manchmal mit neuen Preisstrukturen. Prüfen Sie immer die aktuelle Preisliste.
  • Die Output-Länge ignorieren. Ein Satz im Prompt zur gewünschten Länge kann mehr sparen als ein Modellwechsel.
  • Kosten jenseits der Tokens vergessen. Tool-Aufrufe, Speicher, Fine-Tuning und Datentransfer können separat berechnet werden.
  • Kosten vor Qualität optimieren. Das günstigste Modell ist nur günstiger, wenn seine Antworten gut genug sind. Ein Modell, das mehr Wiederholungen oder mehr menschliche Korrektur braucht, kann insgesamt teurer sein.

Nächste Schritte

Um aus Ihrer Schätzung eine Geschäftsentscheidung zu machen, verbinden Sie die Kosten- mit der Nutzenseite: Der KI-ROI-Rechner stellt laufende Kosten der gesparten Zeit gegenüber. Fällt die Schätzung höher aus als erhofft, lesen Sie weiter bei den zwölf Taktiken, mit denen Sie LLM-API-Kosten senken.

Häufige Fragen

Wie wird die Nutzung einer LLM-API abgerechnet?

Die meisten Anbieter rechnen pro Token ab, mit getrennten Preisen für Input-Tokens (was Sie senden) und Output-Tokens (was das Modell erzeugt), meist pro Million Tokens angegeben. Manche Funktionen wie Caching, Batch-Verarbeitung oder Tool-Nutzung haben eigene Preise.

Warum ist der Output-Preis höher als der Input-Preis?

Tokens einzeln zu erzeugen braucht mehr Rechenleistung, als die Eingabe zu verarbeiten. Daher verlangen Anbieter für Output meist mehr. Lange Antworten können die Rechnung deshalb dominieren.

Was macht eine LLM-Anwendung teurer als erwartet?

Meist die Input-Seite: Lange System-Prompts, Gesprächsverläufe und abgerufene Dokumente werden mit jeder Anfrage erneut gesendet. Auch Wiederholungen, Agenten-Schleifen und verborgene Reasoning-Tokens können die Kosten vervielfachen.

Wie schätze ich meine monatlichen LLM-API-Kosten?

Multiplizieren Sie die durchschnittlichen Input- und Output-Tokens pro Anfrage mit den jeweiligen Preisen und dann mit der Zahl der Anfragen pro Monat. Messen Sie die Token-Zahlen an echten Beispielanfragen und planen Sie einen Puffer für Wachstum und Wiederholungen ein.

Ähnliche Artikel

Kosten & ROI7 Min. Lesezeit

Was sind Tokens bei LLMs? Einfach erklärt

Was Tokens bei LLMs sind, wie Text zerlegt wird, warum Sprachen und Formate sich unterscheiden und wie Tokens Kontextgrenzen, Tempo und API-Kosten bestimmen.

Kosten & ROI8 Min. Lesezeit

LLM-API-Kosten senken: 12 praxiserprobte Taktiken

Zwölf praktische Wege, LLM-API-Kosten ohne Qualitätsverlust zu senken: Modell-Routing, Prompt-Caching, kürzerer Kontext, Output-Limits, Batching, Monitoring.

Kosten & ROI8 Min. Lesezeit

ROI von KI-Automatisierung berechnen: So geht's

Schritt für Schritt den ROI von KI-Automatisierung berechnen: gesparte Zeit, Prüfaufwand, laufende und einmalige Kosten, Amortisation – mit Rechenbeispiel.

← Zurück zum Blog