Coûts et ROI9 min de lecture
Tarification des API LLM : comment se calcule le coût
Comment fonctionne la tarification des API LLM : tokens d'entrée et de sortie, contexte, cache, remises par lots et coûts cachés, avec un exemple mensuel.
Publié le
La tarification des API LLM est à l'usage : vous payez les tokens envoyés au modèle (entrée) et ceux qu'il génère (sortie), chacun à son prix, généralement exprimé par million de tokens. Le coût d'une requête est tokens d'entrée × prix d'entrée plus tokens de sortie × prix de sortie. Votre facture mensuelle correspond à ce montant multiplié par le nombre de requêtes, plus d'éventuels extras comme les appels d'outils ou le stockage. La suite de ce guide explique ce qui pèse sur chaque terme de la formule et où les estimations dérapent habituellement.
C'est l'article central de notre série sur les coûts de l'IA. Pour calculer en lisant, ouvrez le calculateur de coût d'API LLM dans un autre onglet.
Le modèle de tarification de base
Les modèles de langage ne lisent pas des mots mais des tokens, c'est-à-dire des fragments de texte : mots courts entiers, morceaux de mots plus longs, ponctuation ou espaces. Si la notion est nouvelle pour vous, lisez d'abord ce que sont les tokens des LLM. Pour la tarification, trois faits comptent :
- Chaque requête est facturée en tokens. Les deux sens comptent.
- Entrée et sortie ont des prix différents. La sortie est généralement plusieurs fois plus chère par token.
- Les prix sont exprimés par million de tokens. Un prix de 2,00 € par million de tokens d'entrée signifie 0,000002 € par token.
La formule de base est donc :
Coût par requête = (tokens d'entrée × prix d'entrée + tokens de sortie × prix de sortie) ÷ 1 000 000
Les prix varient fortement d'un fournisseur à l'autre et entre modèles d'un même fournisseur. Les modèles plus petits et rapides peuvent coûter une fraction des plus grands. Comme ces prix changent souvent, consultez la page tarifaire officielle du fournisseur avant de budgéter ; tout chiffre lu dans un article, y compris les exemples ici, est purement illustratif.
Ce qui compte comme entrée
L'entrée, c'est tout ce que vous envoyez avec une requête, pas seulement la question de l'utilisateur. Dans une application métier typique :
- Prompt système : les instructions permanentes qui définissent rôle, règles et format de l'assistant.
- Historique de conversation : dans un chat, les messages précédents sont généralement renvoyés à chaque tour pour donner le contexte.
- Contexte récupéré : documents, passages d'une base de connaissances ou enregistrements insérés dans le prompt, par exemple en génération augmentée par récupération (RAG).
- Définitions d'outils : si le modèle peut appeler des fonctions, leurs descriptions font partie de l'entrée.
- Images ou fichiers : beaucoup de modèles les convertissent aussi en tokens, souvent en nombre important par image ou par page.
- Le message de l'utilisateur lui-même.
C'est pourquoi l'entrée représente souvent la plus grosse part des coûts, malgré un prix par token plus bas. Une courte question peut voyager avec des milliers de tokens d'instructions et de contexte.
Ce qui compte comme sortie
La sortie est le texte que le modèle génère dans sa réponse. Deux éléments la font facilement sous-estimer :
- Les réponses verbeuses. Sans consigne de longueur, les modèles ont tendance à être généreux. Une consigne de format claire peut réduire nettement la sortie.
- Les tokens de raisonnement. Certains modèles « réfléchissent » avant de répondre et génèrent des tokens de raisonnement internes. Selon le fournisseur, ils sont facturés comme sortie même si vous ne les voyez pas. Vérifiez comment votre modèle les déclare et les facture.
Les mécanismes tarifaires qui changent le calcul
Au-delà des tarifs de base, la plupart des fournisseurs proposent des mécanismes qui peuvent baisser ou augmenter vos coûts. Noms et conditions varient : lisez la documentation de votre fournisseur.
| Mécanisme | Ce qu'il fait | Effet sur le coût |
|---|---|---|
| Cache de prompt | Réutilise un début de prompt identique d'une requête à l'autre | L'entrée en cache est facturée à tarif réduit ; l'écriture dans le cache peut coûter en plus |
| Traitement par lots | Les requêtes sont traitées en asynchrone, pas en temps réel | Souvent moins cher que les requêtes standard |
| Paliers de longueur de contexte | Certains modèles facturent plus au-delà d'une certaine longueur de prompt | Les prompts très longs peuvent coûter plus par token |
| Appels d'outils et de recherche | Recherche web, exécution de code ou recherche de fichiers intégrées | Souvent facturés par appel ou par usage en plus des tokens |
| Modèles affinés | Modèles entraînés sur vos données | Coût d'entraînement et, en général, prix d'utilisation différents |
| Capacité prioritaire ou réservée | Débit garanti | Dépenses plus élevées ou engagées |
Le cache mérite une attention particulière. Si de nombreuses requêtes partagent un long prompt système ou le même document de référence, le cache peut réduire considérablement le coût d'entrée de cette partie commune. Le calculateur permet de saisir la part de l'entrée servie depuis le cache et un prix de cache distinct. Notre article pour réduire les coûts d'API LLM explique comment structurer les prompts pour que le cache s'applique vraiment.
Un exemple chiffré
Estimons un assistant de service client. Tous les chiffres sont des hypothèses, et les prix des valeurs d'exemple, pas ceux d'un fournisseur réel.
Hypothèses d'usage
- Prompt système et règles : 800 tokens
- Passages récupérés du centre d'aide : 1 200 tokens
- Historique de conversation (moyenne) : 600 tokens
- Message de l'utilisateur : 100 tokens
- Réponse : 300 tokens
- Requêtes : 1 000 par jour, 30 jours par mois
Par requête
- Entrée : 800 + 1 200 + 600 + 100 = 2 700 tokens
- Sortie : 300 tokens
Prix d'exemple : 1,00 € par million de tokens d'entrée, 4,00 € par million de tokens de sortie.
- Coût d'entrée : 2 700 × 1,00 € ÷ 1 000 000 = 0,0027 €
- Coût de sortie : 300 × 4,00 € ÷ 1 000 000 = 0,0012 €
- Coût par requête : 0,0039 €
Par mois : 0,0039 € × 1 000 × 30 = 117 €
L'entrée représente environ 70 % du coût alors que les tokens de sortie sont quatre fois plus chers. Raccourcir le contexte récupéré ou mettre en cache le prompt système aurait ici plus d'effet que raccourcir les réponses.
Changeons une hypothèse. Si l'équipe passe à un modèle plus grand avec des prix d'exemple de 5,00 € et 20,00 €, le même usage coûte 585 € par mois. Avec un modèle plus petit à 0,20 € et 0,80 €, environ 23 €. Cet écart est typique : le choix du modèle est souvent le premier levier de coût, et choisir un LLM est donc en partie une décision tarifaire.
Abonnements ou tarification API
Beaucoup découvrent l'IA par des abonnements de chat à tarif mensuel fixe par utilisateur. L'accès API est différent :
| Abonnement de chat | API | |
|---|---|---|
| Facturation | Forfait par utilisateur et par mois | Paiement au token utilisé |
| Idéal pour | Collaborateurs utilisant directement un assistant | Applications, automatisations, intégrations |
| Prévisibilité des coûts | Élevée | Dépend de l'usage, à surveiller |
| Contrôle des prompts et des flux de données | Limité | Total, dans le cadre des conditions du fournisseur |
| Limites d'usage | Limites d'usage raisonnable fixées par le fournisseur | Limites de débit et de dépenses configurables |
Une entreprise utilise souvent les deux : abonnements pour les métiers du savoir, API pour les processus automatisés. Ne les comparez pas sur le seul prix : un abonnement ne permet pas de construire un workflow, et une API ne fournit pas d'interface prête à l'emploi.
Les multiplicateurs cachés à prévoir
La formule est simple, l'usage réel non. Ces facteurs poussent régulièrement le coût réel au-dessus de la première estimation :
- Relances et erreurs. Les résultats échoués ou rejetés qu'il faut regénérer coûtent deux fois des tokens.
- Boucles d'agents. Un agent IA peut appeler le modèle de nombreuses fois pour une seule tâche : planifier, appeler des outils, lire les résultats, vérifier son travail. Une requête utilisateur peut représenter dix appels ou plus. Voir agents IA ou automatisation de workflows pour l'impact sur la conception.
- Historique qui s'allonge. Dans les longues conversations, l'historique est renvoyé à chaque tour : le coût par message augmente au fil de l'échange.
- Plusieurs étapes par processus. Un pipeline qui classe, extrait, rédige puis vérifie fait quatre appels par document.
- Développement et tests. Les essais de prompts et les campagnes d'évaluation coûtent avant l'arrivée du premier vrai utilisateur.
- Croissance. Les fonctions réussies sont davantage utilisées. Budgétez la croissance, pas seulement le pilote.
Règle pratique : mesurez les vrais nombres de tokens sur un échantillon de requêtes de test plutôt que d'estimer à partir du nombre de mots, puis ajoutez une marge pour les points ci-dessus.
Estimer vos propres coûts
- Rassemblez des requêtes types. Dix à vingt exemples réalistes de ce que l'application enverra et recevra.
- Mesurez les tokens. Utilisez l'outil de comptage de votre fournisseur ou les chiffres d'usage renvoyés par l'API. Pour une première estimation rapide, l'estimateur du calculateur de coût donne un ordre de grandeur à partir d'un texte.
- Calculez par requête. Moyenne des tokens d'entrée et de sortie, multipliée par les prix actuels.
- Multipliez par le volume. Requêtes par jour × jours par mois. Comptez les appels par action utilisateur, pas seulement les actions.
- Comparez des scénarios. Essayez au moins deux modèles. Le calculateur en affiche trois côte à côte.
- Ajoutez une marge. Pour les relances, la croissance et les tests.
- Fixez des plafonds de dépenses. La plupart des fournisseurs proposent alertes budgétaires ou limites strictes. Utilisez-les dès le premier jour.
Les erreurs fréquentes
- Ne compter que le message de l'utilisateur comme entrée. Le prompt système et le contexte pèsent généralement plus.
- Utiliser les prix de l'an dernier. Les prix changent souvent, fréquemment à la baisse pour les anciens modèles, parfois avec de nouvelles structures tarifaires. Vérifiez toujours la grille actuelle.
- Ignorer la longueur de sortie. Une phrase sur la longueur souhaitée dans le prompt peut faire économiser plus qu'un changement de modèle.
- Oublier les frais hors tokens. Appels d'outils, stockage, fine-tuning et transfert de données peuvent être facturés à part.
- Optimiser le coût avant la qualité. Le modèle le moins cher ne l'est que si ses réponses suffisent. Un modèle qui exige plus de relances ou de corrections humaines peut coûter plus au total.
Prochaines étapes
Pour transformer votre estimation en décision, associez coûts et valeur : le calculateur de ROI de l'automatisation IA compare les coûts récurrents au temps gagné. Si l'estimation dépasse vos attentes, poursuivez avec les douze tactiques de notre article pour réduire les coûts d'API LLM.
FAQ
Comment l'usage d'une API LLM est-il facturé ?
La plupart des fournisseurs facturent au token, avec des prix distincts pour les tokens d'entrée (ce que vous envoyez) et de sortie (ce que le modèle génère), généralement exprimés par million de tokens. Certaines fonctions comme le cache, le traitement par lots ou les outils ont leurs propres tarifs.
Pourquoi la sortie coûte-t-elle plus cher que l'entrée ?
Générer les tokens un par un demande plus de calcul que traiter l'entrée, c'est pourquoi les fournisseurs facturent généralement la sortie plus cher. Les réponses longues peuvent donc dominer la facture.
Qu'est-ce qui rend une application LLM plus chère que prévu ?
Le plus souvent l'entrée : longs prompts système, historique de conversation et documents récupérés sont renvoyés à chaque requête. Les relances, les boucles d'agents et les tokens de raisonnement invisibles peuvent aussi multiplier les coûts.
Comment estimer mon coût mensuel d'API LLM ?
Multipliez la moyenne des tokens d'entrée et de sortie par requête par leurs prix, puis par le nombre de requêtes mensuelles. Mesurez les tokens sur de vraies requêtes et ajoutez une marge pour la croissance et les relances.
Articles similaires
Coûts et ROI9 min de lecture
Réduire les coûts d'API LLM : 12 tactiques concrètes
Douze façons de réduire les coûts d'API LLM sans perdre en qualité : routage de modèles, cache de prompt, contexte allégé, sorties limitées, lots et suivi.
Coûts et ROI8 min de lecture
Que sont les tokens d'un LLM ? Explication simple
Ce que sont les tokens d'un LLM, comment le texte est découpé, pourquoi langues et formats diffèrent, et leur effet sur contexte, rapidité et coût d'API.
Coûts et ROI9 min de lecture
Calculer le ROI de l'automatisation par l'IA
Méthode pas à pas pour calculer le ROI de l'automatisation IA : temps gagné, relecture, coûts récurrents et initiaux, amortissement, avec un exemple chiffré.