Économie des tokens (tarification API)
L'économie des tokens est le modèle de tarification régissant l'accès commercial aux modèles de langage IA via API, où les utilisateurs sont facturés par token — environ 3 à 4 caractères de texte — avec des taux distincts pour l'entrée (prompt) et la sortie (texte généré).
L'économie des tokens décrit la structure de coûts qui régit l'accès commercial aux grands modèles de langage via les API. Un token est l'unité atomique de texte qu'un modèle traite : environ 0,75 mots, ou 3 à 4 caractères, en anglais. Les fournisseurs facturent séparément les tokens d'entrée (le prompt et tout contexte envoyé au modèle) et les tokens de sortie (la réponse générée), avec la sortie généralement tarifée 2 à 4 fois plus élevée parce que la génération autorégressive est plus intensive en calcul qu'une seule passe avant sur l'entrée.
La tarification est cotée par million de tokens. Le GPT-4 d'OpenAI lancé en mars 2023 à environ 30 dollars par million de tokens d'entrée ; vers la mi-2025, les modèles comparables ou plus capables d'OpenAI, Anthropic et Google étaient disponibles pour 1 à 15 dollars par million de tokens. Cette compression a été entraînée par la pression concurrentielle et les gains d'efficacité matérielle. Les dimensions de tarification supplémentaires incluent la mise en cache des prompts — facturer une fraction des taux normaux pour le contexte déjà stocké côté serveur — l'inférence par lots (travaux asynchrones à environ 50 % de réduction) et les contrats de volume échelonnés. La longueur de la fenêtre de contexte affecte également le coût, car les entrées plus longues consomment plus de tokens même lorsque le contenu sémantique est inchangé.
L'économie des tokens façonne directement l'économie unitaire des produits natifs IA. Un chatbot de support client traitant des milliers de conversations quotidiennement peut dépenser des montants vastement différents selon la conception du prompt, la sélection du modèle et la stratégie de mise en cache. Les praticiens utilisent des techniques telles que la compression de prompts, la fenêtre de contexte et le routage de modèles — diriger les requêtes simples vers les modèles moins chers et les requêtes complexes vers les modèles premium — pour contrôler les coûts sans dégrader la qualité.
En 2026, le marché s'est segmenté davantage. Les modèles de pointe (GPT-5, Claude 4, Gemini 2 Ultra) commandent des taux premium pour la capacité maximale, tandis que les modèles à poids ouverts auto-hébergés sur des clouds GPU offrent un coût marginal quasi nul par token. Les plans d'abonnement à taux fixe pour les utilisateurs individuels coexistent avec les contrats d'entreprise basés sur le paiement par token. Les fournisseurs publient de plus en plus des tarifications distinctes pour les cas d'utilisation de contexte long et pour l'inférence en mode raisonnement, où le modèle génère des chaînes étendues de pensée interne avant de produire une réponse, consommant des tokens supplémentaires dans le processus.