Quand tu arrêtes d'utiliser l'IA comme un chat et que tu commences à la mettre à l'intérieur de ton code, le modèle cesse d'être un onglet du navigateur et devient une facture. Et cette facture peut être trois centimes par mois ou trois mille euros, selon l'API que tu choisis et la façon dont tu l'utilises. L'écart entre un fournisseur et un autre, pour la même tâche, peut être de 20 à 1.
Le problème, c'est que la carte change tous les quelques mois : de nouveaux modèles sortent, les prix baissent, des agrégateurs apparaissent. Ce guide est une photo figée de 2026 pour que tu comprennes comment on facture, quel fournisseur gagne sur quoi et lequel choisir selon ton cas, sans marketing et pensé pour qui va écrire le code.
Attention
Les chiffres exacts de chaque API bougent de mois en mois, presque toujours à la baisse. Ici on utilise des fourchettes indicatives vérifiées à la mi-2026. Avant de boucler un budget, confirme le chiffre sur la page de tarifs officielle du fournisseur : c'est la seule chose qui ne périme pas.
Pourquoi comparer les API (et ne pas garder la première)
La tentation est d'utiliser l'API de la marque que tu connais déjà —sans doute OpenAI— et de ne plus y penser. Ça marche, mais tu laisses de l'argent et de la vitesse sur la table. Trois raisons de comparer avant de te marier :
- Le coût grimpe avec le volume. Sur un prototype, peu importe. Quand tu traites des millions de tokens par jour, un écart de 2 $ par million fait la différence entre un projet rentable ou non.
- Toutes les tâches n'ont pas besoin du meilleur modèle. Classer un e-mail, résumer un texte ou étiqueter des données, un modèle bon marché le fait largement. Réserver le modèle premium à ces tâches, c'est jeter le budget.
- La vitesse est une feature. Si ton IA répond à un utilisateur en temps réel, 200 tokens par seconde contre 800 change complètement l'expérience. Certains fournisseurs sont spécialisés uniquement là-dedans.
La bonne question n'est pas «quelle est la meilleure API ?», mais «laquelle est la meilleure pour cette tâche précise ?». Et pour y répondre, il faut d'abord comprendre la facture.
Comment on facture : tokens d'entrée et de sortie
Les API d'IA ne facturent ni au mot ni à la requête. Elles facturent au token. Un token est un fragment de texte —environ 4 caractères ou trois quarts de mot en anglais (en français, un peu moins)—. La phrase «Salut, ça va ?» fait environ 6 tokens.
L'important, et ce que presque personne ne regarde au début, c'est qu'on facture deux choses séparément :
- Input (entrée) : tout ce que tu envoies au modèle. Ton prompt, les instructions système et —c'est clé— tout le contexte que tu traînes : l'historique de la conversation, les documents que tu lui passes, les résultats d'outils. Dans un agent, l'input grossit à chaque tour.
- Output (sortie) : ce que le modèle génère comme réponse.
Et voilà l'astuce qui fait exploser les factures : l'output coûte entre 4 et 6 fois plus cher que l'input chez presque tous les fournisseurs. Un modèle à 3 $ d'input peut être à 15 $ d'output. C'est pourquoi une API qui «a l'air pas chère» en ne regardant que l'input peut te revenir cher si elle génère de longues réponses.
Astuce
Règle pratique pour estimer le coût : compte combien de tokens de sortie tu attends par requête et multiplie-les par le prix d'output, qui est celui qui commande. Si tes réponses sont longues (rapports, code, rédaction), l'output domine la facture. Si tu ne fais que classer ou extraire des données, l'input pèse plus parce que tu lui mets beaucoup de contexte et qu'il sort peu de texte.
Deux détails de plus qui font vraiment baisser le coût quand tu les utilises :
- Cache de prompt. Si tu renvoies le même bloc de contexte dans beaucoup de requêtes (un manuel, un system prompt long), presque tous les fournisseurs te le facturent au dixième du prix normal à partir de la deuxième fois. Dans les applications à contexte fixe, c'est le plus grand levier d'économie.
- Mode batch. Si tu n'as pas besoin de la réponse à l'instant, le traitement par lots (jusqu'à 24 h d'attente) coûte souvent la moitié chez OpenAI, Anthropic et Google. Idéal pour traiter des données massives de nuit.
Fiche par fournisseur
OpenAI (famille GPT-5)
Le fournisseur par défaut du secteur, et pas pour rien. Sa gamme va de modèles minuscules et ultra bon marché (les «nano» et «mini», dès ~0,10–0,15 $ d'input) jusqu'aux vaisseaux amiraux du raisonnement de la famille GPT-5, qui se situent dans la fourchette de ~1,25–5 $ d'input et ~10–30 $ d'output par million de tokens selon la variante. Le gros avantage : écosystème énorme, documentation impeccable et SDK pour tout. L'inconvénient : rarement le moins cher pour une tâche donnée, et pour tirer parti des modèles top tu paies un prix top.
Anthropic (Claude)
La maison forte en code, en agents de longue haleine et sur les tâches où tu joues ta fiabilité. Sa gamme a trois échelons clairs : Haiku (le rapide et bon marché, autour de ~1 $ input / ~5 $ output), Sonnet (l'équilibré, ~3 $ / ~15 $) et Opus (le haut de gamme, ~5 $ / ~25 $). Tous avec une fenêtre de contexte énorme (jusqu'à 1M de tokens sur les modèles actuels) sans surcoût pour le contexte long. Si ton produit vit de générer ou de relire du code, ou d'agents qui exécutent des tâches pendant des minutes, Claude rend souvent au-dessus de son prix.
Note
Les chiffres de Claude que nous donnons sont les fourchettes par échelon (Haiku / Sonnet / Opus) à la mi-2026 ; Anthropic publie les chiffres exacts par modèle sur sa page de tarifs. Le cache de prompt et le mode batch s'appliquent comme chez les autres et réduisent beaucoup le coût réel en production.
Google Gemini
Celui qui combine le mieux prix et capacité dans la tranche moyenne. Ses modèles Flash sont ultra bon marché pour ce qu'ils offrent (dès ~0,10–0,30 $ d'input sur les versions légères, jusqu'à ~1,50 $ sur le Flash le plus récent), et les Pro rivalisent d'égal à égal avec les grands en qualité (~2–4 $ d'input / ~12 $ d'output, avec un saut de prix au-delà de 200K de contexte). Gemini brille en multimodalité (image, audio, vidéo) et dispose d'un palier gratuit généreux via Google AI Studio pour tester avant de payer.
Open source via Groq, Together AI et Fireworks
C'est là qu'est l'argent bon marché. Des modèles ouverts puissants —DeepSeek, Llama, Qwen, Kimi et compagnie— servis par des fournisseurs qui ne mettent que les GPU. Les prix vont de ~0,05 $ à ~0,90 $ par million de tokens sur la plupart des modèles, une fraction de ce que coûtent les propriétaires. Chaque fournisseur a son atout :
- Groq : la vitesse. Ses puces maison (LPU) servent à 500+ tokens par seconde. Si tu as besoin de réponses instantanées, c'est la référence.
- Together AI et Fireworks : infrastructure propre (H100/H200/B200), sans intermédiaire, prix au token très compétitif et large catalogue de modèles ouverts.
Le prix à payer : la qualité moyenne des open source reste un cran derrière les meilleurs GPT-5 et Opus sur le plus exigeant, même si l'écart se resserre chaque trimestre.
Tableau comparatif
| Fournisseur / gamme | Input ($/MTok) | Output ($/MTok) | Gagne en | Quand l'utiliser |
|---|---|---|---|---|
| OpenAI · mini/nano | ~0,10–0,15 | ~0,40–0,60 | Équilibre + écosystème | Tâches légères à volume avec SDK mature |
| OpenAI · GPT-5 (top) | ~1,25–5 | ~10–30 | Qualité et raisonnement | Le plus exigeant, si tu es déjà dans leur stack |
| Anthropic · Haiku | ~1 | ~5 | Rapide et bon marché des grands | Volume avec bonne qualité et contexte long |
| Anthropic · Sonnet | ~3 | ~15 | Code et agents équilibrés | Le cheval de bataille pour un produit |
| Anthropic · Opus | ~5 | ~25 | Code et agents haut de gamme | Tâches critiques de longue haleine |
| Google · Gemini Flash | ~0,10–1,50 | ~0,40–9 | Prix/qualité et multimodal | Tranche moyenne, image/audio/vidéo |
| Google · Gemini Pro | ~2–4 | ~12 | Qualité proche du top, bon marché | Haute qualité sans payer le prix premium |
| Open source (Groq/Together/Fireworks) | ~0,05–0,90 | ~0,10–1 | Prix (et vitesse chez Groq) | Volume, coût minimal, autonomie |
Lequel choisir selon ton cas
Le tableau, c'est bien, mais la décision se concrétise avec des scénarios précis.
Tu as besoin de la qualité maximale et l'argent est secondaire. GPT-5 haut de gamme ou Claude Opus. Pour le code et les agents qui exécutent de longues tâches, Claude a souvent l'avantage ; pour la connaissance générale et le raisonnement pur, GPT-5. Gemini Pro est la troisième option sérieuse, et souvent moins chère.
Tu as besoin d'une qualité raisonnable au moindre coût possible. Modèles open source via Together ou Fireworks, ou les «mini/flash» des grands. C'est ici que se trouvent 80 % des tâches réelles : classer, résumer, extraire, répondre à des questions avec du contexte. Ne paie pas le prix Opus pour étiqueter des e-mails.
Tu as besoin de vitesse avant tout. Groq. Quand ton IA répond à un utilisateur en temps réel et que chaque milliseconde compte, ses 500+ tokens/s, presque personne ne les égale, et en plus à prix open source.
Tu prototypes et tu ne sais pas encore quel modèle tu veux. Ne te marie avec aucun pour l'instant : utilise OpenRouter (section suivante) et change de modèle en changeant une chaîne de caractères.
Astuce
Un pattern qui économise beaucoup en production : le routage par difficulté. Envoie les tâches faciles à un modèle bon marché et n'escalade vers le cher que lorsque la tâche l'exige. Beaucoup d'équipes utilisent un petit modèle comme filtre et réservent le gros à ce qui en a vraiment besoin. Bien fait, ça rabote la facture sans que ça se voie sur la qualité.
OpenRouter : le raccourci pour ne te marier avec personne
Gérer cinq comptes, cinq clés et cinq factures pour comparer des modèles, c'est une plaie. OpenRouter règle ça : un unique endpoint —compatible avec l'API d'OpenAI, donc migrer revient presque à changer l'URL de base— et une unique clé pour parler à des centaines de modèles de tous les fournisseurs. Une seule facture.
Ce qu'il t'apporte :
- Tester sans friction. Tu passes de GPT-5 à Claude à un Llama ouvert en changeant le nom du modèle dans la requête. Zéro code nouveau.
- Routage automatique. Il peut envoyer ta requête au fournisseur le moins cher ou le plus rapide qui sert ce modèle, et faire un failover si l'un tombe.
- Une facture pour tout. Au lieu de rapprocher les dépenses dans cinq tableaux de bord.
Il prélève une petite marge sur le prix du fournisseur, donc pour une app en production à gros volume, tu as peut-être intérêt à aller directement au fournisseur le moins cher. Mais pour prototyper, comparer et ne pas rester coincé chez une seule maison, ça vaut largement le coup.
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="TA_CLE_OPENROUTER",
)
reponse = client.chat.completions.create(
# Change cette chaîne pour changer de modèle et de fournisseur :
model="anthropic/claude-sonnet-4-6",
messages=[{"role": "user", "content": "Résume ceci en 3 points : ..."}],
)
print(reponse.choices[0].message.content)Pour qui est chaque chose
OpenAI si tu valorises l'écosystème le plus mature, la meilleure documentation et que tu ne veux pas trop réfléchir : c'est l'option sûre, même si c'est rarement la moins chère.
Anthropic (Claude) si ton produit vit du code, d'agents qui exécutent de longues tâches ou de fiabilité sur des tâches critiques, et que la fenêtre de contexte énorme t'arrange.
Google Gemini si tu veux une haute qualité sans payer le prix premium, si tu as besoin de multimodalité (image, audio, vidéo) ou d'un palier gratuit généreux pour démarrer.
Open source (Groq/Together/Fireworks) si tu traites du volume, si le coût au token est ta métrique principale, ou si tu veux l'indépendance vis-à-vis des grands —et, dans le cas de Groq, de la vitesse brute.
OpenRouter si tu débutes, si tu compares, ou si tu ne veux simplement pas t'attacher à un fournisseur tant que le marché continue de bouger.
La vérité qui dérange, c'est qu'il n'existe pas de meilleure API : il existe la meilleure combinaison pour ton cas, et c'est presque toujours plus d'une à la fois —un modèle bon marché pour le gros, un cher pour le difficile, et un agrégateur pour ne pas t'enchaîner—. Commence par comprendre ton mélange d'input et d'output, teste deux ou trois options avec OpenRouter, et laisse la facture réelle, pas la brochure, te dire laquelle tu gardes.
