Le récit du secteur, c’est que les tokens n’arrêtent pas de baisser, et c’est à moitié vrai : chaque génération de petits modèles arrive moins chère que la précédente. Mais 2026 a consolidé quatre façons de voir votre facture monter sans que vous changiez une seule ligne de code. Aucune n’est un piège : elles sont toutes publiées sur les pages tarifaires des fournisseurs. Le problème, c’est qu’elles n’apparaissent pas dans le comparatif que vous avez consulté le jour où vous avez choisi votre modèle.
1. Les promotions ont une date
OpenAI vend aujourd’hui GPT-5.6 Sol à 4 $ en entrée et 20 $ en sortie par million de tokens. Sa page tarifaire indique, littéralement, que ce prix promotionnel est disponible « au moins jusqu’au 21 novembre 2026 ».
« Au moins », c’est un plancher, pas un plafond : cela peut être prolongé et cela peut s’arrêter ce jour-là. Si vous avez budgété l’année sur le tarif promotionnel, vous avez une date au calendrier et un risque non chiffré, car ce que coûtera le modèle ensuite n’est pas publié.
2. Le contexte long est facturé sur un autre palier
C’est celui qui surprend le plus, parce qu’il ne dépend pas du modèle mais de ce que vous lui envoyez.
OpenAI publie deux paliers par modèle, contexte court et contexte long. Sur GPT-5.6 Sol, l’entrée passe de 4 $ à 8 $ et la sortie de 20 $ à 30 $. Google le marque par seuil : sur Gemini 3.1 Pro, en dessous de 200 000 tokens l’entrée est à 2 $ et au-dessus à 4 $, la sortie passant de 12 $ à 18 $.
Le détail important, c’est que la page d’OpenAI affiche les deux paliers mais pas le seuil qui les sépare. Vous savez qu’il existe un autre prix, mais pas à quel moment exact vous y entrez. Et en pratique on y entre tout seul : un RAG qui accumule les documents, un historique de conversation que personne n’élague, un prompt système qui grossit à coups de rustines. Même tâche, même modèle, prix unitaire différent.
Anthropic a pris le chemin inverse : depuis Claude 4.6, la fenêtre d’un million de tokens est incluse au tarif standard, sans majoration. Cela vaut la peine de le savoir si vous comparez.
3. Les majorations selon où et comment ça tourne
Ce sont des drapeaux de configuration, pas des décisions de modèle, et chacun a un prix.
Résidence des données. OpenAI facture 10 % de plus sur les endpoints régionaux, pour les modèles publiés à partir du 5 mars 2026 qui la prennent en charge. Anthropic applique un multiplicateur de 1,1 à l’inférence restreinte aux États-Unis.
Mode rapide. Chez OpenAI, il double le tarif standard. Chez Anthropic, le mode rapide d’Opus 5 passe de 5 $/25 $ à 10 $/50 $ : exactement le double.
Ni l’un ni l’autre ne change ce que fait le modèle, seulement où il tourne ou avec quelle priorité. Un drapeau mal positionné dans une intégration double la facture de ce chemin, et cela ne se voit qu’à la clôture du mois.
4. Les hausses annoncées avec une date
Google publie ses tarifs actuels comme valables jusqu’au 31 décembre 2026 et a déjà annoncé qu’à partir du 1er janvier 2027 ils doublent, approximativement, sur toute la ligne. Gemini 3.8 Flash passe de 0,75 $ à 1,50 $ en entrée. Le stockage du cache de contexte passe de 0,50 $ à 1 $ par million de tokens et par heure.
C’est la plus grosse des quatre hausses et aussi la plus facile à anticiper, puisqu’elle est publiée près de quatre mois à l’avance. C’est aussi celle que le plus de monde découvrira sur la facture de janvier sans l’avoir regardée avant.
Et parfois la hausse n’arrive pas
Anthropic avait annoncé que Claude Sonnet 5 passerait de 2 $/10 $ à 3 $/15 $ le 1er septembre 2026. Cela n’a pas eu lieu : le tarif de lancement est resté comme prix standard.
C’est une bonne nouvelle et, en même temps, le meilleur argument de cet article. Le prix des tokens est une variable, pas une constante : il monte, il baisse, et parfois il est annoncé puis retiré. L’apprendre en lisant coûte peu. L’apprendre par la facture, non.
Quoi en faire
Rangez la date de péremption à côté du prix. Dans votre tableau de coûts, chaque tarif devrait porter d’où il vient, quand vous l’avez vérifié et jusqu’à quand il est valable. Un prix sans date est une donnée qui périme en silence.
Mesurez le coût par million de tokens, pas la dépense totale. Si votre usage croît de 20 % et le prix de 15 %, la dépense totale monte et vous ne savez pas ce qui revient à quoi. Le coût unitaire les sépare.
Vérifiez les drapeaux avant les modèles. Contexte long, résidence et mode rapide : trois vérifications de dix minutes qui expliquent des hausses apparemment inexplicables.
Les remises structurelles sont toujours là. La lecture de cache coûte un dixième de l’entrée chez OpenAI comme chez Anthropic, et le traitement par lots est à 50 % chez les trois fournisseurs. Une bonne part de l’économie réelle se joue ici, sans changer de modèle ni de fournisseur.
Changer de fournisseur n’est pas changer de modèle. Le même modèle servi ailleurs peut porter un autre prix, une autre résidence et d’autres majorations. Ce sont deux décisions distinctes et mieux vaut ne pas les mélanger.
Questions fréquentes
Les prix des tokens ont-ils augmenté en 2026 ? Les prix catalogue de la gamme basse ont baissé, mais des paliers et des majorations sont apparus qui font monter le coût réel : contexte long, résidence des données et mode rapide. À cela s’ajoute la hausse d’environ le double annoncée par Google pour le 1er janvier 2027.
Qu’est-ce que le palier de contexte long ? Un prix par token différent dès que la requête dépasse une certaine taille. Sur Gemini 3.1 Pro, le seuil est de 200 000 tokens et l’entrée passe de 2 $ à 4 $. OpenAI publie les deux paliers, mais pas le seuil qui les sépare.
Comment savoir si cela me touche ? Regardez le coût par million de tokens mois après mois, séparé par modèle et par chemin. S’il monte sans que vous ayez changé de modèle, la cause est en général un palier ou une majoration, pas le fournisseur.
Cet article fait partie du cluster sur le coût par tâche de l’IA. Pour mettre vos propres chiffres, il y a la calculatrice de coût des tokens.
Tarifs vérifiés le 7 septembre 2026 sur les pages officielles d’OpenAI, d’Anthropic et de Google. Ils changent souvent : vérifiez toujours le tarif en vigueur avant de décider.
Chez e-ficient, nous mesurons le coût par tâche des entreprises qui ont déjà l’IA en production. L’audit initial est gratuit si vous souscrivez un forfait avec un engagement de trois mois et rend un diagnostic en 72 heures.