Le prompt caching conserve le bloc de contexte qui se répète entre les requêtes —instructions, exemples, un document de base— et vous le facture une seule fois plutôt qu’à chaque requête. Sur les charges à contexte très répété, l’économie sur ces tokens atteint 50-90 %. C’est l’un des leviers les moins chers à mettre en place et il ne touche pas à la qualité des réponses.

C’est le deuxième des 7 leviers pour réduire votre facture OpenAI et l’un de ceux au meilleur rapport économie/effort.

En un coup d’œil

Ce qu’il met en cacheLe contexte stable : system prompt, instructions, exemples, documents de base
Économie typique50-90 % sur les tokens mis en cache
EffortFaible : marquer le bloc stable et le réutiliser
Quand c’est rentableRequêtes qui répètent le même long contexte

Comment ça marche

La première requête traite tout le contexte et le met en cache pendant une courte fenêtre. Les requêtes suivantes qui commencent par le même bloc ne paient plus le traitement de cette partie : ils réutilisent ce qui est en cache et ne paient que le nouveau. Plus le bloc que vous réutilisez est grand et stable, plus c’est rentable.

Combien il économise vraiment

L’économie s’applique seulement aux tokens mis en cache, pas à toute la facture. Si votre system prompt et vos exemples occupent 3 000 tokens et se répètent à chaque requête, ces 3 000 coûtent une fraction dès la deuxième requête. À gros volume, c’est la remise qui se remarque le plus vite sans rien changer au modèle ni à la sortie.

Quand c’est rentable (et quand ça ne l’est pas)

C’est rentable quand le même contexte se répète entre les requêtes : assistants avec un long system prompt, RAG avec un document de base fixe, classification avec beaucoup d’exemples. Ça n’apporte rien si chaque requête porte un contexte différent, car il n’y a rien à réutiliser.

Comment l’activer

Séparez le stable du variable : placez d’abord le bloc qui se répète (instructions, exemples, document) et à la fin ce qui change à chaque requête. Ainsi le préfixe cachable est le plus long possible. Consultez la documentation de votre fournisseur pour marquer le bloc ; le changement prend en général quelques minutes.

Chiffrez-le

Avant de toucher à quoi que ce soit, mesurez d’où vient votre dépense. Entrez vos tokens de contexte et votre volume dans le calculateur de coût des tokens et comparez-le à ce que vous paieriez en réutilisant le bloc stable : vous verrez l’économie mensuelle avant de l’implémenter. Tout cela fait partie du coût par tâche que mesure e-ficient.

Questions fréquentes

Combien économise le prompt caching ? Sur les tokens de contexte qui se répètent entre les requêtes, l’économie atteint 50-90 %. Plus le bloc que vous réutilisez est grand et stable, plus c’est rentable.

Affecte-t-il la qualité des réponses ? Non. Le modèle reçoit exactement le même contexte ; seule change la façon dont le traitement de la partie répétée est facturé.

En quoi diffère-t-il du RAG ? Le caching rend moins cher le contexte que vous envoyez déjà ; le RAG réduit la quantité de contexte à envoyer. Ils se combinent bien.


Chez e-ficient, nous mesurons le coût par tâche d’entreprises qui exploitent déjà l’IA en production et vous disons combien vous économiseriez avec chaque levier à votre volume réel. Le premier audit est gratuit si vous souscrivez un forfait avec un engagement de trois mois et rend un diagnostic sous 72 heures.