Quand la facture d’API commence à faire mal, la première idée est souvent la même : monter son propre modèle. C’est parfois la bonne décision, mais rarement pour les raisons avancées, et presque toujours plus tard qu’on ne le croit. La question n’est pas de savoir ce qui coûte le moins par token, mais à partir de quel volume l’économie couvre ce que coûte l’exploitation.
Ce qu’on compare mal
On compare le prix par million de tokens de l’API au prix horaire d’un GPU, et le self-hosting gagne toujours sur le papier. Il manque la moitié de l’équation : le GPU se paie qu’il soit occupé ou non, et son coût réel dépend du taux d’utilisation. Un GPU à 8 % d’usage coûte dix fois plus par token que le même GPU à 80 %.
Les coûts que personne n’additionne
| Poste | API | Self-hosting |
|---|---|---|
| Calcul | Par token consommé | Par heure réservée, utilisée ou non |
| Ingénierie | Quasi nulle | Servir, scaler, mettre à jour, surveiller |
| Disponibilité | Celle du fournisseur | La vôtre, astreintes comprises |
| Changement de modèle | Une ligne de code | Réévaluer, réajuster, revalider |
Quand c’est rentable
Trois situations font vraiment gagner le self-hosting. La première : un volume élevé et stable, un trafic important et assez plat qui garde le GPU occupé presque tout le temps. La deuxième : une contrainte de données qui interdit de les faire sortir —réglementation, contrat, secteur régulé— et là la décision n’est plus de coût. La troisième : une tâche très étroite et répétitive, où un petit modèle affiné fait le travail d’un grand pour une fraction du calcul.
Quand ce ne l’est presque jamais
Trafic irrégulier ou en pics, catalogue de tâches varié, ou une équipe sans personne pour maintenir l’infrastructure. Si votre charge a de longs creux, vous payez du GPU à l’arrêt. Et avant de toucher à l’infrastructure, mieux vaut épuiser les leviers bon marché : bien choisir le modèle par tâche, le prompt caching et le batch API coupent en général davantage, et en jours plutôt qu’en mois.
Comment trancher avec des chiffres
Calculez votre coût mensuel réel d’API et comparez-le au coût des GPU nécessaires pour votre pic, pas pour votre moyenne. Ajoutez le temps d’ingénierie au prix du marché. Si l’économie ne dépasse pas largement ce total, ce n’est pas rentable. Chiffrez-le avec le calculateur de coût des tokens et mesurez toujours en coût par tâche, la seule chose comparable entre les deux options.
Questions fréquentes
À partir de quel volume le self-hosting est-il rentable ? Il n’y a pas de chiffre universel, car cela dépend du taux d’utilisation, pas du volume. Le signal est d’avoir un trafic suffisant et stable pour garder le GPU occupé la plupart du temps ; avec de longs creux, l’API revient moins cher.
Un modèle ouvert est-il moins cher qu’un modèle payant ? Par token de calcul, oui. En ajoutant l’ingénierie, la disponibilité et le GPU à l’arrêt, pas toujours. La comparaison honnête est le coût par tâche, tout compris.
Puis-je mélanger les deux ? C’est le montage le plus courant en pratique : un modèle propre pour la tâche à fort volume et des API pour le reste. Répartir par tâche l’emporte souvent sur le choix d’un fournisseur unique.
Chez e-ficient, nous mesurons le coût par tâche d’entreprises qui exploitent déjà l’IA en production et vous disons combien vous économiseriez avec chaque levier à votre volume réel. Le premier audit est gratuit si vous souscrivez un forfait avec un engagement de trois mois et rend un diagnostic sous 72 heures.