Quando a fatura da API começa a doer, a primeira ideia costuma ser a mesma: montar um modelo próprio. Às vezes é a decisão certa, mas raramente pelas razões que se apresentam, e quase sempre mais tarde do que se pensa. A pergunta não é qual é mais barato por token, mas a partir de que volume a poupança cobre o que custa operá-lo.
O que se compara mal
Compara-se o preço por milhão de tokens da API com o preço por hora de uma GPU, e o self-hosting ganha sempre no papel. Falta metade da equação: a GPU paga-se esteja ocupada ou não, e o seu custo real depende da utilização. Uma GPU a 8% de uso é dez vezes mais cara por token do que a mesma GPU a 80%.
Os custos que ninguém soma
| Rubrica | API | Self-hosting |
|---|---|---|
| Computação | Por token consumido | Por hora reservada, use-se ou não |
| Engenharia | Quase nula | Servir, escalar, atualizar, vigiar |
| Disponibilidade | Do fornecedor | Sua, com piquetes incluídos |
| Troca de modelo | Uma linha de código | Reavaliar, reajustar, revalidar |
Quando compensa
Há três situações em que o self-hosting ganha mesmo. A primeira é volume alto e estável: muito tráfego e bastante plano, que mantém a GPU ocupada quase todo o tempo. A segunda é uma restrição de dados que impede tirá-los para fora —regulamentação, contrato, setor regulado— e aí a decisão já não é de custo. A terceira é uma tarefa muito estreita e repetitiva, onde um modelo pequeno afinado faz o trabalho de um grande a uma fração da computação.
Quando quase nunca compensa
Tráfego irregular ou com picos, catálogo de tarefas variado, ou uma equipa sem quem mantenha a infraestrutura. Se a sua carga tem vales longos, paga GPU parada. E antes de mexer na infraestrutura convém esgotar as alavancas baratas: escolher bem o modelo por tarefa, prompt caching e batch API costumam cortar mais e em dias, não em meses.
Como decidir com números
Calcule o seu custo mensal real por API e compare-o com o custo das GPU de que precisaria para o seu pico, não para a sua média. Some o tempo de engenharia a preço de mercado. Se a poupança não superar com folga esse total, não compensa. Ponha-lhe números na calculadora de custo de tokens e meça sempre em custo por tarefa, a única coisa comparável entre as duas opções.
Perguntas frequentes
A partir de que volume compensa o self-hosting? Não há um número universal, porque depende da utilização, não do volume. O sinal é ter tráfego suficiente e estável para manter a GPU ocupada a maior parte do tempo; com vales longos, a API sai mais barata.
Um modelo aberto é mais barato do que um pago? Por token de computação, sim. Somando engenharia, disponibilidade e GPU parada, nem sempre. A comparação honesta é custo por tarefa, tudo incluído.
Posso misturar as duas coisas? É o mais habitual na prática: um modelo próprio para a tarefa de alto volume e APIs para o resto. Repartir por tarefa costuma ganhar a escolher um único fornecedor.
Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.