Monitorizar o gasto não poupa dinheiro por si só, mas habilita tudo o resto: sem medir o custo por tarefa, por utilizador e por endpoint, não sabe onde está a pagar a mais e otimiza às cegas. O que não se mede, não se otimiza.

As três métricas que importam

MétricaO que revelaPara que serve
Custo por tarefaO que custa uma unidade de trabalho realComparar modelos e decidir o encaminhamento
Custo por utilizadorQuem consome e quantoDetetar abusos e fixar preços
Custo por endpointQue parte do produto come o gastoSaber onde aplicar as alavancas

Custo por tarefa

É a métrica raiz: quanto custa resolver uma unidade de trabalho com sentido para o negócio —classificar um ticket, gerar uma ficha, responder a uma consulta—. Em dinheiro por tarefa, não em tokens. É a única coisa que lhe permite comparar modelos de forma honesta e justificar uma mudança. Desenvolvemo-lo em custo por tarefa.

Custo por utilizador

Divida o gasto pelas contas que o geram. Serve para duas coisas: detetar o punhado de utilizadores que concentra uma percentagem desproporcionada do consumo, e fixar preços que não o deixem em perdas nos planos altos.

Custo por endpoint

Reparta o gasto pelas funções do seu produto. Quase sempre há uma que leva a maior parte, e não costuma ser a mais usada: é a que arrasta mais contexto ou chama o modelo grande. É aí que aplicar primeiro as 7 alavancas de poupança.

Como começar sem montar nada

Não é preciso uma plataforma. Etiquete cada solicitação com três campos —tarefa, utilizador, endpoint—, guarde os tokens de entrada e saída que a API devolve, e agregue numa tabela. Com isso já tem as três métricas. Se quiser uma estimativa antes de instrumentar, a calculadora de custo de tokens dá-lhe a ordem de grandeza num minuto.

Perguntas frequentes

Que métricas seguir para controlar o custo da IA? Três: custo por tarefa, por utilizador e por endpoint. A primeira deixa comparar modelos, a segunda detetar consumos anómalos e fixar preços, a terceira saber onde otimizar primeiro.

Basta olhar para a fatura do fornecedor? Não. A fatura dá o total, não o detalhe. Sem saber que tarefa, que utilizador e que endpoint o geram, não pode agir sobre ele.

De quanto em quanto tempo convém rever? Semanalmente durante os primeiros meses e após cada mudança de modelo ou de prompt. O gasto em IA desvia-se depressa quando muda o uso.


Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.