Escolher o modelo por tarefa é, de longe, a maior alavanca de custo. A maioria das tarefas —classificar, extrair, resumir— resolve-as um modelo pequeno a uma fração do preço do grande. O erro mais caro é usar o modelo mais potente para tudo: reserve o grande para o que realmente o precisa e encaminhe o resto para o pequeno.
É a primeira das 7 alavancas para reduzir a fatura da OpenAI e a que mais mexe o ponteiro.
Que modelo por tipo de tarefa
| Tarefa | Modelo | Custo relativo |
|---|---|---|
| Classificar, etiquetar, encaminhar | Pequeno | Muito baixo |
| Extrair dados de um texto | Pequeno | Muito baixo |
| Resumir, reescrever | Pequeno / médio | Baixo |
| Redação com matiz, tom | Médio | Médio |
| Raciocínio complexo, código difícil | Grande | Alto |
O erro de usar o grande para tudo
O modelo mais potente é também o mais caro por token, às vezes numa ordem de grandeza. Se o usa para classificar tickets ou extrair campos de uma fatura, paga preço de raciocínio avançado por uma tarefa que um modelo pequeno acerta. Em volume, essa diferença é a maior parte de uma fatura inchada.
Como decidir
Parta da tarefa, não do modelo. Pergunte que capacidade mínima a resolve bem: se um modelo pequeno dá a qualidade que precisa, a decisão acaba aí. Suba de nível só quando a qualidade do pequeno fica curta de forma mensurável, não por defeito.
Como encaminhar
O padrão habitual é uma porta barata à frente: um classificador pequeno (ou umas regras) olha para cada pedido e manda-o ao modelo certo. O simples vai ao pequeno; só o que realmente o precisa escala ao grande. Assim paga o modelo caro apenas na fração de pedidos que o justificam.
Ponha número
Antes de fixar o encaminhamento, meça quanto muda o custo por modelo. Ponha os seus tokens e o seu volume na calculadora de custo de tokens e compare o mesmo trabalho num modelo grande e num pequeno: verá a diferença mensal de golpe. Tudo isto faz parte do custo por tarefa que a e-ficient mede.
Perguntas frequentes
Que modelo de IA devo usar para cada tarefa? Um pequeno para classificar, extrair e resumir; um médio para redação com matiz; reserve o grande para raciocínio complexo ou código difícil. Comece pelo pequeno e suba só se a qualidade ficar curta.
Quanto se poupa escolhendo bem o modelo? É a alavanca de maior impacto: encaminhar as tarefas simples a um modelo pequeno pode baixar o custo desses pedidos entre 50 e 90 %.
Combina-se com as outras alavancas? Sim. Sobre o modelo já bem escolhido somam-se o prompt caching e o batch API.
Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.