O batch API processa pedidos que não precisam de resposta imediata em troca de um desconto —normalmente cerca de 50 %— face às solicitações em tempo real. Compensa em tudo o que não seja interativo: relatórios, enriquecimento de dados, classificação em massa. É trocar minutos (ou horas) por dinheiro.
É a terceira das 7 alavancas para reduzir a fatura da OpenAI: a de maior poupança por unidade de esforço quando tem trabalho que pode esperar.
Num relance
| O que faz | Processa lotes de pedidos de forma assíncrona |
| Poupança típica | ~50 % face ao tempo real |
| Em troca de | Não ser imediato (janela de minutos a horas) |
| Quando compensa | Tudo o que não seja interativo |
Como funciona
Em vez de chamar um pedido de cada vez e esperar a resposta na hora, envia um lote inteiro e o fornecedor processa-o quando tem capacidade, dentro de uma janela acordada. Quando termina, recolhe todos os resultados juntos. O desconto é a contrapartida de abdicar da imediatez.
Quanto poupa
O desconto ronda metade do preço do tempo real, por isso nas cargas que pode adiar o custo por tarefa baixa de golpe sem tocar no modelo nem no prompt. Quanto maior o volume que move por lote, mais se nota na fatura.
Que tarefas encaixam
Encaixa tudo o que nenhum utilizador está a aguardar: relatórios noturnos, enriquecer uma base de dados, classificar ou etiquetar em massa, gerar descrições de catálogo, resumir ficheiros históricos. Se o resultado pode chegar em umas horas, é candidato a batch.
Quando não usá-lo
Não serve para nada interativo: um chat, um assistente ao vivo, qualquer fluxo onde o utilizador espera a resposta agora. Aí a latência manda e o tempo real é obrigatório. A regra é simples: se alguém está à espera à frente do ecrã, não é batch.
Ponha número
Antes de mover algo para batch, meça que parte do seu gasto é adiável. Ponha os seus tokens e o seu volume na calculadora de custo de tokens e aplique o desconto a essa parte: verá quanto baixa o custo mensal. Tudo isto faz parte do custo por tarefa que a e-ficient mede.
Perguntas frequentes
Quanto poupa o batch API? Normalmente cerca de metade do preço do tempo real, em troca de a resposta não ser imediata. Compensa em tudo o que não seja interativo.
Que tarefas posso enviar em lote? Qualquer uma que não precise de resposta na hora: relatórios, enriquecimento de dados, classificação em massa, geração em bloco.
Combina-se com as outras alavancas? Sim. O batch soma-se a escolher o modelo por tarefa e ao prompt caching: desconto sobre um preço já otimizado.
Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.