O batch API processa pedidos que não precisam de resposta imediata em troca de um desconto —normalmente cerca de 50 %— face às solicitações em tempo real. Compensa em tudo o que não seja interativo: relatórios, enriquecimento de dados, classificação em massa. É trocar minutos (ou horas) por dinheiro.

É a terceira das 7 alavancas para reduzir a fatura da OpenAI: a de maior poupança por unidade de esforço quando tem trabalho que pode esperar.

Num relance

O que fazProcessa lotes de pedidos de forma assíncrona
Poupança típica~50 % face ao tempo real
Em troca deNão ser imediato (janela de minutos a horas)
Quando compensaTudo o que não seja interativo

Como funciona

Em vez de chamar um pedido de cada vez e esperar a resposta na hora, envia um lote inteiro e o fornecedor processa-o quando tem capacidade, dentro de uma janela acordada. Quando termina, recolhe todos os resultados juntos. O desconto é a contrapartida de abdicar da imediatez.

Quanto poupa

O desconto ronda metade do preço do tempo real, por isso nas cargas que pode adiar o custo por tarefa baixa de golpe sem tocar no modelo nem no prompt. Quanto maior o volume que move por lote, mais se nota na fatura.

Que tarefas encaixam

Encaixa tudo o que nenhum utilizador está a aguardar: relatórios noturnos, enriquecer uma base de dados, classificar ou etiquetar em massa, gerar descrições de catálogo, resumir ficheiros históricos. Se o resultado pode chegar em umas horas, é candidato a batch.

Quando não usá-lo

Não serve para nada interativo: um chat, um assistente ao vivo, qualquer fluxo onde o utilizador espera a resposta agora. Aí a latência manda e o tempo real é obrigatório. A regra é simples: se alguém está à espera à frente do ecrã, não é batch.

Ponha número

Antes de mover algo para batch, meça que parte do seu gasto é adiável. Ponha os seus tokens e o seu volume na calculadora de custo de tokens e aplique o desconto a essa parte: verá quanto baixa o custo mensal. Tudo isto faz parte do custo por tarefa que a e-ficient mede.

Perguntas frequentes

Quanto poupa o batch API? Normalmente cerca de metade do preço do tempo real, em troca de a resposta não ser imediata. Compensa em tudo o que não seja interativo.

Que tarefas posso enviar em lote? Qualquer uma que não precise de resposta na hora: relatórios, enriquecimento de dados, classificação em massa, geração em bloco.

Combina-se com as outras alavancas? Sim. O batch soma-se a escolher o modelo por tarefa e ao prompt caching: desconto sobre um preço já otimizado.


Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção e dizemos-lhe quanto pouparia com cada alavanca ao seu volume real. A primeira auditoria é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.