A narrativa do setor é que os tokens não param de baixar de preço, e é meia verdade: cada geração de modelos pequenos chega mais barata do que a anterior. Mas em 2026 consolidaram-se quatro formas de a sua fatura subir sem que altere uma única linha de código. Nenhuma é um truque: estão todas publicadas nas páginas de preços dos fornecedores. O problema é que não aparecem na comparação que consultou no dia em que escolheu o modelo.
1. As promoções têm data
A OpenAI vende hoje o GPT-5.6 Sol a 4 $ de entrada e 20 $ de saída por milhão de tokens. A sua página de preços diz, literalmente, que esse preço promocional está disponível «pelo menos até 21 de novembro de 2026».
«Pelo menos» é um piso, não um teto: pode ser prolongado e pode terminar nesse dia. Se orçamentou o ano com a tarifa promocional, tem uma data no calendário e um risco por quantificar, porque quanto custará o modelo depois não está publicado.
2. O contexto longo é cobrado noutro escalão
Este é o que mais surpreende, porque não depende do modelo mas de quanto lhe envia.
A OpenAI publica dois escalões por modelo, contexto curto e contexto longo. No GPT-5.6 Sol, a entrada passa de 4 $ para 8 $ e a saída de 20 $ para 30 $. A Google marca-o por limiar: no Gemini 3.1 Pro, abaixo de 200.000 tokens a entrada são 2 $ e acima 4 $, e a saída sobe de 12 $ para 18 $.
O detalhe importante é que na página da OpenAI aparecem os dois escalões mas não o limiar que os separa. Sabe que há um preço diferente, mas não em que ponto exato entra nele. E na prática entra-se sozinho: um RAG que vai acumulando documentos, um histórico de conversa que ninguém poda, um prompt de sistema que cresce à custa de remendos. A tarefa é a mesma, o modelo é o mesmo, e o preço unitário muda.
A Anthropic foi em sentido contrário: desde o Claude 4.6, a janela de um milhão de tokens entra a preço padrão, sem agravamento. Vale a pena tê-lo em conta se está a comparar.
3. Os agravamentos por onde e como se processa
São bandeiras de configuração, não decisões de modelo, e cada uma tem preço.
Residência de dados. A OpenAI cobra mais 10 % nos endpoints regionais, para os modelos publicados a partir de 5 de março de 2026 que a suportam. A Anthropic aplica um multiplicador de 1,1 à inferência restrita aos Estados Unidos.
Modo rápido. Na OpenAI duplica a tarifa padrão. Na Anthropic, o modo rápido do Opus 5 passa de 5 $/25 $ para 10 $/50 $: exatamente o dobro.
Nenhum dos dois muda o que o modelo faz, apenas onde corre ou com que prioridade. Uma bandeira mal colocada numa integração duplica a fatura desse caminho e só se nota no fecho do mês.
4. As subidas anunciadas com data
A Google publica os preços atuais como válidos até 31 de dezembro de 2026 e já anunciou que a partir de 1 de janeiro de 2027 duplicam, de forma aproximada, em toda a linha. O Gemini 3.8 Flash passa de 0,75 $ para 1,50 $ de entrada. O armazenamento de cache de contexto passa de 0,50 $ para 1 $ por milhão de tokens e hora.
É a maior subida das quatro e também a mais fácil de planear, porque foi publicada com quase quatro meses de antecedência. É também aquela que mais gente vai encontrar na fatura de janeiro sem a ter visto antes.
E às vezes a subida não chega
A Anthropic tinha anunciado que o Claude Sonnet 5 passaria de 2 $/10 $ para 3 $/15 $ a 1 de setembro de 2026. Não aconteceu: a tarifa de lançamento ficou como preço padrão.
É uma boa notícia e, ao mesmo tempo, o melhor argumento do artigo. O preço dos tokens é uma variável, não uma constante: sobe, desce e às vezes anuncia-se e retira-se. Saber lendo é barato; saber pela fatura, não.
O que fazer com isto
Guarde a data de validade junto ao preço. Na sua folha de custos, cada tarifa devia levar de onde saiu, quando a verificou e até quando é válida. Um preço sem data é um dado que caduca em silêncio.
Meça custo por milhão de tokens, não gasto total. Se o seu uso cresce 20 % e o preço sobe 15 %, o gasto total sobe e não sabe quanto corresponde a cada coisa. O custo unitário separa-os.
Reveja as bandeiras antes dos modelos. Contexto longo, residência e modo rápido são três verificações de dez minutos que explicam subidas aparentemente inexplicáveis.
Os descontos estruturais continuam lá. A leitura de cache custa um décimo da entrada na OpenAI e na Anthropic, e o processamento por lotes está a 50 % nos três fornecedores. Boa parte da poupança real está aqui, sem mudar de modelo nem de fornecedor.
Mudar de fornecedor não é mudar de modelo. O mesmo modelo servido de outro sítio pode ter outro preço, outra residência e outros agravamentos. São duas decisões distintas e convém não as misturar.
Perguntas frequentes
Os preços dos tokens subiram em 2026? Os preços de tabela da gama pequena desceram, mas apareceram escalões e agravamentos que sobem o custo efetivo: contexto longo, residência de dados e modo rápido. Além disso, a Google anunciou uma subida de aproximadamente o dobro para 1 de janeiro de 2027.
O que é o escalão de contexto longo? Um preço por token diferente quando o pedido ultrapassa certo tamanho. No Gemini 3.1 Pro o limiar são 200.000 tokens e a entrada passa de 2 $ para 4 $. A OpenAI publica os dois escalões, mas não o limiar que os separa.
Como sei se me está a afetar? Olhe para o custo por milhão de tokens mês a mês, separado por modelo e por caminho. Se sobe sem que tenha mudado de modelo, a causa costuma ser um escalão ou um agravamento, não o fornecedor.
Esta peça faz parte do cluster sobre o custo por tarefa de IA. Se quiser pôr os seus números, tem a calculadora de custo de tokens.
Preços verificados a 7 de setembro de 2026 nas páginas oficiais da OpenAI, da Anthropic e da Google. Mudam com frequência: verifique sempre a tarifa em vigor antes de decidir.
Na e-ficient medimos o custo por tarefa de empresas que já têm IA em produção. A auditoria inicial é gratuita se contratar um plano com compromisso de três meses e devolve um diagnóstico em 72 horas.