Il racconto del settore è che i token continuano a costare meno, ed è vero a metà: ogni generazione di modelli piccoli arriva più economica della precedente. Ma nel 2026 si sono consolidati quattro modi in cui la tua fattura sale senza che tu cambi una riga di codice. Nessuno è un trucco: sono tutti pubblicati sulle pagine dei prezzi dei fornitori. Il problema è che non compaiono nel confronto che hai guardato il giorno in cui hai scelto il modello.

1. Le promozioni hanno una data

OpenAI vende oggi GPT-5.6 Sol a 4 $ in ingresso e 20 $ in uscita per milione di token. La sua pagina dei prezzi dice, letteralmente, che quel prezzo promozionale è disponibile «almeno fino al 21 novembre 2026».

«Almeno» è un pavimento, non un tetto: può essere prorogato e può finire quel giorno. Se hai fatto il budget dell’anno sulla tariffa promozionale, hai una data sul calendario e un rischio non quantificato, perché quanto costerà il modello dopo non è pubblicato.

2. Il contesto lungo si paga in un’altra fascia

È quello che sorprende di più, perché non dipende dal modello ma da quanto gli mandi.

OpenAI pubblica due fasce per modello, contesto corto e contesto lungo. Su GPT-5.6 Sol l’ingresso passa da 4 $ a 8 $ e l’uscita da 20 $ a 30 $. Google lo segna per soglia: su Gemini 3.1 Pro, sotto i 200.000 token l’ingresso è 2 $ e sopra 4 $, mentre l’uscita sale da 12 $ a 18 $.

Il dettaglio importante è che sulla pagina di OpenAI compaiono le due fasce ma non la soglia che le separa. Sai che c’è un prezzo diverso, ma non in quale punto esatto ci entri. E in pratica ci si entra da soli: un RAG che accumula documenti, una cronologia di conversazione che nessuno pota, un prompt di sistema che cresce a forza di toppe. Stesso compito, stesso modello, prezzo unitario diverso.

Anthropic è andata nella direzione opposta: da Claude 4.6 la finestra da un milione di token è inclusa a prezzo standard, senza sovrapprezzo. Vale la pena saperlo se stai confrontando.

3. I sovrapprezzi per dove e come si elabora

Sono flag di configurazione, non decisioni di modello, e ognuno ha un prezzo.

Residenza dei dati. OpenAI applica un 10 % in più sugli endpoint regionali, per i modelli pubblicati dal 5 marzo 2026 che la supportano. Anthropic applica un moltiplicatore di 1,1 all’inferenza limitata agli Stati Uniti.

Modalità veloce. In OpenAI raddoppia la tariffa standard. In Anthropic, la modalità veloce di Opus 5 passa da 5 $/25 $ a 10 $/50 $: esattamente il doppio.

Nessuno dei due cambia ciò che fa il modello, solo dove gira o con quale priorità. Un flag messo male in un’integrazione raddoppia la fattura di quel percorso, e non si nota fino alla chiusura del mese.

4. Gli aumenti annunciati con una data

Google pubblica i prezzi attuali come validi fino al 31 dicembre 2026 e ha già annunciato che dal 1 gennaio 2027 raddoppiano, in modo approssimativo, su tutta la linea. Gemini 3.8 Flash passa da 0,75 $ a 1,50 $ in ingresso. L’archiviazione della cache di contesto passa da 0,50 $ a 1 $ per milione di token all’ora.

È il più grande dei quattro aumenti e anche il più facile da pianificare, perché è pubblicato con quasi quattro mesi di anticipo. È anche quello che più persone troveranno nella fattura di gennaio senza averlo guardato prima.

E a volte l’aumento non arriva

Anthropic aveva annunciato che Claude Sonnet 5 sarebbe passato da 2 $/10 $ a 3 $/15 $ il 1 settembre 2026. Non è successo: la tariffa di lancio è rimasta come prezzo standard.

È una buona notizia e, allo stesso tempo, l’argomento migliore dell’articolo. Il prezzo dei token è una variabile, non una costante: sale, scende e a volte viene annunciato e ritirato. Scoprirlo leggendo costa poco. Scoprirlo dalla fattura, no.

Cosa farci

Tieni la data di scadenza accanto al prezzo. Nel tuo foglio dei costi ogni tariffa dovrebbe portare da dove viene, quando l’hai verificata e fino a quando è valida. Un prezzo senza data è un dato che scade in silenzio.

Misura il costo per milione di token, non la spesa totale. Se il tuo uso cresce del 20 % e il prezzo sale del 15 %, la spesa totale sale e non sai quanto è dovuto a cosa. Il costo unitario li separa.

Controlla i flag prima dei modelli. Contesto lungo, residenza e modalità veloce sono tre verifiche da dieci minuti che spiegano aumenti apparentemente inspiegabili.

Gli sconti strutturali ci sono ancora. La lettura di cache costa un decimo dell’ingresso sia in OpenAI sia in Anthropic, e l’elaborazione in batch è al 50 % presso tutti e tre i fornitori. Buona parte del risparmio reale sta qui, senza cambiare modello né fornitore.

Cambiare fornitore non è cambiare modello. Lo stesso modello servito da un’altra parte può avere un altro prezzo, un’altra residenza e altri sovrapprezzi. Sono due decisioni distinte ed è meglio non mescolarle.

Domande frequenti

I prezzi dei token sono saliti nel 2026? I prezzi di listino della fascia bassa sono scesi, ma sono comparse fasce e sovrapprezzi che alzano il costo effettivo: contesto lungo, residenza dei dati e modalità veloce. In più, Google ha annunciato un aumento di circa il doppio per il 1 gennaio 2027.

Cos’è la fascia di contesto lungo? Un prezzo per token diverso quando la richiesta supera una certa dimensione. Su Gemini 3.1 Pro la soglia è di 200.000 token e l’ingresso passa da 2 $ a 4 $. OpenAI pubblica le due fasce, ma non la soglia che le separa.

Come faccio a sapere se mi sta colpendo? Guarda il costo per milione di token mese per mese, separato per modello e per percorso. Se sale senza che tu abbia cambiato modello, la causa di solito è una fascia o un sovrapprezzo, non il fornitore.

Questo pezzo fa parte del cluster sul costo per attività dell’IA. Se vuoi mettere i tuoi numeri, c’è la calcolatrice del costo dei token.


Prezzi verificati il 7 settembre 2026 sulle pagine ufficiali di OpenAI, Anthropic e Google. Cambiano spesso: verifica sempre la tariffa in vigore prima di decidere.

In e-ficient misuriamo il costo per attività delle aziende che hanno già l’IA in produzione. L’audit iniziale è gratuito se attivi un piano con impegno di tre mesi e restituisce una diagnosi in 72 ore.