Quale costa meno: GPT-4o, Claude o Gemini? La risposta breve è che dipende dal compito e dal volume, non dal prezzo di listino. Un modello può costare cinque volte di più per token di un altro e comunque risultare più economico in produzione se risolve il compito con metà dei token o al primo tentativo. Ecco i prezzi a confronto e, soprattutto, come leggerli senza brutte sorprese in bolletta.

Prezzi delle API per milione di token

Le API fatturano a token, e quasi tutte separano il prezzo di ingresso (ciò che invii: il tuo prompt, il contesto, i documenti) da quello di uscita (ciò che il modello genera). L’uscita costa di solito parecchio più dell’ingresso.

ModelloIngresso ($/1M)Uscita ($/1M)
GPT-4o mini0,150,60
Gemini 2.5 Flash0,302,50
GPT-4.1 mini0,401,60
Claude Haiku1,005,00
Gemini 2.5 Pro1,2510,00
GPT-4.12,008,00
GPT-4o2,5010,00
Claude Sonnet3,0015,00
Claude Opus15,0075,00

Prezzi indicativi ad agosto 2026; verifica sempre le tariffe ufficiali, che cambiano spesso. Tra il modello più economico e il più caro della tabella c’è un fattore 100 sull’uscita. È questo divario a rendere la scelta sbagliata del modello l’errore più costoso che si commette con l’IA in produzione.

Il prezzo di listino inganna: guarda il costo per attività

Il numero che conta non è quello della tabella, è il costo per attività: i token che una richiesta reale consuma moltiplicati per il loro prezzo, e questo per le volte che la ripeti al mese. Un modello caro che risponde bene al primo tentativo può risultare più economico di uno economico che richiede ritentativi, prompt più lunghi o correzioni.

Per questo il confronto onesto non è «quale costa meno per token» ma «quale costa meno per attività risolta». Un modello piccolo ed economico che risolve il 95% dei casi e passa il restante 5% a uno grande di solito batte qualsiasi modello grande usato per tutto.

Come scegliere tra i tre

Per attività ad alto volume e bassa complessità —classificare, estrarre dati, riassumere testi brevi— i modelli piccoli (GPT-4o mini, Gemini Flash, Claude Haiku) vincono quasi sempre: il costo per attività è una frazione e la qualità è più che sufficiente.

Per ragionamento complesso, codice o testi lunghi conviene un modello grande (Claude Sonnet o Opus, GPT-4.1, Gemini Pro), ma solo nelle attività che ne hanno davvero bisogno. La strategia che funziona meglio è l’instradamento: il modello piccolo in prima linea e quello grande solo quando serve.

Attenzione agli sconti strutturali. Il caching dei prompt (pagare una volta per il contesto che si ripete) e l’elaborazione in batch (fino a metà prezzo se l’attività può aspettare) cambiano del tutto il confronto. Un modello con un buon caching può superare uno più economico di listino.

Verificalo con i tuoi numeri

La tabella ti dà il prezzo; la tua bolletta la decide il tuo volume. Prima di sposare un modello, inserisci i tuoi token reali e il tuo numero di attività nel calcolatore di costo dei token e confronta il costo mensile di ciascuno fianco a fianco. Il risultato quasi sempre sorprende.

Domande frequenti

Quale costa meno, GPT-4o, Claude o Gemini? Per prezzo di listino, i modelli piccoli di ogni famiglia (GPT-4o mini, Gemini Flash, Claude Haiku) sono i più economici, con GPT-4o mini in testa. Ma il più economico nel tuo caso dipende da quanti token spende ciascuno per risolvere la tua attività, non solo dal prezzo per token.

Quanto costa GPT-4o per milione di token? Circa 2,50 $ l’ingresso e 10 $ l’uscita (indicativo, agosto 2026). La sua versione mini scende a circa 0,15 $ e 0,60 $.

Il modello più caro per token è il più caro in produzione? Non necessariamente. Ciò che decide la bolletta è il costo per attività —token per prezzo, per volume—, quindi un modello caro che risolve al primo tentativo e con meno token può risultare più economico di uno economico che richiede ritentativi.

Questo articolo fa parte del cluster sul costo per attività dell’IA, la guida che ancora tutto il resto.


In e-ficient misuriamo il costo per attività di aziende che hanno già l’IA in produzione, incluso quanto ti costerebbe ciascun modello al tuo volume reale. Il primo audit è gratuito se attivi un piano con impegno di tre mesi e restituisce una diagnosi in 72 ore.