Il contesto è la parte della spesa che cresce di più senza che nessuno lo decida. Nessuno approva “paghiamo il triplo”: si aggiunge un documento al prompt, poi un altro, e la fattura sale. Ogni token di contesto si paga a ogni richiesta, ed è questo che trasforma una finestra lunga in un problema di costo.
Perché costa caro
Un modello non ricorda nulla tra una richiesta e l’altra. Tutto ciò che vuoi che sappia —istruzioni, esempi, cronologia, documenti— viaggia di nuovo a ogni richiesta e viene fatturato di nuovo. Se il tuo prompt porta 20.000 token di contesto e fai 50.000 richieste al mese, paghi un miliardo di token di ingresso solo per il contesto, qualunque sia la risposta.
Le tre perdite tipiche
| Perdita | Che cosa la causa | Come si corregge |
|---|---|---|
| Cronologia completa | Si rinvia tutta la conversazione a ogni turno | Riassumere i turni vecchi e inviare solo i recenti |
| Documenti interi | Si allega il PDF completo “per sicurezza” | Recuperare solo i frammenti rilevanti |
| Prompt di sistema gonfio | Istruzioni che si accumulano e non si potano mai | Riscriverlo e misurare se la qualità cala |
Recuperare invece di allegare
La correzione strutturale è non mettere il corpus nel prompt. Si indicizzano i documenti, si recuperano i tre o quattro frammenti che rispondono alla domanda e si inviano solo quelli. La qualità di solito sale —meno rumore— e il contesto scende di un ordine di grandezza. Lo sviluppiamo in RAG, fine-tuning e contesto.
Che cosa conviene tenere lungo
Non ogni taglio è buono. Le istruzioni stabili e gli esempi che fissano il formato sono cari da togliere ed economici da mantenere se usi il prompt caching: il blocco fisso va in cache e si paga a una frazione. La regola pratica è contesto fisso e in cache in alto, contesto variabile e minimo in basso.
Mettici un numero
Prima di ridisegnare qualsiasi cosa, misura. Inserisci i tuoi token di ingresso attuali e il tuo volume nel calcolatore di costo dei token e confronta lo stesso lavoro con metà contesto: vedrai la differenza mensile di colpo. E segui il costo per attività prima e dopo per confermare che la qualità non è calata.
Domande frequenti
Perché il contesto lungo aumenta tanto il costo? Perché il contesto viene inviato e fatturato a ogni richiesta. Un prompt grande non si paga una volta: si paga tante volte quante richieste fai.
Quanto contesto è troppo? Non c’è un numero assoluto. Il segnale è la proporzione: se i token di ingresso superano di molto quelli di uscita e buona parte sono documenti o cronologia, hai margine.
Ridurre il contesto peggiora le risposte? Spesso le migliora, perché il modello smette di competere con informazione irrilevante. Quello che non si può fare è tagliare senza misurare il costo per attività e la qualità prima e dopo.
In e-ficient misuriamo il costo per attività di aziende che hanno già l’IA in produzione e ti diciamo quanto risparmieresti con ogni leva al tuo volume reale. Il primo audit è gratuito se attivi un piano con impegno di tre mesi e restituisce una diagnosi in 72 ore.