
Perché i token in uscita dall'API LLM costano da 4 a 8 volte di più rispetto ai token in ingresso
Pubblicato il 25 lug 2026
Se dai un’occhiata alla pagina dei prezzi di qualsiasi API LLM di rilievo — OpenAI, Anthropic, Google, non importa quale — noterai ogni volta lo stesso andamento: i token in uscita costano diverse volte di più rispetto a quelli in ingresso. E non si tratta certo di un sovrapprezzo irrisorio. Nei modelli attuali, il rapporto si attesta costantemente tra 4x e 8x. Non si tratta di una stranezza di prezzo specifica di un singolo fornitore; è una conseguenza diretta del modo in cui questi modelli funzionano effettivamente.
Il vero motivo: l’input è parallelo, l’output è sequenziale
L’elaborazione dei token di input — il vostro prompt, i messaggi di sistema, la cronologia delle conversazioni — avviene in un unico passaggio in avanti. Il modello legge l’intero input in una sola volta e calcola l’attenzione su tutto il testo in parallelo. Le moderne GPU sono estremamente efficienti in questo tipo di calcolo in batch e in parallelo, quindi un prompt da 3.000 token e uno da 300 token non richiedono proporzionalmente lo stesso tempo di calcolo che il loro numero di token potrebbe suggerire: il costo dominante è rappresentato dall’overhead dell’esecuzione del modello, non dalla lunghezza di ciò che sta leggendo.
La generazione dei token di output è fondamentalmente diversa. Ogni nuovo token dipende da tutti i token che lo hanno preceduto, compresi quelli appena generati dal modello — pertanto il token 500 di una risposta non può essere calcolato finché non esiste il token 499. Ciò impone un ciclo sequenziale: un passaggio in avanti per ogni token di output, eseguito uno dopo l’altro, senza alcuna possibilità di parallelizzazione lungo la sequenza. Produrre 500 token di output significa eseguire il modello 500 volte di seguito, non una sola volta.
Questa asimmetria nel calcolo — un passaggio parallelo per l’input, N passaggi sequenziali per N token di output — è il motivo per cui i prezzi di tutti i principali fornitori appaiono identici indipendentemente dall’azienda, dall’architettura del modello o dalla regione. Non si tratta tanto di una decisione aziendale quanto di un trasferimento diretto del costo di calcolo sottostante.
Cosa significa questo per i vostri prompt
La conclusione pratica è chiara: una risposta verbosa del modello costa sproporzionatamente di più rispetto a un prompt lungo con una risposta breve, anche quando il conteggio totale dei token sembra simile. Se state cercando di ridurre la spesa per l’API, ridurre la lunghezza dell’output di solito fa risparmiare di più per token rispetto a ridurre la lunghezza dell’input.
Alcune leve concrete:
- Limitate esplicitamente la lunghezza della risposta. Un’istruzione nel prompt di sistema come “rispondi in un paragrafo” o un limite
max_tokensincide maggiormente sui costi rispetto all’accorciare il proprio prompt. - Richiedi un output strutturato invece che in prosa. Un oggetto JSON con tre campi è spesso molto più breve dell’equivalente spiegato in frasi, e altrettanto utile a valle.
- Non fornire spiegazioni eccessive nel prompt di sistema per risparmiare sull’output. Un prompt di sistema più lungo e preciso (input, economico) che produca in modo affidabile una risposta breve e corretta (output, costoso) rappresenta solitamente uno scambio migliore rispetto a un prompt breve e vago che induce il modello a fornire una risposta prolissa.
- Utilizza un modello più economico per output ad alto volume e bassa complessità. Se un’attività non richiede il ragionamento di un modello all’avanguardia — classificazione, estrazione, risposte brevi — il costo dell’output di un modello di fascia economica è spesso di un ordine di grandezza inferiore.
Calcolo dell’importo effettivo in dollari
Il rapporto spiega perché l’output costa di più, ma la cifra esatta in dollari dipende dal modello che si sta utilizzando e dal numero di token effettivamente consumati da ciascuna parte di una richiesta. Poiché la ripartizione tra input e output — e il moltiplicatore tra di essi — varia effettivamente a seconda del modello (un modello economico e un modello di punta non applicano lo stesso rapporto), l’unico modo affidabile per conoscere il costo reale è inserire i propri numeri effettivi per ciascun modello.
Il Calcolatore dei prezzi delle API LLM di CodeKitHub fa esattamente questo: scegli il modello, inserisci il numero di token di input e di output, e ti mostrerà il costo di input, il costo di output e il totale — oltre a una stima mensile se sai approssimativamente quante richieste effettuerai. Se non sei sicuro di quanti token utilizzi effettivamente il tuo prompt, lo strumento Contatore di token ti fornisce il conteggio esatto utilizzando il tokenizer reale, anziché una stima approssimativa basata sui caratteri.
Entrambi funzionano interamente nel tuo browser: nessuna chiave API, nessun account, nessun dato inviato da nessuna parte.