CodeKitHub
Italiano
Strumenti di testo

Contatore di token AI

Inserisci qualsiasi testo, prompt o codice e scopri esattamente quanti token utilizza — utilizzando le stesse codifiche del tokenizer che i modelli di OpenAI usano internamente (o200k_base per GPT-4o, cl100k_base per GPT-4/GPT-3.5), non una stima approssimativa del numero di caratteri. Il conteggio dei caratteri e delle parole viene mostrato a fianco come riferimento. Tutto funziona localmente nel tuo browser.

0
Token
0
Caratteri
0
Parole

I diversi modelli effettuano la tokenizzazione del testo in modi diversi: prova a cambiare il modello sopra indicato per vedere come cambia il conteggio. Tutti i calcoli vengono effettuati localmente; il tuo testo non viene mai caricato online.

Che cos'è questo strumento?

I modelli linguistici non elaborano il testo carattere per carattere o parola per parola, ma lo suddividono in “token”, ovvero segmenti che spesso contengono pochi caratteri (circa 4 caratteri o 0,75 parole per token in inglese, anche se questo valore varia notevolmente a seconda della lingua e del contenuto). Il numero di token determina direttamente il costo dell’API e se il prompt rientra nella finestra di contesto del modello.

Questo strumento utilizza le codifiche effettive dei tokenizer — o200k_base (utilizzata da GPT-4o e GPT-4o mini) e cl100k_base (utilizzata da GPT-4 e GPT-3.5) — anziché un'approssimazione grossolana del tipo «caratteri divisi per 4», pertanto il conteggio visualizzato qui corrisponde a quello che verrebbe effettivamente addebitato o a cui si sarebbe soggetti in termini di limiti.

Perché usarlo?

  • Codifiche effettive del tokenizer (o200k_base, cl100k_base) — non si tratta di una stima basata sul conteggio dei caratteri.
  • Passa istantaneamente da un modello all'altro per confrontare le diverse modalità di tokenizzazione dello stesso testo.
  • Il numero di caratteri e di parole è indicato a fianco, per una rapida consultazione.
  • Gli aggiornamenti avvengono in tempo reale mentre digiti o incolli — non occorre cliccare su alcun pulsante.
  • 100% locale: il tuo prompt o documento non viene mai caricato, il che è importante se contiene testi riservati o sensibili.

Come si usa

  1. Incolla o digita il testo, il prompt o il codice nella casella.
  2. Scegli il modello che ti interessa (GPT-4o / GPT-4o mini oppure GPT-4 / GPT-3.5).
  3. Il conteggio dei token si aggiorna istantaneamente: cambia modello per confrontarli.
  4. Utilizza il conteggio dei caratteri/delle parole riportato qui accanto come controllo di verifica o per i limiti non basati sui token.

Esempio

Input

"Hello, world!" (GPT-4o encoding)

Risultato

4 tokens, 13 characters, 2 words

Le frasi brevi comuni vengono spesso suddivise in token con un token per parola o segno di punteggiatura, ma ciò varia a seconda dell'uso delle maiuscole, degli spazi e della lingua.

Quale tokenizer dovresti provare?

Le due codifiche non sono intercambiabili: scegli quella corrispondente al modello che stai effettivamente chiamando, poiché lo stesso testo può essere suddiviso in token con un numero di token notevolmente diverso a seconda della codifica utilizzata.

Famiglia di modelliTokenizzatoreQuando utilizzarlo
GPT-4o, GPT-4o mini, GPT-4.1, modelli di ragionamento o1/o3o200k_baseQualsiasi versione attuale dei modelli OpenAI — si tratta del tokenizer che OpenAI ha integrato in tutti i modelli più recenti a partire da GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseModelli OpenAI più vecchi o obsoleti, oppure se le tue chiamate API sono ancora indirizzate a GPT-3.5/GPT-4 (e non a GPT-4o) per motivi di costo.
Claude, Gemini, Llama e altri modelli non OpenAINessuna delle due — argomento non trattato in questa sedeQuesti fornitori utilizzano i propri tokenizzatori (non basati su tiktoken); i conteggi qui riportati non corrisponderanno a quelli utilizzati ai fini della fatturazione.

Consigli pratici

  • Stima del costo dell'API prima di inviare una richiesta: moltiplica il numero di token per il prezzo per token del tuo modello per ottenere una stima rapida del costo, invece di fare una stima approssimativa basandoti sul numero di caratteri.
  • Per verificare se un documento lungo rientra nella finestra di contesto di un modello: incolla prima l'intero testo qui — è molto più veloce che procedere per tentativi con una chiamata API vera e propria che potrebbe fallire a metà.
  • Confronto tra diverse varianti di prompt engineering: se stai cercando di accorciare il prompt di un sistema per ridurre i costi, incolla qui ciascuna versione per vedere direttamente il risparmio in termini di token, non solo per constatare che “sembra più breve”.
  • Testo in lingua diversa dall'inglese: il numero di token per il cinese, il giapponese, il coreano e altre scritture non latine è spesso molto più elevato per carattere rispetto all'inglese — è opportuno verificarlo esplicitamente, anziché dare per scontato che si applichi la regola dei 4 caratteri per token.

Domande frequenti

Perché lo stesso testo restituisce un conteggio dei token diverso a seconda dei modelli?

GPT-4o e GPT-4o mini utilizzano un tokenizzatore più recente (o200k_base) rispetto a GPT-4 e GPT-3.5 (cl100k_base): i due codificatori suddividono il testo in un vocabolario di segmenti diverso, pertanto lo stesso identico input può essere tokenizzato con un numero di token diverso a seconda del modello utilizzato.

Un token corrisponde davvero a circa 4 caratteri?

Si tratta di una media approssimativa per la prosa inglese, ma varia notevolmente: le parole comuni in inglese corrispondono spesso a un token ciascuna, mentre le parole rare, il codice e, soprattutto, gli alfabeti non latini (cinese, giapponese, coreano, arabo) possono richiedere un numero notevolmente maggiore di token per carattere. Verificate sempre il conteggio esatto per qualsiasi elemento sensibile al costo o al limite, piuttosto che affidarvi alla regola empirica dei 4 caratteri.

Questo strumento utilizza l'API di OpenAI per contare i token?

No. Utilizza un'implementazione in JavaScript delle stesse codifiche del tokenizer (o200k_base, cl100k_base), che gira interamente nel tuo browser. Non serve alcuna chiave API, non viene effettuata alcuna richiesta di rete e il tuo testo non viene mai inviato da nessuna parte.

Perché è importante il numero dei miei token?

Due motivi: il costo dell'API viene addebitato per token (in entrata e in uscita) e ogni modello ha una finestra di contesto massima misurata in token; se il prompt e la risposta prevista superano tale limite, la richiesta fallisce o viene troncata. Verificare in anticipo il numero di token permette di evitare entrambe le sorprese.

Funziona anche con Claude, Gemini o altri modelli non OpenAI?

I conteggi indicati si riferiscono specificatamente ai tokenizzatori di OpenAI (o200k_base e cl100k_base). Altri fornitori utilizzano i propri tokenizzatori, che possono fornire conteggi significativamente diversi per lo stesso testo; questo strumento non li tiene in considerazione.

Strumenti correlati