CodeKitHub
Instrumente text

Numărător de Tokeni AI

Ultima actualizare:

Lipește orice text, prompt sau cod și vezi exact câți tokeni folosește — folosind aceleași codificări de tokenizare pe care modelele OpenAI le folosesc intern (o200k_base pentru GPT-4o, cl100k_base pentru GPT-4/GPT-3.5), nu o estimare aproximativă bazată pe numărul de caractere. Numărul de caractere și cuvinte este afișat alături, ca referință. Totul rulează local, în browserul tău.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Ce este acest instrument?

Modelele de limbaj nu procesează textul caracter cu caracter sau cuvânt cu cuvânt — îl împart în "tokeni", bucăți care au adesea câteva caractere lungime (aproximativ 4 caractere sau 0,75 cuvinte per token în engleză, deși acest lucru variază mult în funcție de limbă și conținut). Numărul de tokeni determină direct costul tău de API și dacă promptul tău încape în fereastra de context a unui model.

Acest instrument folosește codificările reale ale tokenizatorului — o200k_base (folosit de GPT-4o și GPT-4o mini) și cl100k_base (folosit de GPT-4 și GPT-3.5) — în loc de o aproximare grosieră de tip "caractere împărțite la 4", astfel încât numărul pe care îl vezi aici corespunde exact cu ceea ce ai fi taxat sau limitat efectiv.

De ce să-l folosești?

  • Codificări reale de tokenizator (o200k_base, cl100k_base) — nu o presupunere bazată pe numărul de caractere.
  • Comută instant între modele pentru a compara cum se tokenizează diferit același text.
  • Numărul de caractere și cuvinte afișat alături, pentru referință rapidă.
  • Se actualizează live pe măsură ce scrii sau lipești — fără niciun buton de apăsat.
  • 100% local — promptul sau documentul tău nu este niciodată încărcat pe server, ceea ce contează dacă conține text proprietar sau sensibil.

Cum se folosește

  1. Lipește sau scrie textul, promptul sau codul tău în casetă.
  2. Alege modelul vizat (GPT-4o / GPT-4o mini, sau GPT-4 / GPT-3.5).
  3. Numărul de tokeni se actualizează instant — comută modelele pentru a compara.
  4. Folosește numărul de caractere/cuvinte alături, ca verificare de bun-simț sau pentru limite care nu se bazează pe tokeni.

Exemplu

Intrare

"Hello, world!" (codificare GPT-4o)

Rezultat

4 tokeni, 13 caractere, 2 cuvinte

Frazele scurte comune se tokenizează adesea ca 1 token pe cuvânt sau semn de punctuație, dar acest lucru variază în funcție de capitalizare, spațiere și limbă.

Ce tokenizator ar trebui să verifici?

Cele două codificări nu sunt interschimbabile — alege-o pe cea care corespunde modelului pe care îl apelezi efectiv, deoarece același text se poate tokeniza la un număr vizibil diferit în fiecare dintre ele.

Familie de modeleTokenizatorCând să-l folosești
GPT-4o, GPT-4o mini, GPT-4.1, modelele de raționament o1/o3o200k_baseOrice lansare curentă de model OpenAI — acesta este tokenizatorul pe care OpenAI l-a livrat pentru toate modelele mai noi de la GPT-4o încoace.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseModele OpenAI mai vechi sau vechi, sau dacă apelurile tale API vizează încă GPT-3.5/GPT-4 (nu GPT-4o) din motive de cost.
Claude, Gemini, Llama, alte modele non-OpenAINiciunul — nu este acoperit aiciAcești furnizori folosesc propriile tokenizatoare (nu bazate pe tiktoken); numerele de aici nu vor corespunde facturării lor.

Sfaturi practice

  • Estimarea costului API înainte de a trimite o solicitare: înmulțește numărul de tokeni cu prețul per token al modelului tău pentru a obține o estimare rapidă a costului, în loc să ghicești din numărul de caractere.
  • Verificarea dacă un document lung încape în fereastra de context a unui model: lipește totul aici mai întâi — este mult mai rapid decât încercarea repetată a unui apel API real care eșuează la jumătatea drumului.
  • Compararea variantelor de inginerie a prompturilor: dacă încerci să scurtezi un prompt de sistem pentru a economisi costuri, lipește fiecare versiune aici pentru a vedea economia de tokeni direct, nu doar impresia că "pare mai scurt".
  • Text non-englezesc: numărul de tokeni pentru chineză, japoneză, coreeană și alte scrieri non-latine este adesea mult mai mare per caracter decât în engleză — verifică asta explicit, în loc să presupui că regula de 4-caractere-per-token se aplică.

Întrebări frecvente

De ce același text dă un număr diferit de tokeni pentru modele diferite?

GPT-4o și GPT-4o mini folosesc un tokenizator mai nou (o200k_base) decât GPT-4 și GPT-3.5 (cl100k_base) — cele două codificări împart textul într-un vocabular diferit de bucăți, astfel încât exact aceeași intrare se poate tokeniza la un număr diferit, în funcție de modelul vizat.

Este 1 token cu adevărat aproximativ 4 caractere?

Aceasta este o medie aproximativă pentru proza în engleză, dar variază mult: cuvintele englezești comune sunt adesea câte 1 token fiecare, în timp ce cuvintele rare, codul și mai ales scrierile non-latine (chineză, japoneză, coreeană, arabă) pot lua vizibil mai mulți tokeni per caracter. Verifică întotdeauna numărul exact pentru orice este sensibil la cost sau limită, în loc să te bazezi pe regula aproximativă de 4 caractere.

Acest instrument apelează API-ul OpenAI pentru a număra tokenii?

Nu. Folosește o implementare JavaScript a acelorași codificări de tokenizator (o200k_base, cl100k_base), rulând în întregime în browserul tău. Nu este nevoie de nicio cheie API, nu se face nicio solicitare de rețea, iar textul tău nu este niciodată trimis nicăieri.

De ce contează numărul meu de tokeni?

Din două motive: prețul API-ului este taxat pe token (intrare și ieșire), iar fiecare model are o fereastră de context maximă măsurată în tokeni — dacă promptul tău plus răspunsul așteptat depășesc acea limită, solicitarea eșuează sau este trunchiată. Verificarea numărului de tokeni în avans evită ambele surprize.

Funcționează asta pentru Claude, Gemini sau alte modele non-OpenAI?

Numerele afișate sunt specifice tokenizatoarelor OpenAI (o200k_base și cl100k_base). Alți furnizori folosesc propriile tokenizatoare, care pot da numere semnificativ diferite pentru același text — acest instrument nu le acoperă.

La câți tokeni pe cuvânt ar trebui să mă aștept?

Pentru proza obișnuită în engleză, aproximativ 0,75 cuvinte per token — deci un articol de 1.000 de cuvinte ajunge la aproximativ 1.300 de tokeni. Codul se tokenizează de obicei mai puțin eficient din cauza indentării și simbolurilor, iar scrierile non-latine costă și mai mult: textul chinezesc folosește adesea unul sau mai mulți tokeni per caracter. Dacă îți bugetezi costurile API, măsoară textul tău real aici, în loc să estimezi doar din numărul de cuvinte.

Instrumente similare