CodeKitHub
Teksta rīki

AI tokenu skaitītājs

Pēdējoreiz atjaunināts:

Ielīmē jebkuru tekstu, uzvedni vai kodu un redzi precīzi, cik tokenu tas izmanto — izmantojot tos pašus tokenizācijas kodējumus, kurus iekšēji izmanto OpenAI modeļi (o200k_base GPT-4o, cl100k_base GPT-4/GPT-3.5), nevis rupju rakstzīmju skaita novērtējumu. Blakus tiek rādīts arī rakstzīmju un vārdu skaits. Viss darbojas lokāli tavā pārlūkā.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Kas ir šis rīks?

Valodu modeļi neapstrādā tekstu pa rakstzīmēm vai pa vārdiem — tie to sadala "tokenos", gabalos, kas bieži ir dažas rakstzīmes gari (aptuveni 4 rakstzīmes jeb 0,75 vārdi uz tokenu angļu valodā, lai gan tas ievērojami atšķiras atkarībā no valodas un satura). Tokenu skaits tieši nosaka tavas API izmaksas un to, vai tava uzvedne ietilpst modeļa konteksta logā.

Šis rīks izmanto īstus tokenizācijas kodējumus — o200k_base (ko izmanto GPT-4o un GPT-4o mini) un cl100k_base (ko izmanto GPT-4 un GPT-3.5) — nevis rupju "rakstzīmes dalīts ar 4" tuvinājumu, tāpēc šeit redzamais skaitlis atbilst tam, par ko tevi patiešām rēķinātu vai ierobežotu.

Kāpēc to izmantot?

  • Īsti tokenizācijas kodējumi (o200k_base, cl100k_base) — ne rakstzīmju skaita minējums.
  • Momentāna modeļu maiņa, lai salīdzinātu, kā tas pats teksts tokenizējas atšķirīgi.
  • Blakus rādīts rakstzīmju un vārdu skaits ātrai atsaucei.
  • Atjaunojas dzīvē, kamēr raksti vai ielīmē — nav pogas, ko spiest.
  • 100% lokāli — tava uzvedne vai dokuments nekad netiek augšupielādēts, kas ir svarīgi, ja tas satur konfidenciālu vai sensitīvu tekstu.

Kā to lietot

  1. Ielīmē vai ieraksti savu tekstu, uzvedni vai kodu laukā.
  2. Izvēlies modeli, kuru mērķē (GPT-4o / GPT-4o mini vai GPT-4 / GPT-3.5).
  3. Tokenu skaits atjaunojas uzreiz — pārslēdz modeļus, lai salīdzinātu.
  4. Izmanto rakstzīmju/vārdu skaitu blakus kā pārbaudi vai limitiem, kas nav balstīti uz tokeniem.

Piemērs

Ievade

"Sveika, pasaule!" (GPT-4o kodējums)

Izvade

4 tokeni, 16 rakstzīmes, 2 vārdi

Bieži īsas frāzes tokenizējas kā 1 tokens uz vārdu vai pieturzīmi, taču tas mainās atkarībā no lielo/mazo burtu lietojuma, atstarpēm un valodas.

Kuru tokenizatoru pārbaudīt?

Abi kodējumi nav savstarpēji aizvietojami — izvēlies to, kas atbilst modelim, kuru faktiski izsauc, jo tas pats teksts var tokenizēties manāmi atšķirīgā skaitā katrā no tiem.

Modeļu saimeTokenizatorsKad izmantot
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 spriešanas modeļio200k_baseJebkurš aktuāls OpenAI modeļa laidiens — šo tokenizatoru OpenAI izmanto visiem jaunākajiem modeļiem kopš GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseVecāki vai novecojuši OpenAI modeļi, vai ja tavi API izsaukumi izmaksu dēļ joprojām izmanto GPT-3.5/GPT-4 (nevis GPT-4o).
Claude, Gemini, Llama un citi ne-OpenAI modeļiNekas no šiem — šeit netiek aptvertsŠie pakalpojumu sniedzēji izmanto savus tokenizatorus (nevis balstītus uz tiktoken); šeit rādītais skaits nesakritīs ar viņu rēķiniem.

Praktiski padomi

  • API izmaksu novērtēšana pirms pieprasījuma sūtīšanas: reizini tokenu skaitu ar sava modeļa cenu par tokenu, lai iegūtu ātru izmaksu novērtējumu, nevis mini pēc rakstzīmju skaita.
  • Pārbaude, vai garš dokuments ietilpst modeļa konteksta logā: vispirms ielīmē visu šeit — tas ir daudz ātrāk nekā mēģinājumi ar kļūdainu API izsaukumu, kas neizdodas pusceļā.
  • Uzvednes veidošanas variantu salīdzināšana: ja mēģini saīsināt sistēmas uzvedni, lai ietaupītu izmaksas, ielīmē katru versiju šeit, lai redzētu tieši tokenu ietaupījumu, nevis "izskatās īsāks".
  • Ne-angļu teksts: tokenu skaits ķīniešu, japāņu, korejiešu un citiem ne-latīņu rakstiem bieži ir daudz augstāks uz rakstzīmi nekā angļu valodā — pārbaudi to skaidri, nevis pieņem, ka darbojas 4 rakstzīmju uz tokenu likums.

Biežāk uzdotie jautājumi

Kāpēc tas pats teksts dod atšķirīgu tokenu skaitu dažādiem modeļiem?

GPT-4o un GPT-4o mini izmanto jaunāku tokenizatoru (o200k_base) nekā GPT-4 un GPT-3.5 (cl100k_base) — abi kodējumi sadala tekstu atšķirīgā vārdnīcas gabalu kopā, tāpēc tieši tas pats ievads var tokenizēties atšķirīgā skaitā atkarībā no tā, kuru modeli mērķē.

Vai 1 tokens tiešām ir apmēram 4 rakstzīmes?

Tas ir rupjš vidējais rādītājs angļu prozai, taču tas ievērojami atšķiras: bieži lietoti angļu vārdi bieži ir pa 1 tokenam katrs, savukārt reti vārdi, kods un jo īpaši ne-latīņu raksti (ķīniešu, japāņu, korejiešu, arābu) var prasīt manāmi vairāk tokenu uz rakstzīmi. Vienmēr pārbaudi precīzu skaitu jebkam, kas ir izmaksu vai limitu ziņā svarīgs, nevis paļaujies uz 4 rakstzīmju likumu.

Vai šis rīks izsauc OpenAI API, lai saskaitītu tokenus?

Nē. Tas izmanto JavaScript implementāciju tiem pašiem tokenizācijas kodējumiem (o200k_base, cl100k_base), kas darbojas pilnībā tavā pārlūkā. Nav vajadzīga API atslēga, nav tīkla pieprasījuma, un tavs teksts nekad netiek nosūtīts.

Kāpēc man ir svarīgs tokenu skaits?

Divu iemeslu dēļ: API cenas tiek rēķinātas par katru tokenu (ievadi un izvadi), un katram modelim ir maksimāls konteksta logs, kas mērīts tokenos — ja tava uzvedne plus gaidāmā atbilde pārsniedz šo limitu, pieprasījums neizdodas vai tiek saīsināts. Tokenu skaita pārbaude iepriekš novērš abus pārsteigumus.

Vai tas darbojas Claude, Gemini vai citiem ne-OpenAI modeļiem?

Šeit rādītais skaits ir tieši OpenAI tokenizatoriem (o200k_base un cl100k_base). Citi pakalpojumu sniedzēji izmanto savus tokenizatorus, kas tam pašam tekstam var dot ievērojami atšķirīgu skaitu — šis rīks tos neaptver.

Cik tokenu jāgaida uz vārdu?

Parastai angļu prozai — aptuveni 0,75 vārdi uz tokenu, tāpēc 1000 vārdu raksts iznāk apmēram 1300 tokenu. Kods parasti tokenizējas neefektīvāk atkāpju un simbolu dēļ, un ne-latīņu raksti izmaksā vēl vairāk: ķīniešu tekstā bieži tiek izmantots viens vai vairāki tokeni uz rakstzīmi. Ja plāno API izmaksas, izmēri savu faktisko tekstu šeit, nevis vērtē to tikai pēc vārdu skaita.

Saistītie rīki