CodeKitHub
Tekstitööriistad

AI Tokenite Loendur

Viimati uuendatud:

Kleebi mistahes tekst, prompt või kood ja näe täpselt, kui palju tokeneid see kasutab — kasutades samu tokeniseerimise kodeeringuid, mida OpenAI mudelid sisemiselt kasutavad (o200k_base GPT-4o jaoks, cl100k_base GPT-4/GPT-3.5 jaoks), mitte umbkaudset märkide arvu hinnangut. Kõrval näidatakse ka märkide ja sõnade arvu. Kõik toimub kohapeal sinu brauseris.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Mis see tööriist on?

Keelemudelid ei töötle teksti tähthaaval ega sõnahaaval — nad jagavad selle "tokeniteks", tükkideks, mis on tihti mõne tähemärgi pikkused (umbes 4 tähemärki ehk 0,75 sõna tokeni kohta inglise keeles, kuigi see varieerub palju keele ja sisu järgi). Tokenite arv määrab otseselt API kulu ja selle, kas prompt mahub mudeli kontekstiaknasse.

See tööriist kasutab tõelisi tokeniseerimise kodeeringuid — o200k_base (kasutusel GPT-4o ja GPT-4o mini puhul) ja cl100k_base (kasutusel GPT-4 ja GPT-3.5 puhul) — mitte umbkaudset "märgid jagatud 4-ga" ligikaudsust, nii et siin nähtav arv vastab sellele, mille eest sind tegelikult arveldatakse või piiratakse.

Miks seda kasutada?

  • Tõelised tokeniseerimise kodeeringud (o200k_base, cl100k_base) — mitte märkide arvu oletus.
  • Vaheta mudelit koheselt, et võrrelda, kuidas sama tekst erinevalt tokeniseerub.
  • Märkide ja sõnade arv on kõrval näha kiireks viiteks.
  • Uueneb elavalt kirjutades või kleepides — ei ole nuppu, mida vajutada.
  • 100% kohalik — sinu prompti või dokumenti ei laadita kunagi üles, mis on oluline, kui see sisaldab omanduslikku või tundlikku teksti.

Kuidas kasutada

  1. Kleebi või kirjuta oma tekst, prompt või kood kasti.
  2. Vali mudel, mida sihid (GPT-4o / GPT-4o mini, või GPT-4 / GPT-3.5).
  3. Tokenite arv uueneb koheselt — vaheta mudeleid võrdlemiseks.
  4. Kasuta kõrvalolevat märkide/sõnade arvu mõistlikkuse kontrolliks või mitte-tokenipõhiste piirangute jaoks.

Näide

Sisend

"Hello, world!" (GPT-4o kodeering)

Tulemus

4 tokenit, 13 märki, 2 sõna

Levinud lühikesed fraasid tokeniseeruvad tihti 1 tokeniks sõna või kirjavahemärgi kohta, aga see varieerub suurtähtede kasutuse, tühikute ja keele järgi.

Millist tokeniseerijat kontrollida?

Kaks kodeeringut pole vahetatavad — vali see, mis vastab mudelile, mida tegelikult kutsud, sest sama tekst võib mõlemas tokeniseeruda märgatavalt erineva arvuni.

MudeliperekondTokeniseerijaMillal kasutada
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 arutlusmudelido200k_baseIga hetkel kehtiv OpenAI mudeli väljalase — see on tokeniseerija, mida OpenAI on tarninud kõigile uuematele mudelitele alates GPT-4o-st.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseVanemad või pärandmudelid, või kui su API päringud sihivad ikka GPT-3.5/GPT-4 (mitte GPT-4o) kulu tõttu.
Claude, Gemini, Llama, teised mitte-OpenAI mudelidEi kumbki — pole siin kaetudNeed pakkujad kasutavad oma tokeniseerijaid (mitte tiktoken-põhiseid); siinsed arvud ei vasta nende arveldusele.

Praktilised näpunäited

  • API kulu hindamine enne päringu saatmist: korruta tokenite arv oma mudeli tokenihinnaga, et saada kiire kuluhinnang, mitte oletada märkide arvust.
  • Kontrollimine, kas pikk dokument mahub mudeli kontekstiaknasse: kleebi kogu tekst siia esmalt — see on palju kiirem kui tegeliku API kõne katse-eksitus, mis pooleli ebaõnnestub.
  • Prompt-inseneri variantide võrdlemine: kui üritad süsteemiprompti lühendada kulu kokkuhoiuks, kleebi iga versioon siia, et näha tokenite kokkuhoidu otse, mitte lihtsalt "see näib lühem".
  • Mitte-ingliskeelne tekst: hiina, jaapani, korea ja teiste mitte-ladina kirjade tokenite arv märgi kohta on tihti palju kõrgem kui inglise keeles — kontrolli seda selgesõnaliselt, mitte ära eelda, et 4-märki-tokeni-kohta reegel kehtib.

Korduma kippuvad küsimused

Miks annab sama tekst erineva mudeli puhul erineva tokenite arvu?

GPT-4o ja GPT-4o mini kasutavad uuemat tokeniseerijat (o200k_base) kui GPT-4 ja GPT-3.5 (cl100k_base) — need kaks kodeeringut jagavad teksti erinevasse tükkide sõnavarasse, seega sama sisend võib tokeniseeruda erinevaks arvuks olenevalt sihitud mudelist.

Kas 1 token on tõesti umbes 4 tähemärki?

See on umbkaudne keskmine inglise proosa jaoks, aga see varieerub palju: levinud inglise sõnad on tihti igaüks 1 token, samas kui harvad sõnad, kood ja eriti mitte-ladina kirjad (hiina, jaapani, korea, araabia) võivad võtta märgatavalt rohkem tokeneid märgi kohta. Kontrolli alati täpset arvu kõige puhul, mis on kulu- või piiritundlik, mitte ära tugine 4-märgi rusikareeglile.

Kas see tööriist kutsub tokenite loendamiseks OpenAI API-d?

Ei. See kasutab JavaScripti implementatsiooni samadest tokeniseerimise kodeeringutest (o200k_base, cl100k_base), mis töötab täielikult sinu brauseris. Ei vaja API võtit, ei tee võrgupäringut ja sinu teksti ei saadeta kunagi kuhugi.

Miks on tokenite arv oluline?

Kahel põhjusel: API hinnastamine arveldatakse tokeni kohta (sisend ja väljund) ning igal mudelil on maksimaalne kontekstiaken tokenites mõõdetuna — kui sinu prompt pluss oodatav vastus ületab selle piiri, päring ebaõnnestub või kärbitakse. Tokenite arvu ette kontrollimine väldib mõlemat üllatust.

Kas see töötab Claude'i, Gemini või teiste mitte-OpenAI mudelite jaoks?

Näidatud arvud on spetsiifiliselt OpenAI tokeniseerijate jaoks (o200k_base ja cl100k_base). Teised pakkujad kasutavad oma tokeniseerijaid, mis võivad sama teksti puhul anda oluliselt erineva arvu — see tööriist neid ei kata.

Kui palju tokeneid peaksin sõna kohta ootama?

Tavalise inglise proosa puhul umbes 0,75 sõna tokeni kohta — seega 1000-sõnaline artikkel jääb umbes 1300 tokeni juurde. Kood tokeniseerub tavaliselt vähem tõhusalt taandete ja sümbolite tõttu, ning mitte-ladina kirjad maksavad veelgi rohkem: hiina tekst kasutab tihti ühe või mitu tokenit märgi kohta. Kui planeerid API kulusid, mõõda oma tegelikku teksti siin, mitte ära hinda ainult sõnade arvust.

Seotud tööriistad