Čo je tento nástroj?
Jazykové modely nespracúvajú text po znakoch ani po slovách — rozdeľujú ho na „tokeny“, úseky dlhé zvyčajne pár znakov (približne 4 znaky alebo 0,75 slova na token v angličtine, hoci sa to výrazne líši podľa jazyka a obsahu). Počet tokenov priamo určuje cenu API a to, či sa váš prompt zmestí do kontextového okna modelu.
Tento nástroj používa skutočné tokenizačné enkódovania — o200k_base (používa GPT-4o a GPT-4o mini) a cl100k_base (používa GPT-4 a GPT-3.5) — namiesto hrubej aproximácie „počet znakov delený 4“, takže počet, ktorý tu vidíte, zodpovedá tomu, za čo skutočne platíte alebo čím ste limitovaní.
Prečo ho používať?
- Skutočné tokenizačné enkódovania (o200k_base, cl100k_base) — nie odhad podľa počtu znakov.
- Okamžité prepínanie modelov na porovnanie, ako sa ten istý text tokenizuje inak.
- Počet znakov a slov zobrazený vedľa toho, pre rýchlu referenciu.
- Aktualizuje sa naživo pri písaní alebo vkladaní — netreba klikať na žiadne tlačidlo.
- 100 % lokálne — váš prompt alebo dokument sa nikdy nikam neposiela, čo je dôležité, ak obsahuje dôverný alebo citlivý text.
Ako sa používa
- Vložte alebo napíšte svoj text, prompt alebo kód do poľa.
- Vyberte model, na ktorý cielite (GPT-4o / GPT-4o mini, alebo GPT-4 / GPT-3.5).
- Počet tokenov sa aktualizuje okamžite — prepínajte modely a porovnávajte.
- Počet znakov/slov popri tom použite ako kontrolu alebo pri limitoch nezávislých od tokenov.
Príklad
Vstup
"Hello, world!" (enkódovanie GPT-4o)Výstup
4 tokeny, 13 znakov, 2 slováBežné krátke frázy sa často tokenizujú ako 1 token na slovo alebo interpunkčné znamienko, no líši sa to podľa veľkosti písmen, medzier a jazyka.
Ktorý tokenizér si vybrať?
Tieto dve enkódovania nie sú zameniteľné — vyberte to, ktoré zodpovedá modelu, ktorý skutočne voláte, keďže ten istý text sa v každom môže tokenizovať na výrazne odlišný počet.
| Rodina modelov | Tokenizér | Kedy ho použiť |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, reasoning modely o1/o3 | o200k_base | Akýkoľvek súčasný model od OpenAI — toto je tokenizér, ktorý OpenAI nasadila pre všetky novšie modely od GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Staršie alebo legacy modely OpenAI, alebo ak vaše API volania z cenových dôvodov stále cielia na GPT-3.5/GPT-4 (nie GPT-4o). |
| Claude, Gemini, Llama, iné modely mimo OpenAI | Žiadne — tu nepokryté | Títo poskytovatelia používajú vlastné tokenizéry (nezaložené na tiktoken); počty tu nebudú zodpovedať ich cenotvorbe. |
Praktické tipy
- Odhad ceny API pred odoslaním požiadavky: vynásobte počet tokenov cenou vášho modelu za token, aby ste rýchlo odhadli náklady, namiesto hádania z počtu znakov.
- Overenie, či sa dlhý dokument zmestí do kontextového okna modelu: vložte celý text sem najprv — je to oveľa rýchlejšie než skúšať a chybovať cez skutočné API volanie, ktoré zlyhá v polovici.
- Porovnávanie variantov pri prompt engineeringu: ak sa snažíte skrátiť systémový prompt kvôli úspore nákladov, vložte sem každú verziu, aby ste videli priamu úsporu tokenov, nie len dojem „vyzerá kratšie“.
- Neanglický text: počet tokenov pre čínsky, japonský, kórejský a iný neLatinský text je často oveľa vyšší na znak než pri angličtine — overte si to výslovne, namiesto predpokladania, že platí pravidlo 4 znaky na token.
Časté otázky
Prečo dáva ten istý text iný počet tokenov pri rôznych modeloch?
GPT-4o a GPT-4o mini používajú novší tokenizér (o200k_base) než GPT-4 a GPT-3.5 (cl100k_base) — tieto dve enkódovania rozdeľujú text na iný slovník úsekov, takže rovnaký vstup sa môže tokenizovať na iný počet podľa toho, na ktorý model cielite.
Je 1 token naozaj zhruba 4 znaky?
Ide o hrubý priemer pre anglickú prózu, no líši sa to výrazne: bežné anglické slová sú často po 1 tokene, zatiaľ čo zriedkavé slová, kód a najmä neLatinské písma (čínština, japončina, kórejčina, arabčina) môžu spotrebovať výrazne viac tokenov na znak. Pri všetkom citlivom na cenu alebo limity si vždy overte presný počet namiesto spoliehania sa na pravidlo „4 znaky“.
Volá tento nástroj OpenAI API na počítanie tokenov?
Nie. Používa JavaScriptovú implementáciu rovnakých tokenizačných enkódovaní (o200k_base, cl100k_base), ktorá beží celá vo vašom prehliadači. Nie je potrebný žiadny API kľúč, žiadna sieťová požiadavka a váš text sa nikam neposiela.
Prečo záleží na počte tokenov?
Z dvoch dôvodov: API cenotvorba sa účtuje za token (vstup aj výstup) a každý model má maximálne kontextové okno merané v tokenoch — ak váš prompt spolu s očakávanou odpoveďou tento limit prekročí, požiadavka zlyhá alebo sa skráti. Kontrola počtu tokenov vopred zabráni obom prekvapeniam.
Funguje toto aj pre Claude, Gemini alebo iné modely mimo OpenAI?
Zobrazené počty sú špecifické pre tokenizéry OpenAI (o200k_base a cl100k_base). Iní poskytovatelia používajú vlastné tokenizéry, ktoré môžu pri rovnakom texte dávať výrazne odlišné počty — tento nástroj ich nepokrýva.
Koľko tokenov mám očakávať na slovo?
Pri bežnej anglickej próze je to približne 0,75 slova na token — takže 1 000-slovný článok vyjde na približne 1 300 tokenov. Kód sa zvyčajne tokenizuje menej efektívne kvôli odsadeniu a symbolom a neLatinské písma sú ešte drahšie: čínsky text často spotrebuje jeden alebo viac tokenov na znak. Ak plánujete náklady na API, radšej si zmerajte skutočný text tu, než odhadovať len z počtu slov.