Co je tento nástroj?
Jazykové modely nezpracovávají text znak po znaku ani slovo po slově — rozdělují ho na "tokeny", úseky, které mají obvykle jen několik znaků (v angličtině zhruba 4 znaky nebo 0,75 slova na token, ale výrazně se to liší podle jazyka a obsahu). Počet tokenů přímo určuje cenu API a to, zda se váš prompt vejde do kontextového okna modelu.
Tento nástroj používá skutečné tokenizační kódování — o200k_base (používá GPT-4o a GPT-4o mini) a cl100k_base (používá GPT-4 a GPT-3.5) — namísto hrubé aproximace "počet znaků děleno 4", takže počet, který zde vidíte, odpovídá tomu, za co byste skutečně platili nebo co by vás skutečně omezovalo.
Proč ho používat?
- Skutečné tokenizační kódování (o200k_base, cl100k_base) — ne odhad podle počtu znaků.
- Okamžité přepínání modelů pro porovnání, jak se stejný text jinak tokenizuje.
- Pro rychlou orientaci zobrazuje i počet znaků a slov.
- Aktualizuje se živě při psaní nebo vkládání — žádné tlačítko ke kliknutí.
- 100% lokálně — váš prompt nebo dokument se nikam neodesílá, což je důležité, pokud obsahuje důvěrný nebo citlivý text.
Jak se používá
- Vložte nebo napište svůj text, prompt nebo kód do pole.
- Vyberte cílový model (GPT-4o / GPT-4o mini, nebo GPT-4 / GPT-3.5).
- Počet tokenů se aktualizuje okamžitě — přepínáním modelů je můžete porovnat.
- Počty znaků/slov použijte jako kontrolu nebo pro limity, které nejsou založené na tokenech.
Příklad
Vstup
"Hello, world!" (kódování GPT-4o)Výstup
4 tokeny, 13 znaků, 2 slovaBěžné krátké fráze se často tokenizují jako 1 token na slovo nebo interpunkční znaménko, ale liší se to podle velikosti písmen, mezer a jazyka.
Který tokenizér zkontrolovat?
Obě kódování nejsou zaměnitelná — vyberte to, které odpovídá modelu, jaký skutečně voláte, protože stejný text se u každého z nich může tokenizovat na výrazně odlišný počet.
| Rodina modelů | Tokenizér | Kdy jej použít |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, reasoning modely o1/o3 | o200k_base | Jakýkoli aktuální model OpenAI — tento tokenizér OpenAI nasadila pro všechny novější modely od GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Starší nebo dosluhující modely OpenAI, nebo pokud vaše API volání z cenových důvodů stále cílí na GPT-3.5/GPT-4 (ne GPT-4o). |
| Claude, Gemini, Llama a další modely mimo OpenAI | Žádný — zde nejsou zahrnuty | Tito poskytovatelé používají vlastní tokenizéry (nezaložené na tiktoken); počty zde nebudou odpovídat jejich fakturaci. |
Praktické tipy
- Odhad ceny API před odesláním požadavku: vynásobte počet tokenů cenou za token u svého modelu a získáte rychlý odhad ceny, místo hádání podle počtu znaků.
- Kontrola, zda se dlouhý dokument vejde do kontextového okna modelu: vložte celý text sem — je to mnohem rychlejší než metodou pokus-omyl testovat skutečné volání API, které v polovině selže.
- Porovnávání variant promptů: pokud se snažíte zkrátit systémový prompt kvůli úspoře nákladů, vložte sem každou verzi a uvidíte přímo úsporu tokenů, ne jen dojem "vypadá kratší".
- Text v jiném jazyce než angličtina: počty tokenů pro čínštinu, japonštinu, korejštinu a další nelatinská písma jsou často na znak mnohem vyšší než u angličtiny — ověřte to explicitně místo předpokladu, že platí pravidlo 4 znaků na token.
Časté dotazy
Proč dává stejný text různý počet tokenů u různých modelů?
GPT-4o a GPT-4o mini používají novější tokenizér (o200k_base) než GPT-4 a GPT-3.5 (cl100k_base) — obě kódování rozdělují text na jiný slovník úseků, takže stejný vstupní text se může tokenizovat na jiný počet podle toho, na jaký model cílíte.
Je 1 token opravdu zhruba 4 znaky?
To je hrubý průměr pro anglický text, ale výrazně se to liší: běžná anglická slova jsou často jeden token, zatímco vzácná slova, kód a zejména nelatinská písma (čínština, japonština, korejština, arabština) mohou zabírat výrazně více tokenů na znak. Pro cokoli citlivého na cenu nebo limit vždy zkontrolujte přesný počet místo spoléhání na pravidlo 4 znaků.
Volá tento nástroj API OpenAI pro počítání tokenů?
Ne. Používá implementaci v JavaScriptu se stejným tokenizačním kódováním (o200k_base, cl100k_base), která běží celá ve vašem prohlížeči. Není potřeba API klíč, neprobíhá žádný síťový požadavek a váš text se nikam neodesílá.
Proč záleží na počtu tokenů?
Ze dvou důvodů: ceny API se účtují za token (vstup i výstup) a každý model má maximální kontextové okno měřené v tokenech — pokud váš prompt spolu s očekávanou odpovědí tento limit překročí, požadavek selže nebo se ořízne. Kontrola počtu tokenů předem oběma problémům předchází.
Funguje to i pro Claude, Gemini nebo jiné modely mimo OpenAI?
Zobrazené počty platí konkrétně pro tokenizéry OpenAI (o200k_base a cl100k_base). Ostatní poskytovatelé používají vlastní tokenizéry, které mohou u stejného textu dávat výrazně odlišné počty — tento nástroj je nezahrnuje.
Kolik tokenů mám očekávat na slovo?
U běžného anglického textu je to zhruba 0,75 slova na token — takže článek o 1 000 slovech vychází přibližně na 1 300 tokenů. Kód se obvykle tokenizuje méně efektivně kvůli odsazení a symbolům a nelatinská písma stojí ještě více: čínský text často používá jeden nebo více tokenů na znak. Pokud plánujete náklady na API, změřte skutečný text zde místo odhadu jen podle počtu slov.