CodeKitHub
Textové nástroje

Počítadlo tokenů AI

Naposledy aktualizováno:

Vložte libovolný text, prompt nebo kód a zjistěte přesně, kolik tokenů zabírá — pomocí stejného tokenizačního kódování, jaké interně používají modely OpenAI (o200k_base pro GPT-4o, cl100k_base pro GPT-4/GPT-3.5), nikoli hrubého odhadu podle počtu znaků. Pro srovnání jsou zobrazeny i počty znaků a slov. Vše probíhá lokálně ve vašem prohlížeči.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Co je tento nástroj?

Jazykové modely nezpracovávají text znak po znaku ani slovo po slově — rozdělují ho na "tokeny", úseky, které mají obvykle jen několik znaků (v angličtině zhruba 4 znaky nebo 0,75 slova na token, ale výrazně se to liší podle jazyka a obsahu). Počet tokenů přímo určuje cenu API a to, zda se váš prompt vejde do kontextového okna modelu.

Tento nástroj používá skutečné tokenizační kódování — o200k_base (používá GPT-4o a GPT-4o mini) a cl100k_base (používá GPT-4 a GPT-3.5) — namísto hrubé aproximace "počet znaků děleno 4", takže počet, který zde vidíte, odpovídá tomu, za co byste skutečně platili nebo co by vás skutečně omezovalo.

Proč ho používat?

  • Skutečné tokenizační kódování (o200k_base, cl100k_base) — ne odhad podle počtu znaků.
  • Okamžité přepínání modelů pro porovnání, jak se stejný text jinak tokenizuje.
  • Pro rychlou orientaci zobrazuje i počet znaků a slov.
  • Aktualizuje se živě při psaní nebo vkládání — žádné tlačítko ke kliknutí.
  • 100% lokálně — váš prompt nebo dokument se nikam neodesílá, což je důležité, pokud obsahuje důvěrný nebo citlivý text.

Jak se používá

  1. Vložte nebo napište svůj text, prompt nebo kód do pole.
  2. Vyberte cílový model (GPT-4o / GPT-4o mini, nebo GPT-4 / GPT-3.5).
  3. Počet tokenů se aktualizuje okamžitě — přepínáním modelů je můžete porovnat.
  4. Počty znaků/slov použijte jako kontrolu nebo pro limity, které nejsou založené na tokenech.

Příklad

Vstup

"Hello, world!" (kódování GPT-4o)

Výstup

4 tokeny, 13 znaků, 2 slova

Běžné krátké fráze se často tokenizují jako 1 token na slovo nebo interpunkční znaménko, ale liší se to podle velikosti písmen, mezer a jazyka.

Který tokenizér zkontrolovat?

Obě kódování nejsou zaměnitelná — vyberte to, které odpovídá modelu, jaký skutečně voláte, protože stejný text se u každého z nich může tokenizovat na výrazně odlišný počet.

Rodina modelůTokenizérKdy jej použít
GPT-4o, GPT-4o mini, GPT-4.1, reasoning modely o1/o3o200k_baseJakýkoli aktuální model OpenAI — tento tokenizér OpenAI nasadila pro všechny novější modely od GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseStarší nebo dosluhující modely OpenAI, nebo pokud vaše API volání z cenových důvodů stále cílí na GPT-3.5/GPT-4 (ne GPT-4o).
Claude, Gemini, Llama a další modely mimo OpenAIŽádný — zde nejsou zahrnutyTito poskytovatelé používají vlastní tokenizéry (nezaložené na tiktoken); počty zde nebudou odpovídat jejich fakturaci.

Praktické tipy

  • Odhad ceny API před odesláním požadavku: vynásobte počet tokenů cenou za token u svého modelu a získáte rychlý odhad ceny, místo hádání podle počtu znaků.
  • Kontrola, zda se dlouhý dokument vejde do kontextového okna modelu: vložte celý text sem — je to mnohem rychlejší než metodou pokus-omyl testovat skutečné volání API, které v polovině selže.
  • Porovnávání variant promptů: pokud se snažíte zkrátit systémový prompt kvůli úspoře nákladů, vložte sem každou verzi a uvidíte přímo úsporu tokenů, ne jen dojem "vypadá kratší".
  • Text v jiném jazyce než angličtina: počty tokenů pro čínštinu, japonštinu, korejštinu a další nelatinská písma jsou často na znak mnohem vyšší než u angličtiny — ověřte to explicitně místo předpokladu, že platí pravidlo 4 znaků na token.

Časté dotazy

Proč dává stejný text různý počet tokenů u různých modelů?

GPT-4o a GPT-4o mini používají novější tokenizér (o200k_base) než GPT-4 a GPT-3.5 (cl100k_base) — obě kódování rozdělují text na jiný slovník úseků, takže stejný vstupní text se může tokenizovat na jiný počet podle toho, na jaký model cílíte.

Je 1 token opravdu zhruba 4 znaky?

To je hrubý průměr pro anglický text, ale výrazně se to liší: běžná anglická slova jsou často jeden token, zatímco vzácná slova, kód a zejména nelatinská písma (čínština, japonština, korejština, arabština) mohou zabírat výrazně více tokenů na znak. Pro cokoli citlivého na cenu nebo limit vždy zkontrolujte přesný počet místo spoléhání na pravidlo 4 znaků.

Volá tento nástroj API OpenAI pro počítání tokenů?

Ne. Používá implementaci v JavaScriptu se stejným tokenizačním kódováním (o200k_base, cl100k_base), která běží celá ve vašem prohlížeči. Není potřeba API klíč, neprobíhá žádný síťový požadavek a váš text se nikam neodesílá.

Proč záleží na počtu tokenů?

Ze dvou důvodů: ceny API se účtují za token (vstup i výstup) a každý model má maximální kontextové okno měřené v tokenech — pokud váš prompt spolu s očekávanou odpovědí tento limit překročí, požadavek selže nebo se ořízne. Kontrola počtu tokenů předem oběma problémům předchází.

Funguje to i pro Claude, Gemini nebo jiné modely mimo OpenAI?

Zobrazené počty platí konkrétně pro tokenizéry OpenAI (o200k_base a cl100k_base). Ostatní poskytovatelé používají vlastní tokenizéry, které mohou u stejného textu dávat výrazně odlišné počty — tento nástroj je nezahrnuje.

Kolik tokenů mám očekávat na slovo?

U běžného anglického textu je to zhruba 0,75 slova na token — takže článek o 1 000 slovech vychází přibližně na 1 300 tokenů. Kód se obvykle tokenizuje méně efektivně kvůli odsazení a symbolům a nelatinská písma stojí ještě více: čínský text často používá jeden nebo více tokenů na znak. Pokud plánujete náklady na API, změřte skutečný text zde místo odhadu jen podle počtu slov.

Související nástroje