CodeKitHub
Alati za tekst

AI brojač tokena

Zadnje ažurirano:

Zalijepi bilo koji tekst, prompt ili kod i vidi točno koliko tokena koristi — koristeći iste enkoding tokenizatore koje interno koriste OpenAI-jevi modeli (o200k_base za GPT-4o, cl100k_base za GPT-4/GPT-3.5), ne grubu procjenu po broju znakova. Broj znakova i riječi prikazani su uz to kao referenca. Sve se izvršava lokalno u tvom pregledniku.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Što je ovaj alat?

Jezični modeli ne obrađuju tekst znak po znak ili riječ po riječ — dijele ga na "tokene", dijelove koji su često dugi nekoliko znakova (otprilike 4 znaka ili 0,75 riječi po tokenu na engleskom, iako to jako varira ovisno o jeziku i sadržaju). Broj tokena izravno određuje trošak tvog API poziva i to stane li tvoj prompt unutar kontekstnog prozora modela.

Ovaj alat koristi prave tokenizator enkodinge — o200k_base (koji koriste GPT-4o i GPT-4o mini) i cl100k_base (koji koriste GPT-4 i GPT-3.5) — umjesto grube aproksimacije "znakovi podijeljeni s 4", pa se broj koji vidiš ovdje podudara s onim za što bi te stvarno naplatili ili ograničili.

Zašto ga koristiti?

  • Pravi tokenizator enkodinzi (o200k_base, cl100k_base) — ne procjena po broju znakova.
  • Trenutna promjena modela za usporedbu kako se isti tekst drugačije tokenizira.
  • Broj znakova i riječi prikazan uz to, za brzu referencu.
  • Ažurira se uživo dok tipkaš ili lijepiš — nema gumba za klik.
  • 100% lokalno — tvoj prompt ili dokument se nikad ne prenosi, što je bitno ako sadrži vlasnički ili osjetljiv tekst.

Kako ga koristiti

  1. Zalijepi ili upiši svoj tekst, prompt ili kod u polje.
  2. Odaberi model koji ciljaš (GPT-4o / GPT-4o mini, ili GPT-4 / GPT-3.5).
  3. Broj tokena se odmah ažurira — promijeni model za usporedbu.
  4. Koristi broj znakova/riječi uz to kao provjeru zdravog razuma ili za ograničenja koja nisu temeljena na tokenima.

Primjer

Ulaz

"Hello, world!" (GPT-4o enkoding)

Izlaz

4 tokena, 13 znakova, 2 riječi

Uobičajene kratke fraze često se tokeniziraju kao 1 token po riječi ili interpunkcijskom znaku, ali to varira s velikim slovima, razmacima i jezikom.

Koji tokenizator trebaš provjeriti?

Ta dva enkodinga nisu zamjenjiva — odaberi onaj koji odgovara modelu koji stvarno pozivaš, jer se isti tekst može tokenizirati na primjetno drugačiji broj u svakom od njih.

Obitelj modelaTokenizatorKada ga koristiti
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 modeli za rezoniranjeo200k_baseSvaki trenutni OpenAI izdanje modela — ovo je tokenizator koji OpenAI koristi za sve novije modele od GPT-4o nadalje.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseStariji ili zastarjeli OpenAI modeli, ili ako tvoji API pozivi i dalje ciljaju GPT-3.5/GPT-4 (ne GPT-4o) zbog troška.
Claude, Gemini, Llama, drugi modeli koji nisu od OpenAI-jaNijedan — nije pokriveno ovdjeOvi pružatelji koriste vlastite tokenizatore (nisu temeljeni na tiktokenu); brojevi ovdje neće odgovarati njihovoj naplati.

Praktični savjeti

  • Procjena API troška prije slanja zahtjeva: pomnoži broj tokena s cijenom po tokenu tvog modela za brzu procjenu troška, umjesto nagađanja iz broja znakova.
  • Provjera stane li dugačak dokument u kontekstni prozor modela: prvo zalijepi cijeli tekst ovdje — mnogo je brže nego pokušajima i pogreškama testirati stvaran API poziv koji ne uspijeva na pola puta.
  • Usporedba varijanti prompt inženjeringa: ako pokušavaš skratiti sistemski prompt radi uštede troška, zalijepi svaku verziju ovdje da izravno vidiš uštedu tokena, ne samo "izgleda kraće".
  • Tekst koji nije na engleskom: broj tokena za kineski, japanski, korejski i druga pisma koja nisu latinica često je mnogo veći po znaku od engleskog — provjeri to izričito umjesto pretpostavljanja da vrijedi pravilo 4 znaka po tokenu.

Često postavljana pitanja

Zašto isti tekst daje drugačiji broj tokena za različite modele?

GPT-4o i GPT-4o mini koriste noviji tokenizator (o200k_base) od GPT-4 i GPT-3.5 (cl100k_base) — ta dva enkodinga dijele tekst na drugačiji rječnik dijelova, pa se potpuno isti unos može tokenizirati na drugačiji broj ovisno o tome koji model ciljaš.

Je li 1 token stvarno oko 4 znaka?

To je gruba prosjek za engleski tekst, ali jako varira: uobičajene engleske riječi često su 1 token svaka, dok rijetke riječi, kod, a posebno pisma koja nisu latinica (kineski, japanski, korejski, arapski) mogu trošiti primjetno više tokena po znaku. Uvijek provjeri točan broj za sve što je osjetljivo na trošak ili ograničenje, umjesto oslanjanja na pravilo od 4 znaka.

Poziva li ovaj alat OpenAI API za brojanje tokena?

Ne. Koristi JavaScript implementaciju istih tokenizator enkodinga (o200k_base, cl100k_base), koja se u potpunosti izvršava u tvom pregledniku. Nije potreban API ključ, nema mrežnog zahtjeva, a tvoj tekst se nikad nikamo ne šalje.

Zašto je moj broj tokena bitan?

Dva razloga: API cijene se naplaćuju po tokenu (ulaz i izlaz), a svaki model ima maksimalan kontekstni prozor mjeren u tokenima — ako tvoj prompt plus očekivani odgovor premaši to ograničenje, zahtjev ne uspijeva ili se skraćuje. Provjera broja tokena unaprijed izbjegava oba iznenađenja.

Radi li ovo za Claude, Gemini ili druge modele koji nisu od OpenAI-ja?

Prikazani brojevi specifično su za OpenAI-jeve tokenizatore (o200k_base i cl100k_base). Drugi pružatelji koriste vlastite tokenizatore, koji mogu dati značajno drugačije brojeve za isti tekst — ovaj alat to ne pokriva.

Koliko tokena trebam očekivati po riječi?

Za običan engleski tekst, otprilike 0,75 riječi po tokenu — pa članak od 1.000 riječi iznosi oko 1.300 tokena. Kod se obično tokenizira manje učinkovito zbog uvlačenja i simbola, a pisma koja nisu latinica koštaju još više: kineski tekst često koristi jedan ili više tokena po znaku. Ako planiraš API troškove, izmjeri svoj stvarni tekst ovdje umjesto procjene iz broja riječi.

Povezani alati