CodeKitHub
Szöveges eszközök

AI token-számláló

Utolsó frissítés:

Illessz be bármilyen szöveget, promptot vagy kódot, és lásd pontosan, hány tokent használ — ugyanazokkal a tokenizáló kódolásokkal, amelyeket az OpenAI modelljei belsőleg használnak (o200k_base a GPT-4o-hoz, cl100k_base a GPT-4/GPT-3.5-höz), nem egy hozzávetőleges karakterszám-becsléssel. A karakter- és szószám referenciaként mellette jelenik meg. Minden helyben, a böngésződben fut.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Mi ez az eszköz?

A nyelvi modellek nem karakterenként vagy szavanként dolgozzák fel a szöveget — hanem „tokenekre” bontják, amelyek gyakran néhány karakter hosszúak (angolul nagyjából 4 karakter vagy 0,75 szó per token, bár ez nyelvenként és tartalomtól függően nagyon eltérő lehet). A tokenszám közvetlenül meghatározza az API-költségedet, és azt, hogy a promptod belefér-e egy modell kontextusablakába.

Ez az eszköz a valódi tokenizáló kódolásokat használja — az o200k_base-t (amelyet a GPT-4o és a GPT-4o mini használ) és a cl100k_base-t (amelyet a GPT-4 és a GPT-3.5 használ) —, nem pedig egy hozzávetőleges „karakter osztva 4-gyel” közelítést, így az itt látott szám megegyezik azzal, amiért ténylegesen fizetnél, vagy ami korlátozna.

Miért érdemes használni?

  • Valódi tokenizáló kódolások (o200k_base, cl100k_base) — nem egy karakterszám-becslés.
  • Válts modellt azonnal, hogy összehasonlítsd, hogyan tokenizálódik ugyanaz a szöveg eltérően.
  • Karakter- és szószám mellette megjelenítve, gyors referenciaként.
  • Élőben frissül gépelés vagy beillesztés közben — nincs gomb, amit meg kellene nyomni.
  • 100%-ban helyi — a promptod vagy dokumentumod soha nem kerül feltöltésre, ami akkor számít, ha bizalmas vagy érzékeny szöveget tartalmaz.

Használati útmutató

  1. Illeszd be vagy írd be a szövegedet, promptodat vagy kódodat a mezőbe.
  2. Válaszd ki a célmodellt (GPT-4o / GPT-4o mini, vagy GPT-4 / GPT-3.5).
  3. A tokenszám azonnal frissül — válts modellt az összehasonlításhoz.
  4. Használd a karakter-/szószámokat mellette sanity check-ként, vagy nem token-alapú korlátokhoz.

Példa

Bemenet

„Hello, world!” (GPT-4o kódolás)

Kimenet

4 token, 13 karakter, 2 szó

A gyakori rövid kifejezések gyakran szavanként vagy írásjelenként 1 tokent adnak, de ez a nagybetűktől, szóközöktől és nyelvtől függően eltérő lehet.

Melyik tokenizálót érdemes ellenőrizni?

A két kódolás nem felcserélhető — válaszd azt, amelyik a ténylegesen hívott modellhez illik, mivel ugyanaz a szöveg érzékelhetően eltérő számra tokenizálódhat mindkettőben.

ModellcsaládTokenizálóMikor használd
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 reasoning modelleko200k_baseBármely jelenlegi OpenAI modell — ezt a tokenizálót szállítja az OpenAI minden újabb modellhez a GPT-4o óta.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseRégebbi vagy elavult OpenAI modellek, vagy ha az API-hívásaid még mindig a GPT-3.5/GPT-4-et célozzák (nem a GPT-4o-t) költségokból.
Claude, Gemini, Llama, más nem OpenAI modellekEgyik sem — itt nem szerepelEzek a szolgáltatók saját tokenizálót használnak (nem tiktoken-alapút); az itteni számok nem egyeznek meg a náluk fizetett összeggel.

Gyakorlati tippek

  • API-költség előzetes becsléséhez: szorozd meg a tokenszámot a modelled tokenenkénti árával a gyors költségbecsléshez, ahelyett hogy karakterszámból tippelnél.
  • Annak ellenőrzéséhez, hogy egy hosszú dokumentum belefér-e egy modell kontextusablakába: illeszd be először ide az egészet — sokkal gyorsabb, mint egy valódi API-hívást próbálgatni, amely félúton meghiúsul.
  • Prompt-tervezési variánsok összehasonlítása: ha egy rendszerpromptot próbálsz rövidíteni a költségek csökkentésére, illeszd be ide mindegyik verziót, hogy közvetlenül lásd a tokenmegtakarítást, ne csak azt, hogy „rövidebbnek tűnik”.
  • Nem angol szöveg: a kínai, japán, koreai és más nem latin írások tokenszáma gyakran sokkal magasabb karakterenként, mint az angolé — ezt kifejezetten ellenőrizd, ne feltételezd, hogy a 4 karakter/token szabály itt is érvényes.

Gyakori kérdések

Miért ad más tokenszámot ugyanaz a szöveg különböző modelleknél?

A GPT-4o és a GPT-4o mini újabb tokenizálót használ (o200k_base) mint a GPT-4 és a GPT-3.5 (cl100k_base) — a két kódolás eltérő szókészletre bontja a szöveget, így ugyanaz a bemenet más tokenszámra tokenizálódhat attól függően, melyik modellt célzod.

Tényleg kb. 4 karakter egy token?

Ez egy hozzávetőleges átlag angol prózára, de sokat változik: a gyakori angol szavak gyakran egy tokenre esnek, míg a ritka szavak, a kód és különösen a nem latin írások (kínai, japán, koreai, arab) érzékelhetően több tokent igényelhetnek karakterenként. Mindig ellenőrizd a pontos számot bármi költség- vagy korlátérzékeny esetén, ne hagyatkozz a 4 karakter/token szabályra.

Meghívja ez az eszköz az OpenAI API-t a tokenszámoláshoz?

Nem. Ugyanazon tokenizáló kódolások (o200k_base, cl100k_base) egy JavaScript implementációját használja, teljes egészében a böngésződben futva. Nincs szükség API-kulcsra, nincs hálózati kérés, és a szöveged soha nem kerül elküldésre sehova.

Miért fontos a tokenszámom?

Két okból: az API-árazás tokenenként történik (bemenet és kimenet), és minden modellnek van egy maximális kontextusablaka tokenben mérve — ha a promptod plusz a várt válasz meghaladja ezt a korlátot, a kérés meghiúsul vagy csonkolódik. A tokenszám előzetes ellenőrzése mindkét meglepetést elkerüli.

Működik ez a Claude-hoz, Geminihez vagy más, nem OpenAI modellekhez?

A megjelenített számok kifejezetten az OpenAI tokenizálóira vonatkoznak (o200k_base és cl100k_base). Más szolgáltatók saját tokenizálót használnak, amely érdemben eltérő számokat adhat ugyanarra a szövegre — ez az eszköz nem fedi le azokat.

Hány tokenre számíthatok szavanként?

Átlagos angol prózánál nagyjából 0,75 szó per token — így egy 1000 szavas cikk körülbelül 1300 tokenre esik. A kód általában kevésbé hatékonyan tokenizálódik a behúzás és a szimbólumok miatt, a nem latin írások pedig még többe kerülnek: a kínai szöveg gyakran egy vagy több tokent használ karakterenként. Ha API-költséget tervezel, mérd meg a tényleges szövegedet itt, ne csak a szószámból becsülj.

Kapcsolódó eszközök