Mi ez az eszköz?
A nyelvi modellek nem karakterenként vagy szavanként dolgozzák fel a szöveget — hanem „tokenekre” bontják, amelyek gyakran néhány karakter hosszúak (angolul nagyjából 4 karakter vagy 0,75 szó per token, bár ez nyelvenként és tartalomtól függően nagyon eltérő lehet). A tokenszám közvetlenül meghatározza az API-költségedet, és azt, hogy a promptod belefér-e egy modell kontextusablakába.
Ez az eszköz a valódi tokenizáló kódolásokat használja — az o200k_base-t (amelyet a GPT-4o és a GPT-4o mini használ) és a cl100k_base-t (amelyet a GPT-4 és a GPT-3.5 használ) —, nem pedig egy hozzávetőleges „karakter osztva 4-gyel” közelítést, így az itt látott szám megegyezik azzal, amiért ténylegesen fizetnél, vagy ami korlátozna.
Miért érdemes használni?
- Valódi tokenizáló kódolások (o200k_base, cl100k_base) — nem egy karakterszám-becslés.
- Válts modellt azonnal, hogy összehasonlítsd, hogyan tokenizálódik ugyanaz a szöveg eltérően.
- Karakter- és szószám mellette megjelenítve, gyors referenciaként.
- Élőben frissül gépelés vagy beillesztés közben — nincs gomb, amit meg kellene nyomni.
- 100%-ban helyi — a promptod vagy dokumentumod soha nem kerül feltöltésre, ami akkor számít, ha bizalmas vagy érzékeny szöveget tartalmaz.
Használati útmutató
- Illeszd be vagy írd be a szövegedet, promptodat vagy kódodat a mezőbe.
- Válaszd ki a célmodellt (GPT-4o / GPT-4o mini, vagy GPT-4 / GPT-3.5).
- A tokenszám azonnal frissül — válts modellt az összehasonlításhoz.
- Használd a karakter-/szószámokat mellette sanity check-ként, vagy nem token-alapú korlátokhoz.
Példa
Bemenet
„Hello, world!” (GPT-4o kódolás)Kimenet
4 token, 13 karakter, 2 szóA gyakori rövid kifejezések gyakran szavanként vagy írásjelenként 1 tokent adnak, de ez a nagybetűktől, szóközöktől és nyelvtől függően eltérő lehet.
Melyik tokenizálót érdemes ellenőrizni?
A két kódolás nem felcserélhető — válaszd azt, amelyik a ténylegesen hívott modellhez illik, mivel ugyanaz a szöveg érzékelhetően eltérő számra tokenizálódhat mindkettőben.
| Modellcsalád | Tokenizáló | Mikor használd |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 reasoning modellek | o200k_base | Bármely jelenlegi OpenAI modell — ezt a tokenizálót szállítja az OpenAI minden újabb modellhez a GPT-4o óta. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Régebbi vagy elavult OpenAI modellek, vagy ha az API-hívásaid még mindig a GPT-3.5/GPT-4-et célozzák (nem a GPT-4o-t) költségokból. |
| Claude, Gemini, Llama, más nem OpenAI modellek | Egyik sem — itt nem szerepel | Ezek a szolgáltatók saját tokenizálót használnak (nem tiktoken-alapút); az itteni számok nem egyeznek meg a náluk fizetett összeggel. |
Gyakorlati tippek
- API-költség előzetes becsléséhez: szorozd meg a tokenszámot a modelled tokenenkénti árával a gyors költségbecsléshez, ahelyett hogy karakterszámból tippelnél.
- Annak ellenőrzéséhez, hogy egy hosszú dokumentum belefér-e egy modell kontextusablakába: illeszd be először ide az egészet — sokkal gyorsabb, mint egy valódi API-hívást próbálgatni, amely félúton meghiúsul.
- Prompt-tervezési variánsok összehasonlítása: ha egy rendszerpromptot próbálsz rövidíteni a költségek csökkentésére, illeszd be ide mindegyik verziót, hogy közvetlenül lásd a tokenmegtakarítást, ne csak azt, hogy „rövidebbnek tűnik”.
- Nem angol szöveg: a kínai, japán, koreai és más nem latin írások tokenszáma gyakran sokkal magasabb karakterenként, mint az angolé — ezt kifejezetten ellenőrizd, ne feltételezd, hogy a 4 karakter/token szabály itt is érvényes.
Gyakori kérdések
Miért ad más tokenszámot ugyanaz a szöveg különböző modelleknél?
A GPT-4o és a GPT-4o mini újabb tokenizálót használ (o200k_base) mint a GPT-4 és a GPT-3.5 (cl100k_base) — a két kódolás eltérő szókészletre bontja a szöveget, így ugyanaz a bemenet más tokenszámra tokenizálódhat attól függően, melyik modellt célzod.
Tényleg kb. 4 karakter egy token?
Ez egy hozzávetőleges átlag angol prózára, de sokat változik: a gyakori angol szavak gyakran egy tokenre esnek, míg a ritka szavak, a kód és különösen a nem latin írások (kínai, japán, koreai, arab) érzékelhetően több tokent igényelhetnek karakterenként. Mindig ellenőrizd a pontos számot bármi költség- vagy korlátérzékeny esetén, ne hagyatkozz a 4 karakter/token szabályra.
Meghívja ez az eszköz az OpenAI API-t a tokenszámoláshoz?
Nem. Ugyanazon tokenizáló kódolások (o200k_base, cl100k_base) egy JavaScript implementációját használja, teljes egészében a böngésződben futva. Nincs szükség API-kulcsra, nincs hálózati kérés, és a szöveged soha nem kerül elküldésre sehova.
Miért fontos a tokenszámom?
Két okból: az API-árazás tokenenként történik (bemenet és kimenet), és minden modellnek van egy maximális kontextusablaka tokenben mérve — ha a promptod plusz a várt válasz meghaladja ezt a korlátot, a kérés meghiúsul vagy csonkolódik. A tokenszám előzetes ellenőrzése mindkét meglepetést elkerüli.
Működik ez a Claude-hoz, Geminihez vagy más, nem OpenAI modellekhez?
A megjelenített számok kifejezetten az OpenAI tokenizálóira vonatkoznak (o200k_base és cl100k_base). Más szolgáltatók saját tokenizálót használnak, amely érdemben eltérő számokat adhat ugyanarra a szövegre — ez az eszköz nem fedi le azokat.
Hány tokenre számíthatok szavanként?
Átlagos angol prózánál nagyjából 0,75 szó per token — így egy 1000 szavas cikk körülbelül 1300 tokenre esik. A kód általában kevésbé hatékonyan tokenizálódik a behúzás és a szimbólumok miatt, a nem latin írások pedig még többe kerülnek: a kínai szöveg gyakran egy vagy több tokent használ karakterenként. Ha API-költséget tervezel, mérd meg a tényleges szövegedet itt, ne csak a szószámból becsülj.