Mikä tämä työkalu on?
Kielimallit eivät käsittele tekstiä merkki merkiltä tai sana sanalta — ne jakavat sen "tokeneihin", jotka ovat usein muutaman merkin mittaisia paloja (karkeasti 4 merkkiä eli 0,75 sanaa per token englannissa, mutta tämä vaihtelee paljon kielen ja sisällön mukaan). Tokenmäärä vaikuttaa suoraan API-kustannuksiisi ja siihen, mahtuuko kehotteesi mallin kontekstiikkunaan.
Tämä työkalu käyttää aitoja tokenisointikoodauksia — o200k_base (jota GPT-4o ja GPT-4o mini käyttävät) ja cl100k_base (jota GPT-4 ja GPT-3.5 käyttävät) — karkean "merkit jaettuna neljällä" -arvion sijaan, joten näkemäsi luku vastaa sitä, mistä sinua todella laskutettaisiin tai rajoitettaisiin.
Miksi käyttää sitä?
- Aidot tokenisointikoodaukset (o200k_base, cl100k_base) — ei merkkimäärän arvaus.
- Vaihda mallia välittömästi vertaillaksesi, miten sama teksti tokenisoituu eri tavoin.
- Merkki- ja sanamäärät näytetään vierestä nopeaa vertailua varten.
- Päivittyy heti kirjoittaessasi tai liittäessäsi — ei nappia painettavaksi.
- 100 % paikallinen — kehotettasi tai dokumenttiasi ei koskaan ladata palvelimelle, millä on merkitystä, jos se sisältää omistusoikeudellista tai arkaluontoista tekstiä.
Käyttöohje
- Liitä tai kirjoita tekstisi, kehotteesi tai koodisi kenttään.
- Valitse kohdemalli (GPT-4o / GPT-4o mini, tai GPT-4 / GPT-3.5).
- Tokenmäärä päivittyy heti — vaihda mallia vertaillaksesi.
- Käytä merkki-/sanamääriä vierestä järkevyystarkistuksena tai muihin kuin tokenipohjaisiin rajoihin.
Esimerkki
Syöte
"Hello, world!" (GPT-4o-koodaus)Tuloste
4 tokenia, 13 merkkiä, 2 sanaaLyhyet yleiset lauseet tokenisoituvat usein yhdeksi tokeniksi per sana tai välimerkki, mutta tämä vaihtelee isokirjaimien, välilyöntien ja kielen mukaan.
Kumpaa tokenisoijaa kannattaa tarkistaa?
Kaksi koodausta eivät ole keskenään vaihdettavissa — valitse se, joka vastaa mallia, jota oikeasti kutsut, koska sama teksti voi tokenisoitua huomattavasti eri lukumääräksi kummassakin.
| Malliperhe | Tokenisoija | Milloin käyttää |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-päättelymallit | o200k_base | Mikä tahansa nykyinen OpenAI-mallijulkaisu — tämä on tokenisoija, jota OpenAI on toimittanut kaikille uudemmille malleille GPT-4o:sta lähtien. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Vanhemmat tai poistuvat OpenAI-mallit, tai jos API-kutsusi kohdistuvat yhä GPT-3.5:een/GPT-4:ään (ei GPT-4o:hon) kustannussyistä. |
| Claude, Gemini, Llama, muut kuin OpenAI:n mallit | Ei kumpikaan — ei katettu täällä | Nämä palveluntarjoajat käyttävät omia tokenisoijiaan (eivät tiktoken-pohjaisia); täältä saadut luvut eivät vastaa niiden laskutusta. |
Käytännön vinkkejä
- API-kustannuksen arviointi ennen pyynnön lähettämistä: kerro tokenmäärä mallisi token-hinnalla saadaksesi nopean kustannusarvion sen sijaan, että arvaisit merkkimäärästä.
- Sen tarkistaminen, mahtuuko pitkä dokumentti mallin kontekstiikkunaan: liitä koko teksti tänne ensin — se on paljon nopeampaa kuin yritys ja erehdys oikealla API-kutsulla, joka epäonnistuu kesken kaiken.
- Kehote-engineering-vaihtoehtojen vertailu: jos yrität lyhentää järjestelmäkehotetta kustannusten säästämiseksi, liitä jokainen versio tänne nähdäksesi tokensäästön suoraan, ei vain "näyttää lyhyemmältä".
- Muu kuin englanti: tokenmäärät kiinalle, japanille, korealle ja muille ei-latinalaisille kirjaimistoille ovat usein paljon korkeampia per merkki kuin englannissa — tarkista tämä nimenomaisesti sen sijaan, että olettaisit 4-merkin-per-token-säännön pätevän.
Usein kysytyt kysymykset
Miksi sama teksti antaa eri tokenmäärän eri malleille?
GPT-4o ja GPT-4o mini käyttävät uudempaa tokenisoijaa (o200k_base) kuin GPT-4 ja GPT-3.5 (cl100k_base) — kaksi koodausta jakavat tekstin eri sanastoon paloja, joten täsmälleen sama syöte voi tokenisoitua eri lukumääräksi riippuen siitä, mitä mallia kohdennat.
Onko yksi token oikeasti noin 4 merkkiä?
Se on karkea keskiarvo englanninkieliselle proosalle, mutta se vaihtelee paljon: yleiset englannin sanat ovat usein yksi token kukin, kun taas harvinaiset sanat, koodi ja etenkin ei-latinalaiset kirjaimistot (kiina, japani, korea, arabia) voivat viedä huomattavasti enemmän tokeneita per merkki. Tarkista aina tarkka määrä kustannus- tai rajaherkässä käytössä sen sijaan, että luottaisit 4-merkin-per-token-nyrkkisääntöön.
Kutsuuko tämä työkalu OpenAI:n API:a tokenien laskemiseksi?
Ei. Se käyttää JavaScript-toteutusta samoista tokenisointikoodauksista (o200k_base, cl100k_base), joka ajetaan kokonaan selaimessasi. API-avainta ei tarvita, verkkopyyntöjä ei tehdä, eikä tekstiäsi koskaan lähetetä minnekään.
Miksi tokenmäärälläni on väliä?
Kaksi syytä: API-hinnoittelu laskutetaan tokeneittain (syöte ja tuloste), ja jokaisella mallilla on tokeneina mitattu enimmäiskontekstiikkuna — jos kehotteesi plus odotettu vastaus ylittää tuon rajan, pyyntö epäonnistuu tai katkeaa. Tokenmäärän tarkistaminen etukäteen välttää molemmat yllätykset.
Toimiiko tämä Claudelle, Geminille tai muille kuin OpenAI:n malleille?
Näytetyt luvut ovat nimenomaan OpenAI:n tokenisoijille (o200k_base ja cl100k_base). Muut palveluntarjoajat käyttävät omia tokenisoijiaan, jotka voivat antaa merkittävästi eri lukuja samalle tekstille — tämä työkalu ei kata niitä.
Kuinka monta tokenia pitäisi odottaa per sana?
Tavalliselle englanninkieliselle proosalle karkeasti 0,75 sanaa per token — joten 1 000 sanan artikkeli asettuu noin 1 300 tokeniin. Koodi tokenisoituu yleensä tehottomammin sisennyksen ja symbolien vuoksi, ja ei-latinalaiset kirjaimistot maksavat vielä enemmän: kiinankielinen teksti käyttää usein yhden tai useamman tokenin per merkki. Jos budjetoit API-kustannuksia, mittaa oikea tekstisi täällä sanamäärään perustuvan arvion sijaan.