CodeKitHub
Tekstityökalut

Tekoälyn token-laskuri

Viimeksi päivitetty:

Liitä mikä tahansa teksti, kehote tai koodi ja näe tarkalleen, kuinka monta tokenia se käyttää — samoilla tokenisointikoodauksilla, joita OpenAI:n mallit käyttävät sisäisesti (o200k_base GPT-4o:lle, cl100k_base GPT-4/GPT-3.5:lle), ei karkealla merkkimäärän arviolla. Merkki- ja sanamäärät näytetään vertailun vuoksi vierestä. Kaikki toimii paikallisesti selaimessasi.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Mikä tämä työkalu on?

Kielimallit eivät käsittele tekstiä merkki merkiltä tai sana sanalta — ne jakavat sen "tokeneihin", jotka ovat usein muutaman merkin mittaisia paloja (karkeasti 4 merkkiä eli 0,75 sanaa per token englannissa, mutta tämä vaihtelee paljon kielen ja sisällön mukaan). Tokenmäärä vaikuttaa suoraan API-kustannuksiisi ja siihen, mahtuuko kehotteesi mallin kontekstiikkunaan.

Tämä työkalu käyttää aitoja tokenisointikoodauksia — o200k_base (jota GPT-4o ja GPT-4o mini käyttävät) ja cl100k_base (jota GPT-4 ja GPT-3.5 käyttävät) — karkean "merkit jaettuna neljällä" -arvion sijaan, joten näkemäsi luku vastaa sitä, mistä sinua todella laskutettaisiin tai rajoitettaisiin.

Miksi käyttää sitä?

  • Aidot tokenisointikoodaukset (o200k_base, cl100k_base) — ei merkkimäärän arvaus.
  • Vaihda mallia välittömästi vertaillaksesi, miten sama teksti tokenisoituu eri tavoin.
  • Merkki- ja sanamäärät näytetään vierestä nopeaa vertailua varten.
  • Päivittyy heti kirjoittaessasi tai liittäessäsi — ei nappia painettavaksi.
  • 100 % paikallinen — kehotettasi tai dokumenttiasi ei koskaan ladata palvelimelle, millä on merkitystä, jos se sisältää omistusoikeudellista tai arkaluontoista tekstiä.

Käyttöohje

  1. Liitä tai kirjoita tekstisi, kehotteesi tai koodisi kenttään.
  2. Valitse kohdemalli (GPT-4o / GPT-4o mini, tai GPT-4 / GPT-3.5).
  3. Tokenmäärä päivittyy heti — vaihda mallia vertaillaksesi.
  4. Käytä merkki-/sanamääriä vierestä järkevyystarkistuksena tai muihin kuin tokenipohjaisiin rajoihin.

Esimerkki

Syöte

"Hello, world!" (GPT-4o-koodaus)

Tuloste

4 tokenia, 13 merkkiä, 2 sanaa

Lyhyet yleiset lauseet tokenisoituvat usein yhdeksi tokeniksi per sana tai välimerkki, mutta tämä vaihtelee isokirjaimien, välilyöntien ja kielen mukaan.

Kumpaa tokenisoijaa kannattaa tarkistaa?

Kaksi koodausta eivät ole keskenään vaihdettavissa — valitse se, joka vastaa mallia, jota oikeasti kutsut, koska sama teksti voi tokenisoitua huomattavasti eri lukumääräksi kummassakin.

MalliperheTokenisoijaMilloin käyttää
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-päättelymallito200k_baseMikä tahansa nykyinen OpenAI-mallijulkaisu — tämä on tokenisoija, jota OpenAI on toimittanut kaikille uudemmille malleille GPT-4o:sta lähtien.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseVanhemmat tai poistuvat OpenAI-mallit, tai jos API-kutsusi kohdistuvat yhä GPT-3.5:een/GPT-4:ään (ei GPT-4o:hon) kustannussyistä.
Claude, Gemini, Llama, muut kuin OpenAI:n mallitEi kumpikaan — ei katettu täälläNämä palveluntarjoajat käyttävät omia tokenisoijiaan (eivät tiktoken-pohjaisia); täältä saadut luvut eivät vastaa niiden laskutusta.

Käytännön vinkkejä

  • API-kustannuksen arviointi ennen pyynnön lähettämistä: kerro tokenmäärä mallisi token-hinnalla saadaksesi nopean kustannusarvion sen sijaan, että arvaisit merkkimäärästä.
  • Sen tarkistaminen, mahtuuko pitkä dokumentti mallin kontekstiikkunaan: liitä koko teksti tänne ensin — se on paljon nopeampaa kuin yritys ja erehdys oikealla API-kutsulla, joka epäonnistuu kesken kaiken.
  • Kehote-engineering-vaihtoehtojen vertailu: jos yrität lyhentää järjestelmäkehotetta kustannusten säästämiseksi, liitä jokainen versio tänne nähdäksesi tokensäästön suoraan, ei vain "näyttää lyhyemmältä".
  • Muu kuin englanti: tokenmäärät kiinalle, japanille, korealle ja muille ei-latinalaisille kirjaimistoille ovat usein paljon korkeampia per merkki kuin englannissa — tarkista tämä nimenomaisesti sen sijaan, että olettaisit 4-merkin-per-token-säännön pätevän.

Usein kysytyt kysymykset

Miksi sama teksti antaa eri tokenmäärän eri malleille?

GPT-4o ja GPT-4o mini käyttävät uudempaa tokenisoijaa (o200k_base) kuin GPT-4 ja GPT-3.5 (cl100k_base) — kaksi koodausta jakavat tekstin eri sanastoon paloja, joten täsmälleen sama syöte voi tokenisoitua eri lukumääräksi riippuen siitä, mitä mallia kohdennat.

Onko yksi token oikeasti noin 4 merkkiä?

Se on karkea keskiarvo englanninkieliselle proosalle, mutta se vaihtelee paljon: yleiset englannin sanat ovat usein yksi token kukin, kun taas harvinaiset sanat, koodi ja etenkin ei-latinalaiset kirjaimistot (kiina, japani, korea, arabia) voivat viedä huomattavasti enemmän tokeneita per merkki. Tarkista aina tarkka määrä kustannus- tai rajaherkässä käytössä sen sijaan, että luottaisit 4-merkin-per-token-nyrkkisääntöön.

Kutsuuko tämä työkalu OpenAI:n API:a tokenien laskemiseksi?

Ei. Se käyttää JavaScript-toteutusta samoista tokenisointikoodauksista (o200k_base, cl100k_base), joka ajetaan kokonaan selaimessasi. API-avainta ei tarvita, verkkopyyntöjä ei tehdä, eikä tekstiäsi koskaan lähetetä minnekään.

Miksi tokenmäärälläni on väliä?

Kaksi syytä: API-hinnoittelu laskutetaan tokeneittain (syöte ja tuloste), ja jokaisella mallilla on tokeneina mitattu enimmäiskontekstiikkuna — jos kehotteesi plus odotettu vastaus ylittää tuon rajan, pyyntö epäonnistuu tai katkeaa. Tokenmäärän tarkistaminen etukäteen välttää molemmat yllätykset.

Toimiiko tämä Claudelle, Geminille tai muille kuin OpenAI:n malleille?

Näytetyt luvut ovat nimenomaan OpenAI:n tokenisoijille (o200k_base ja cl100k_base). Muut palveluntarjoajat käyttävät omia tokenisoijiaan, jotka voivat antaa merkittävästi eri lukuja samalle tekstille — tämä työkalu ei kata niitä.

Kuinka monta tokenia pitäisi odottaa per sana?

Tavalliselle englanninkieliselle proosalle karkeasti 0,75 sanaa per token — joten 1 000 sanan artikkeli asettuu noin 1 300 tokeniin. Koodi tokenisoituu yleensä tehottomammin sisennyksen ja symbolien vuoksi, ja ei-latinalaiset kirjaimistot maksavat vielä enemmän: kiinankielinen teksti käyttää usein yhden tai useamman tokenin per merkki. Jos budjetoit API-kustannuksia, mittaa oikea tekstisi täällä sanamäärään perustuvan arvion sijaan.

Liittyvät työkalut