Hva er dette verktøyet?
Språkmodeller behandler ikke tekst tegn for tegn eller ord for ord — de deler den opp i «tokener», biter som ofte er noen få tegn lange (omtrent 4 tegn eller 0,75 ord per token på engelsk, selv om dette varierer mye etter språk og innhold). Tokenantallet avgjør direkte API-kostnaden din og om prompten din passer innenfor en modells kontekstvindu.
Dette verktøyet bruker de ekte tokeniseringsenkoderne — o200k_base (brukt av GPT-4o og GPT-4o mini) og cl100k_base (brukt av GPT-4 og GPT-3.5) — i stedet for en grov «tegn delt på 4»-tilnærming, slik at antallet du ser her stemmer med det du faktisk blir fakturert for eller begrenset av.
Hvorfor bruke det?
- Ekte tokeniseringsenkodere (o200k_base, cl100k_base) — ikke et gjettet tegnantall.
- Bytt modell umiddelbart for å sammenligne hvordan samme tekst tokeniseres ulikt.
- Tegn- og ordantall vist ved siden av, som rask referanse.
- Oppdateres live mens du skriver eller limer inn — ingen knapp å trykke.
- 100 % lokalt — prompten eller dokumentet ditt lastes aldri opp, noe som betyr noe hvis det inneholder proprietær eller sensitiv tekst.
Slik bruker du det
- Lim inn eller skriv teksten, prompten eller koden din i boksen.
- Velg modellen du sikter mot (GPT-4o / GPT-4o mini, eller GPT-4 / GPT-3.5).
- Tokenantallet oppdateres umiddelbart — bytt modell for å sammenligne.
- Bruk tegn-/ordantallet ved siden av som en fornuftssjekk eller for ikke-tokenbaserte grenser.
Eksempel
Inndata
«Hello, world!» (GPT-4o-enkoding)Resultat
4 tokener, 13 tegn, 2 ordVanlige korte fraser tokeniseres ofte som 1 token per ord eller tegnsettingstegn, men dette varierer med store bokstaver, mellomrom og språk.
Hvilken tokenisering bør du sjekke?
De to enkodingene er ikke om hverandre — velg den som samsvarer med modellen du faktisk kaller, siden samme tekst kan tokeniseres til et merkbart ulikt antall i hver.
| Modellfamilie | Tokenisering | Når du bruker den |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-resonneringsmodeller | o200k_base | Enhver gjeldende OpenAI-modellutgivelse — dette er tokeniseringen OpenAI har levert for alle nyere modeller siden GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Eldre eller utfasede OpenAI-modeller, eller hvis API-kallene dine fortsatt sikter mot GPT-3.5/GPT-4 (ikke GPT-4o) av kostnadshensyn. |
| Claude, Gemini, Llama, andre ikke-OpenAI-modeller | Ingen — dekkes ikke her | Disse leverandørene bruker sine egne tokeniseringer (ikke tiktoken-baserte); antallene her vil ikke stemme med faktureringen deres. |
Praktiske tips
- Anslå API-kostnad før du sender en forespørsel: gang tokenantallet med modellens pris per token for et raskt kostnadsanslag, i stedet for å gjette ut fra tegnantall.
- Sjekke om et langt dokument passer i en modells kontekstvindu: lim inn hele dokumentet her først — det er mye raskere enn å prøve-og-feile med et faktisk API-kall som feiler underveis.
- Sammenligne varianter av prompt-utforming: hvis du prøver å korte ned en systemprompt for å spare kostnad, lim inn hver versjon her for å se tokenbesparelsen direkte, ikke bare «den ser kortere ut».
- Ikke-engelsk tekst: tokenantall for kinesisk, japansk, koreansk og andre ikke-latinske skriftsystemer er ofte mye høyere per tegn enn engelsk — sjekk dette eksplisitt i stedet for å anta at 4-tegn-per-token-regelen gjelder.
Ofte stilte spørsmål
Hvorfor gir samme tekst forskjellig tokenantall for ulike modeller?
GPT-4o og GPT-4o mini bruker en nyere tokenisering (o200k_base) enn GPT-4 og GPT-3.5 (cl100k_base) — de to enkodingene deler tekst opp i et ulikt vokabular av biter, så nøyaktig samme inndata kan tokeniseres til et annet antall avhengig av hvilken modell du sikter mot.
Er 1 token virkelig omtrent 4 tegn?
Det er et grovt gjennomsnitt for engelsk prosa, men det varierer mye: vanlige engelske ord er ofte 1 token hver, mens sjeldne ord, kode og spesielt ikke-latinske skriftsystemer (kinesisk, japansk, koreansk, arabisk) kan bruke merkbart flere tokener per tegn. Sjekk alltid det eksakte antallet for alt som er kostnads- eller grensesensitivt, i stedet for å stole på 4-tegn-tommelfingerregelen.
Kaller dette verktøyet OpenAI-API-et for å telle tokener?
Nei. Det bruker en JavaScript-implementasjon av de samme tokeniseringsenkoderne (o200k_base, cl100k_base), som kjører helt i nettleseren din. Ingen API-nøkkel trengs, ingen nettverksforespørsel sendes, og teksten din sendes aldri noe sted.
Hvorfor betyr tokenantallet mitt noe?
To grunner: API-prising faktureres per token (inndata og utdata), og hver modell har et maksimalt kontekstvindu målt i tokener — hvis prompten din pluss forventet svar overskrider den grensen, feiler forespørselen eller kuttes av. Å sjekke tokenantallet på forhånd unngår begge overraskelsene.
Fungerer dette for Claude, Gemini eller andre ikke-OpenAI-modeller?
Antallene som vises er spesifikt for OpenAIs tokeniseringer (o200k_base og cl100k_base). Andre leverandører bruker sine egne tokeniseringer, som kan gi merkbart ulike antall for samme tekst — dette verktøyet dekker ikke dem.
Hvor mange tokener bør jeg forvente per ord?
For vanlig engelsk prosa, omtrent 0,75 ord per token — så en artikkel på 1000 ord lander på rundt 1300 tokener. Kode tokeniseres vanligvis mindre effektivt på grunn av innrykk og symboler, og ikke-latinske skriftsystemer koster enda mer: kinesisk tekst bruker ofte ett eller flere tokener per tegn. Hvis du budsjetterer API-kostnader, mål den faktiske teksten din her i stedet for å anslå ut fra ordantall alene.