Vad är detta verktyg?
Språkmodeller bearbetar inte text tecken för tecken eller ord för ord — de delar upp den i "tokens", bitar som ofta är några tecken långa (ungefär 4 tecken eller 0,75 ord per token på engelska, även om detta varierar mycket beroende på språk och innehåll). Tokenantalet avgör direkt din API-kostnad och om din prompt får plats inom en modells kontextfönster.
Det här verktyget använder de verkliga tokeniserarkodningarna — o200k_base (används av GPT-4o och GPT-4o mini) och cl100k_base (används av GPT-4 och GPT-3.5) — snarare än en grov "tecken delat med 4"-approximation, så antalet du ser här matchar det du faktiskt skulle faktureras för eller begränsas av.
Varför använda det?
- Verkliga tokeniserarkodningar (o200k_base, cl100k_base) — inte en gissning baserad på teckenantal.
- Byt modell direkt för att jämföra hur samma text tokeniseras olika.
- Tecken- och ordräkning visas bredvid, för snabb referens.
- Uppdateras live när du skriver eller klistrar in — ingen knapp att klicka på.
- 100 % lokalt — din prompt eller ditt dokument laddas aldrig upp, vilket spelar roll om det innehåller proprietär eller känslig text.
Så använder du det
- Klistra in eller skriv din text, prompt eller kod i rutan.
- Välj den modell du siktar på (GPT-4o / GPT-4o mini, eller GPT-4 / GPT-3.5).
- Tokenantalet uppdateras direkt — byt modell för att jämföra.
- Använd tecken-/ordräkningen bredvid som en sanity-kontroll eller för gränser som inte är tokenbaserade.
Exempel
Inmatning
"Hej, världen!" (GPT-4o-kodning)Resultat
5 tokens, 14 tecken, 2 ordKorta vanliga fraser tokeniseras ofta som 1 token per ord eller skiljetecken, men det varierar med versaler, mellanslag och språk.
Vilken tokeniserare bör du kontrollera?
De två kodningarna är inte utbytbara — välj den som matchar modellen du faktiskt anropar, eftersom samma text kan tokeniseras till ett märkbart annat antal i vardera.
| Modellfamilj | Tokeniserare | När den ska användas |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-resonemangsmodeller | o200k_base | Alla aktuella OpenAI-modellutgåvor — det här är tokeniseraren OpenAI har levererat för alla nyare modeller sedan GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Äldre eller föråldrade OpenAI-modeller, eller om dina API-anrop fortfarande riktar sig mot GPT-3.5/GPT-4 (inte GPT-4o) av kostnadsskäl. |
| Claude, Gemini, Llama, andra icke-OpenAI-modeller | Ingendera — täcks inte här | Dessa leverantörer använder sina egna tokeniserare (inte tiktoken-baserade); antalen här matchar inte deras fakturering. |
Praktiska tips
- Uppskatta API-kostnad före att skicka en begäran: multiplicera tokenantalet med din modells pris per token för en snabb kostnadsuppskattning, istället för att gissa utifrån teckenantal.
- Kontrollera om ett långt dokument får plats i en modells kontextfönster: klistra in hela saken här först — det är mycket snabbare än att pröva och felsöka ett faktiskt API-anrop som misslyckas halvvägs igenom.
- Jämföra prompt-ingenjörsvarianter: om du försöker korta ner en systemprompt för att spara kostnad, klistra in varje version här för att se tokenbesparingen direkt, inte bara "den ser kortare ut".
- Icke-engelsk text: tokenantal för kinesiska, japanska, koreanska och andra icke-latinska skriftsystem är ofta mycket högre per tecken än engelska — kontrollera detta explicit istället för att anta att 4-tecken-per-token-regeln gäller.
Vanliga frågor
Varför ger samma text olika tokenantal för olika modeller?
GPT-4o och GPT-4o mini använder en nyare tokeniserare (o200k_base) än GPT-4 och GPT-3.5 (cl100k_base) — de två kodningarna delar upp text i ett annat vokabulär av bitar, så exakt samma inmatning kan tokeniseras till ett annat antal beroende på vilken modell du siktar på.
Är 1 token verkligen ungefär 4 tecken?
Det är ett grovt genomsnitt för engelsk prosa, men det varierar mycket: vanliga engelska ord är ofta 1 token vardera, medan ovanliga ord, kod och särskilt icke-latinska skriftsystem (kinesiska, japanska, koreanska, arabiska) kan ta märkbart fler tokens per tecken. Kontrollera alltid det exakta antalet för allt kostnads- eller gränskänsligt istället för att förlita dig på 4-tecken-tumregeln.
Anropar det här verktyget OpenAI:s API för att räkna tokens?
Nej. Det använder en JavaScript-implementation av samma tokeniserarkodningar (o200k_base, cl100k_base), som körs helt i din webbläsare. Ingen API-nyckel behövs, ingen nätverksbegäran görs, och din text skickas aldrig någonstans.
Varför spelar mitt tokenantal någon roll?
Två skäl: API-prissättning faktureras per token (in- och utdata), och varje modell har ett maximalt kontextfönster mätt i tokens — om din prompt plus förväntat svar överstiger den gränsen misslyckas begäran eller trunkeras. Att kontrollera tokenantalet i förväg undviker båda överraskningarna.
Fungerar det här för Claude, Gemini eller andra icke-OpenAI-modeller?
De antal som visas är specifikt för OpenAI:s tokeniserare (o200k_base och cl100k_base). Andra leverantörer använder sina egna tokeniserare, vilket kan ge markant olika antal för samma text — det här verktyget täcker inte dem.
Hur många tokens bör jag förvänta mig per ord?
För vanlig engelsk prosa, ungefär 0,75 ord per token — så en artikel på 1 000 ord landar på ungefär 1 300 tokens. Kod tokeniseras vanligtvis mindre effektivt på grund av indrag och symboler, och icke-latinska skriftsystem kostar ännu mer: kinesisk text använder ofta en eller flera tokens per tecken. Om du budgeterar API-kostnader, mät din faktiska text här istället för att uppskatta utifrån ordantal.