CodeKitHub
Textverktyg

AI-tokenräknare

Senast uppdaterad:

Klistra in valfri text, prompt eller kod och se exakt hur många tokens den använder — med samma tokeniserarkodningar som OpenAI:s modeller använder internt (o200k_base för GPT-4o, cl100k_base för GPT-4/GPT-3.5), inte en grov teckenräkningsuppskattning. Tecken- och ordräkning visas bredvid som referens. Allt körs lokalt i din webbläsare.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Vad är detta verktyg?

Språkmodeller bearbetar inte text tecken för tecken eller ord för ord — de delar upp den i "tokens", bitar som ofta är några tecken långa (ungefär 4 tecken eller 0,75 ord per token på engelska, även om detta varierar mycket beroende på språk och innehåll). Tokenantalet avgör direkt din API-kostnad och om din prompt får plats inom en modells kontextfönster.

Det här verktyget använder de verkliga tokeniserarkodningarna — o200k_base (används av GPT-4o och GPT-4o mini) och cl100k_base (används av GPT-4 och GPT-3.5) — snarare än en grov "tecken delat med 4"-approximation, så antalet du ser här matchar det du faktiskt skulle faktureras för eller begränsas av.

Varför använda det?

  • Verkliga tokeniserarkodningar (o200k_base, cl100k_base) — inte en gissning baserad på teckenantal.
  • Byt modell direkt för att jämföra hur samma text tokeniseras olika.
  • Tecken- och ordräkning visas bredvid, för snabb referens.
  • Uppdateras live när du skriver eller klistrar in — ingen knapp att klicka på.
  • 100 % lokalt — din prompt eller ditt dokument laddas aldrig upp, vilket spelar roll om det innehåller proprietär eller känslig text.

Så använder du det

  1. Klistra in eller skriv din text, prompt eller kod i rutan.
  2. Välj den modell du siktar på (GPT-4o / GPT-4o mini, eller GPT-4 / GPT-3.5).
  3. Tokenantalet uppdateras direkt — byt modell för att jämföra.
  4. Använd tecken-/ordräkningen bredvid som en sanity-kontroll eller för gränser som inte är tokenbaserade.

Exempel

Inmatning

"Hej, världen!" (GPT-4o-kodning)

Resultat

5 tokens, 14 tecken, 2 ord

Korta vanliga fraser tokeniseras ofta som 1 token per ord eller skiljetecken, men det varierar med versaler, mellanslag och språk.

Vilken tokeniserare bör du kontrollera?

De två kodningarna är inte utbytbara — välj den som matchar modellen du faktiskt anropar, eftersom samma text kan tokeniseras till ett märkbart annat antal i vardera.

ModellfamiljTokeniserareNär den ska användas
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-resonemangsmodellero200k_baseAlla aktuella OpenAI-modellutgåvor — det här är tokeniseraren OpenAI har levererat för alla nyare modeller sedan GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseÄldre eller föråldrade OpenAI-modeller, eller om dina API-anrop fortfarande riktar sig mot GPT-3.5/GPT-4 (inte GPT-4o) av kostnadsskäl.
Claude, Gemini, Llama, andra icke-OpenAI-modellerIngendera — täcks inte härDessa leverantörer använder sina egna tokeniserare (inte tiktoken-baserade); antalen här matchar inte deras fakturering.

Praktiska tips

  • Uppskatta API-kostnad före att skicka en begäran: multiplicera tokenantalet med din modells pris per token för en snabb kostnadsuppskattning, istället för att gissa utifrån teckenantal.
  • Kontrollera om ett långt dokument får plats i en modells kontextfönster: klistra in hela saken här först — det är mycket snabbare än att pröva och felsöka ett faktiskt API-anrop som misslyckas halvvägs igenom.
  • Jämföra prompt-ingenjörsvarianter: om du försöker korta ner en systemprompt för att spara kostnad, klistra in varje version här för att se tokenbesparingen direkt, inte bara "den ser kortare ut".
  • Icke-engelsk text: tokenantal för kinesiska, japanska, koreanska och andra icke-latinska skriftsystem är ofta mycket högre per tecken än engelska — kontrollera detta explicit istället för att anta att 4-tecken-per-token-regeln gäller.

Vanliga frågor

Varför ger samma text olika tokenantal för olika modeller?

GPT-4o och GPT-4o mini använder en nyare tokeniserare (o200k_base) än GPT-4 och GPT-3.5 (cl100k_base) — de två kodningarna delar upp text i ett annat vokabulär av bitar, så exakt samma inmatning kan tokeniseras till ett annat antal beroende på vilken modell du siktar på.

Är 1 token verkligen ungefär 4 tecken?

Det är ett grovt genomsnitt för engelsk prosa, men det varierar mycket: vanliga engelska ord är ofta 1 token vardera, medan ovanliga ord, kod och särskilt icke-latinska skriftsystem (kinesiska, japanska, koreanska, arabiska) kan ta märkbart fler tokens per tecken. Kontrollera alltid det exakta antalet för allt kostnads- eller gränskänsligt istället för att förlita dig på 4-tecken-tumregeln.

Anropar det här verktyget OpenAI:s API för att räkna tokens?

Nej. Det använder en JavaScript-implementation av samma tokeniserarkodningar (o200k_base, cl100k_base), som körs helt i din webbläsare. Ingen API-nyckel behövs, ingen nätverksbegäran görs, och din text skickas aldrig någonstans.

Varför spelar mitt tokenantal någon roll?

Två skäl: API-prissättning faktureras per token (in- och utdata), och varje modell har ett maximalt kontextfönster mätt i tokens — om din prompt plus förväntat svar överstiger den gränsen misslyckas begäran eller trunkeras. Att kontrollera tokenantalet i förväg undviker båda överraskningarna.

Fungerar det här för Claude, Gemini eller andra icke-OpenAI-modeller?

De antal som visas är specifikt för OpenAI:s tokeniserare (o200k_base och cl100k_base). Andra leverantörer använder sina egna tokeniserare, vilket kan ge markant olika antal för samma text — det här verktyget täcker inte dem.

Hur många tokens bör jag förvänta mig per ord?

För vanlig engelsk prosa, ungefär 0,75 ord per token — så en artikel på 1 000 ord landar på ungefär 1 300 tokens. Kod tokeniseras vanligtvis mindre effektivt på grund av indrag och symboler, och icke-latinska skriftsystem kostar ännu mer: kinesisk text använder ofta en eller flera tokens per tecken. Om du budgeterar API-kostnader, mät din faktiska text här istället för att uppskatta utifrån ordantal.

Relaterade verktyg