CodeKitHub
Tekstverktøy

AI-tokenteller

Sist oppdatert:

Lim inn en hvilken som helst tekst, prompt eller kode og se nøyaktig hvor mange tokener den bruker — med de samme tokeniseringsenkoderne OpenAIs modeller bruker internt (o200k_base for GPT-4o, cl100k_base for GPT-4/GPT-3.5), ikke et grovt tegn-basert anslag. Tegn- og ordantall vises ved siden av som referanse. Alt kjører lokalt i nettleseren din.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Hva er dette verktøyet?

Språkmodeller behandler ikke tekst tegn for tegn eller ord for ord — de deler den opp i «tokener», biter som ofte er noen få tegn lange (omtrent 4 tegn eller 0,75 ord per token på engelsk, selv om dette varierer mye etter språk og innhold). Tokenantallet avgjør direkte API-kostnaden din og om prompten din passer innenfor en modells kontekstvindu.

Dette verktøyet bruker de ekte tokeniseringsenkoderne — o200k_base (brukt av GPT-4o og GPT-4o mini) og cl100k_base (brukt av GPT-4 og GPT-3.5) — i stedet for en grov «tegn delt på 4»-tilnærming, slik at antallet du ser her stemmer med det du faktisk blir fakturert for eller begrenset av.

Hvorfor bruke det?

  • Ekte tokeniseringsenkodere (o200k_base, cl100k_base) — ikke et gjettet tegnantall.
  • Bytt modell umiddelbart for å sammenligne hvordan samme tekst tokeniseres ulikt.
  • Tegn- og ordantall vist ved siden av, som rask referanse.
  • Oppdateres live mens du skriver eller limer inn — ingen knapp å trykke.
  • 100 % lokalt — prompten eller dokumentet ditt lastes aldri opp, noe som betyr noe hvis det inneholder proprietær eller sensitiv tekst.

Slik bruker du det

  1. Lim inn eller skriv teksten, prompten eller koden din i boksen.
  2. Velg modellen du sikter mot (GPT-4o / GPT-4o mini, eller GPT-4 / GPT-3.5).
  3. Tokenantallet oppdateres umiddelbart — bytt modell for å sammenligne.
  4. Bruk tegn-/ordantallet ved siden av som en fornuftssjekk eller for ikke-tokenbaserte grenser.

Eksempel

Inndata

«Hello, world!» (GPT-4o-enkoding)

Resultat

4 tokener, 13 tegn, 2 ord

Vanlige korte fraser tokeniseres ofte som 1 token per ord eller tegnsettingstegn, men dette varierer med store bokstaver, mellomrom og språk.

Hvilken tokenisering bør du sjekke?

De to enkodingene er ikke om hverandre — velg den som samsvarer med modellen du faktisk kaller, siden samme tekst kan tokeniseres til et merkbart ulikt antall i hver.

ModellfamilieTokeniseringNår du bruker den
GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-resonneringsmodellero200k_baseEnhver gjeldende OpenAI-modellutgivelse — dette er tokeniseringen OpenAI har levert for alle nyere modeller siden GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseEldre eller utfasede OpenAI-modeller, eller hvis API-kallene dine fortsatt sikter mot GPT-3.5/GPT-4 (ikke GPT-4o) av kostnadshensyn.
Claude, Gemini, Llama, andre ikke-OpenAI-modellerIngen — dekkes ikke herDisse leverandørene bruker sine egne tokeniseringer (ikke tiktoken-baserte); antallene her vil ikke stemme med faktureringen deres.

Praktiske tips

  • Anslå API-kostnad før du sender en forespørsel: gang tokenantallet med modellens pris per token for et raskt kostnadsanslag, i stedet for å gjette ut fra tegnantall.
  • Sjekke om et langt dokument passer i en modells kontekstvindu: lim inn hele dokumentet her først — det er mye raskere enn å prøve-og-feile med et faktisk API-kall som feiler underveis.
  • Sammenligne varianter av prompt-utforming: hvis du prøver å korte ned en systemprompt for å spare kostnad, lim inn hver versjon her for å se tokenbesparelsen direkte, ikke bare «den ser kortere ut».
  • Ikke-engelsk tekst: tokenantall for kinesisk, japansk, koreansk og andre ikke-latinske skriftsystemer er ofte mye høyere per tegn enn engelsk — sjekk dette eksplisitt i stedet for å anta at 4-tegn-per-token-regelen gjelder.

Ofte stilte spørsmål

Hvorfor gir samme tekst forskjellig tokenantall for ulike modeller?

GPT-4o og GPT-4o mini bruker en nyere tokenisering (o200k_base) enn GPT-4 og GPT-3.5 (cl100k_base) — de to enkodingene deler tekst opp i et ulikt vokabular av biter, så nøyaktig samme inndata kan tokeniseres til et annet antall avhengig av hvilken modell du sikter mot.

Er 1 token virkelig omtrent 4 tegn?

Det er et grovt gjennomsnitt for engelsk prosa, men det varierer mye: vanlige engelske ord er ofte 1 token hver, mens sjeldne ord, kode og spesielt ikke-latinske skriftsystemer (kinesisk, japansk, koreansk, arabisk) kan bruke merkbart flere tokener per tegn. Sjekk alltid det eksakte antallet for alt som er kostnads- eller grensesensitivt, i stedet for å stole på 4-tegn-tommelfingerregelen.

Kaller dette verktøyet OpenAI-API-et for å telle tokener?

Nei. Det bruker en JavaScript-implementasjon av de samme tokeniseringsenkoderne (o200k_base, cl100k_base), som kjører helt i nettleseren din. Ingen API-nøkkel trengs, ingen nettverksforespørsel sendes, og teksten din sendes aldri noe sted.

Hvorfor betyr tokenantallet mitt noe?

To grunner: API-prising faktureres per token (inndata og utdata), og hver modell har et maksimalt kontekstvindu målt i tokener — hvis prompten din pluss forventet svar overskrider den grensen, feiler forespørselen eller kuttes av. Å sjekke tokenantallet på forhånd unngår begge overraskelsene.

Fungerer dette for Claude, Gemini eller andre ikke-OpenAI-modeller?

Antallene som vises er spesifikt for OpenAIs tokeniseringer (o200k_base og cl100k_base). Andre leverandører bruker sine egne tokeniseringer, som kan gi merkbart ulike antall for samme tekst — dette verktøyet dekker ikke dem.

Hvor mange tokener bør jeg forvente per ord?

For vanlig engelsk prosa, omtrent 0,75 ord per token — så en artikkel på 1000 ord lander på rundt 1300 tokener. Kode tokeniseres vanligvis mindre effektivt på grunn av innrykk og symboler, og ikke-latinske skriftsystemer koster enda mer: kinesisk tekst bruker ofte ett eller flere tokener per tegn. Hvis du budsjetterer API-kostnader, mål den faktiske teksten din her i stedet for å anslå ut fra ordantall alene.

Relaterte verktøy