Hvad er dette værktøj?
Sprogmodeller behandler ikke tekst tegn-for-tegn eller ord-for-ord — de opdeler den i "tokens", bidder der ofte er nogle få tegn lange (groft sagt 4 tegn eller 0,75 ord pr. token på engelsk, selvom det varierer meget med sprog og indhold). Tokenantallet bestemmer direkte din API-omkostning og om din prompt passer inden for en models kontekstvindue.
Dette værktøj bruger de rigtige tokenizer-encodinger — o200k_base (brugt af GPT-4o og GPT-4o mini) og cl100k_base (brugt af GPT-4 og GPT-3.5) — i stedet for en grov "tegn divideret med 4"-tilnærmelse, så antallet du ser her matcher det, du reelt ville blive faktureret for eller begrænset af.
Hvorfor bruge det?
- Rigtige tokenizer-encodinger (o200k_base, cl100k_base) — ikke et tegnetalsgæt.
- Skift model øjeblikkeligt for at sammenligne, hvordan samme tekst tokeniseres forskelligt.
- Tegn- og ordantal vises ved siden af, til hurtig reference.
- Opdateres live, mens du skriver eller indsætter — ingen knap at klikke på.
- 100% lokalt — din prompt eller dit dokument uploades aldrig, hvilket betyder noget, hvis det indeholder proprietær eller følsom tekst.
Sådan bruger du det
- Indsæt eller skriv din tekst, prompt eller kode i feltet.
- Vælg den model, du målretter mod (GPT-4o/GPT-4o mini, eller GPT-4/GPT-3.5).
- Tokenantallet opdateres øjeblikkeligt — skift model for at sammenligne.
- Brug tegn-/ordantallene ved siden af som et sanity-check eller til grænser, der ikke er tokenbaserede.
Eksempel
Input
"Hej, verden!" (GPT-4o-encoding)Output
4 tokens, 12 tegn, 2 ordKorte, almindelige sætninger tokeniseres ofte som 1 token pr. ord eller tegnsætningstegn, men dette varierer med store bogstaver, mellemrum og sprog.
Hvilken tokenizer skal du tjekke?
De to encodinger er ikke ombyttelige — vælg den, der matcher den model, du faktisk kalder, da samme tekst kan tokenisere til et markant forskelligt antal i hver.
| Modelfamilie | Tokenizer | Hvornår du skal bruge den |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3-ræsonneringsmodeller | o200k_base | Enhver aktuel OpenAI-modeludgivelse — dette er den tokenizer, OpenAI har leveret til alle nyere modeller siden GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Ældre eller forældede OpenAI-modeller, eller hvis dine API-kald stadig målretter mod GPT-3.5/GPT-4 (ikke GPT-4o) af omkostningsgrunde. |
| Claude, Gemini, Llama, andre ikke-OpenAI-modeller | Ingen — dækkes ikke her | Disse udbydere bruger deres egne tokenizere (ikke tiktoken-baserede); antallene her matcher ikke deres fakturering. |
Praktiske tips
- Estimering af API-omkostning før en anmodning sendes: gang tokenantallet med din models pris pr. token for at få et hurtigt omkostningsestimat, i stedet for at gætte ud fra tegnantal.
- Kontrol af om et langt dokument passer inden for en models kontekstvindue: indsæt det hele her først — det er meget hurtigere end at prøve-og-fejle et faktisk API-kald, der fejler undervejs.
- Sammenligning af prompt-engineering-varianter: hvis du prøver at forkorte en systemprompt for at spare omkostninger, indsæt hver version her for at se tokenbesparelsen direkte, ikke bare "den ser kortere ud".
- Ikke-engelsk tekst: tokenantal for kinesisk, japansk, koreansk og andre ikke-latinske skrifttyper er ofte meget højere pr. tegn end engelsk — tjek dette eksplicit i stedet for at antage, at 4-tegns-pr.-token-reglen gælder.
Ofte stillede spørgsmål
Hvorfor giver samme tekst et forskelligt tokenantal for forskellige modeller?
GPT-4o og GPT-4o mini bruger en nyere tokenizer (o200k_base) end GPT-4 og GPT-3.5 (cl100k_base) — de to encodinger opdeler tekst i et forskelligt vokabular af bidder, så det nøjagtigt samme input kan tokenisere til et forskelligt antal, afhængigt af hvilken model du målretter mod.
Er 1 token virkelig cirka 4 tegn?
Det er et groft gennemsnit for engelsk prosa, men det varierer meget: almindelige engelske ord er ofte 1 token hver, mens sjældne ord, kode og især ikke-latinske skrifttyper (kinesisk, japansk, koreansk, arabisk) kan bruge markant flere tokens pr. tegn. Tjek altid det præcise antal for alt, der er omkostnings- eller grænsefølsomt, i stedet for at stole på 4-tegns-tommelfingerreglen.
Kalder dette værktøj OpenAI's API for at tælle tokens?
Nej. Det bruger en JavaScript-implementering af de samme tokenizer-encodinger (o200k_base, cl100k_base), der kører helt i din browser. Ingen API-nøgle nødvendig, ingen netværksanmodning foretaget, og din tekst sendes aldrig nogen steder.
Hvorfor betyder mit tokenantal noget?
To grunde: API-priser faktureres pr. token (input og output), og hver model har et maksimalt kontekstvindue målt i tokens — hvis din prompt plus forventede svar overstiger denne grænse, fejler anmodningen eller bliver afkortet. At tjekke tokenantallet på forhånd undgår begge overraskelser.
Fungerer dette til Claude, Gemini eller andre ikke-OpenAI-modeller?
Antallene vist her er specifikt for OpenAI's tokenizere (o200k_base og cl100k_base). Andre udbydere bruger deres egne tokenizere, som kan give markant forskellige antal for samme tekst — dette værktøj dækker ikke dem.
Hvor mange tokens skal jeg forvente pr. ord?
For almindelig engelsk prosa, groft sagt 0,75 ord pr. token — så en artikel på 1.000 ord lander omkring 1.300 tokens. Kode tokeniseres normalt mindre effektivt på grund af indrykning og symboler, og ikke-latinske skrifttyper koster endnu mere: kinesisk tekst bruger ofte ét eller flere tokens pr. tegn. Hvis du budgetterer API-omkostninger, mål din faktiske tekst her i stedet for at estimere ud fra ordantal alene.