CodeKitHub
Hvorfor LLM-API-outputtokens koster 4-8x mere end inputtokens

Hvorfor LLM-API-outputtokens koster 4-8x mere end inputtokens

Udgivet 25. jul. 2026

Kig på prissiden for enhver større LLM-API — OpenAI, Anthropic, Google, det er lige meget — og du vil bemærke den samme form hver gang: outputtokens koster flere gange mere end inputtokens. Ikke en lille merpris, heller. På tværs af nuværende modeller ligger forholdet konsekvent mellem 4x og 8x. Det er ikke en prisejendommelighed specifik for én udbyder; det er en direkte konsekvens af, hvordan disse modeller faktisk kører.

Den egentlige grund: input er parallelt, output er sekventielt

At behandle inputtokens — din prompt, systembesked, samtalehistorik — sker i ét enkelt forward pass. Modellen læser hele inputtet på én gang og beregner attention på tværs af det hele parallelt. Moderne GPU’er er ekstremt gode til den slags batched, parallel beregning, så en prompt på 3.000 tokens og en prompt på 300 tokens koster ikke proportionalt så meget beregningstid, som deres tokenantal kunne antyde — overheadet ved at køre modellen én gang er den dominerende omkostning, ikke længden af det, den læser.

At generere outputtokens er fundamentalt anderledes. Hvert nyt token afhænger af hvert token, der kom før det, inklusive dem modellen lige har genereret — så token 500 i et svar kan ikke beregnes, før token 499 eksisterer. Det tvinger en sekventiel løkke frem: ét forward pass pr. outputtoken, kørt efter hinanden, uden mulighed for at parallelisere på tværs af sekvensen. At producere 500 outputtokens betyder at køre modellen 500 gange i træk, ikke én gang.

Den asymmetri i beregning — ét parallelt pass for input, N sekventielle passes for N outputtokens — er grunden til, at prissætningen hos alle større udbydere ser ens ud, uanset firma, modelarkitektur eller region. Det er ikke så meget en forretningsbeslutning som en direkte videreførelse af den underliggende beregningsomkostning.

Hvad det betyder for dine prompts

Den praktiske konklusion er ligeud: et langt, uddybende modelrespons koster uforholdsmæssigt mere end en lang prompt med et kort svar, selv når det samlede tokenantal ser ens ud. Hvis du prøver at reducere dit API-forbrug, sparer det at beskære outputlængden som regel mere pr. token end at beskære inputlængden.

Nogle konkrete håndtag:

  • Begræns svarlængden eksplicit. En systemprompt-instruks som “svar i ét afsnit” eller en max_tokens-grænse gør mere for omkostningen end at forkorte din egen prompt.
  • Bed om struktureret output frem for prosa. Et JSON-objekt med tre felter er ofte langt kortere end det tilsvarende forklaret i sætninger, og lige så brugbart i det næste led.
  • Overforklar ikke i systemprompten for at spare på output. En længere, mere præcis systemprompt (input, billigt), der pålideligt producerer et kort, korrekt svar (output, dyrt), er som regel en bedre handel end en kort, vag prompt, der får modellen til at gardere sig med et langt svar.
  • Brug en billigere model til høj-volumen, lav-kompleksitet output. Hvis en opgave ikke kræver frontier-model-ræsonnement — klassificering, udtrækning, korte svar — er en budgetmodels outputpris ofte en størrelsesorden lavere.

At regne den faktiske dollarbeløb ud

Forholdet forklarer hvorfor output koster mere, men det præcise dollarbeløb afhænger af, hvilken model du bruger, og hvor mange tokens hver side af en forespørgsel faktisk bruger. Fordi input/output-fordelingen — og multiplikatoren mellem dem — reelt varierer fra model til model (en budgetmodel og en flagskibsmodel anvender ikke samme forhold), er den eneste pålidelige måde at kende sin reelle omkostning på at indtaste sine faktiske tal pr. model.

CodeKitHub’s LLM API Pricing Calculator gør præcis det: vælg din model, indtast dine input- og outputtokenantal, og den viser inputomkostningen, outputomkostningen og totalen — plus et månedligt estimat, hvis du ved nogenlunde, hvor mange forespørgsler du vil lave. Hvis du ikke er sikker på, hvor mange tokens din faktiske prompt bruger, giver Token Counter-værktøjet dig det præcise antal ved brug af den rigtige tokenizer, i stedet for et groft, tegnbaseret gæt.

Begge kører helt i din browser — ingen API-nøgle, ingen konto, intet sendt nogen steder hen.

← Tilbage til bloggen