
Kodėl LLM API išvesties žetonai kainuoja 4-8 kartus daugiau nei įvesties žetonai
Paskelbta 2026-07-25
Pažiūrėkite į bet kurio didžiojo LLM API kainodaros puslapį — OpenAI, Anthropic, Google, nesvarbu — ir pastebėsite tą pačią formą kiekvieną kartą: išvesties žetonai kainuoja kelis kartus daugiau nei įvesties žetonai. Ir ne mažą priedą. Šiuolaikiniuose modeliuose santykis nuosekliai svyruoja tarp 4x ir 8x. Tai ne vieno tiekėjo kainodaros keistenybė; tai tiesioginė pasekmė to, kaip šie modeliai iš tikrųjų veikia.
Tikroji priežastis: įvestis lygiagreti, išvestis nuosekli
Įvesties žetonų — jūsų užklausos, sistemos pranešimo, pokalbio istorijos — apdorojimas vyksta vienu tiesioginiu perėjimu. Modelis perskaito visą įvestį iš karto ir apskaičiuoja dėmesį per visą ją lygiagrečiai. Šiuolaikinės GPU labai geros tokio tipo grupinio, lygiagretaus skaičiavimo, todėl 3000 žetonų užklausa ir 300 žetonų užklausa nekainuoja proporcingai tiek skaičiavimo laiko, kiek jų žetonų skaičius galėtų rodyti — vienkartinio modelio paleidimo kaina yra dominuojanti kaina, ne to, ką jis skaito, ilgis.
Išvesties žetonų generavimas iš esmės skiriasi. Kiekvienas naujas žetonas priklauso nuo visų prieš tai buvusių žetonų, įskaitant tuos, kuriuos modelis ką tik sugeneravo — todėl 500-asis atsakymo žetonas negali būti apskaičiuotas, kol neegzistuoja 499-asis. Tai priverčia naudoti nuoseklią kilpą: po vieną tiesioginį perėjimą kiekvienam išvesties žetonui, paleidžiant vieną po kito, be jokio būdo lygiagretinti per seką. Sugeneruoti 500 išvesties žetonų reiškia paleisti modelį 500 kartų iš eilės, ne vieną kartą.
Šis skaičiavimo asimetriškumas — vienas lygiagretus perėjimas įvesčiai, N nuoseklių perėjimų N išvesties žetonų — yra kodėl kiekvieno didžiojo tiekėjo kainodara atrodo vienodai, nepriklausomai nuo kompanijos, modelio architektūros ar regiono. Tai ne tiek verslo sprendimas, kiek tiesioginis pagrindinės skaičiavimo kainos perkėlimas.
Ką tai reiškia jūsų užklausoms
Praktinė išvada yra tiesmuka: daugiažodis modelio atsakymas kainuoja neproporcingai daugiau nei ilga užklausa su trumpu atsakymu, net kai bendras žetonų skaičius atrodo panašus. Jei bandote sumažinti API išlaidas, išvesties ilgio apkarpymas dažniausiai sutaupo daugiau per žetoną nei įvesties apkarpymas.
Keletas konkrečių svertų:
- Aiškiai apribokite atsakymo ilgį. Sistemos užklausos instrukcija tokia kaip „atsakyk viena pastraipa“ arba
max_tokensriba daro daugiau kainai nei jūsų pačios užklausos trumpinimas. - Prašykite struktūrizuotos išvesties, ne prozos. JSON objektas su trimis laukais dažnai yra kur kas trumpesnis nei tas pats paaiškintas sakiniais, ir taip pat naudingas tolesniam apdorojimui.
- Neperaiškinkite sistemos užklausoje, kad sutaupytumėte išvesties. Ilgesnė, tikslesnė sistemos užklausa (įvestis, pigi), patikimai gaminanti trumpą teisingą atsakymą (išvestis, brangi), paprastai yra geresnis mainas nei trumpa, neaiški užklausa, verčianti modelį rašyti ilgą atsakymą, apsidraudžiant.
- Naudokite pigesnį modelį didelio kiekio, žemo sudėtingumo išvesčiai. Jei užduočiai nereikia priešakinio modelio samprotavimo — klasifikavimo, išgavimo, trumpų atsakymų — biudžetinio lygio modelio išvesties kainodara dažnai yra eilės tvarka žemesnė.
Tikslios pinigų sumos apskaičiavimas
Santykis paaiškina, kodėl išvestis kainuoja daugiau, bet tiksli pinigų suma priklauso nuo to, kurį modelį naudojate ir kiek žetonų kiekviena užklausos pusė iš tikrųjų sunaudoja. Kadangi įvesties/išvesties santykis — ir daugiklis tarp jų — iš tikrųjų skiriasi pagal modelį (biudžetinis ir priešakinis modelis netaiko to paties santykio), vienintelis patikimas būdas sužinoti tikrą savo kainą yra įvesti tikrus skaičius kiekvienam modeliui.
CodeKitHub LLM API kainodaros skaičiuoklė tai daro tiksliai: pasirinkite savo modelį, įveskite savo įvesties ir išvesties žetonų skaičius, ir ji parodo įvesties kainą, išvesties kainą ir bendrą sumą — plius mėnesio įvertį, jei žinote maždaug, kiek užklausų darysite. Jei nesate tikri, kiek žetonų naudoja jūsų tikra užklausa, žetonų skaitiklio įrankis duoda tikslų skaičių naudodamas tikrą žetonizatorių, o ne apytikslį spėjimą pagal simbolius.
Abu veikia visiškai jūsų naršyklėje — jokio API rakto, jokios paskyros, niekas niekur nesiunčiama.