
Zašto izlazni tokeni LLM API-ja koštaju 4-8x više od ulaznih
Objavljeno 25. srp 2026.
Pogledajte stranicu s cijenama bilo kojeg velikog LLM API-ja — OpenAI, Anthropic, Google, svejedno je — i primijetit ćete isti obrazac svaki put: izlazni tokeni koštaju nekoliko puta više od ulaznih. Ne mala premija, nego znatna. Kod aktualnih modela omjer se dosljedno kreće između 4x i 8x. To nije osobitost cijena specifična za jednog dobavljača; to je izravna posljedica toga kako ovi modeli zapravo rade.
Pravi razlog: ulaz je paralelan, izlaz je sekvencijalan
Obrada ulaznih tokena — vašeg prompta, sistemske poruke, povijesti razgovora — odvija se u jednom prolazu unaprijed. Model odjednom pročita cijeli ulaz i izračuna pažnju (attention) preko svega toga paralelno. Moderni GPU-ovi izrazito su dobri u ovakvom grupnom, paralelnom izračunu, pa prompt od 3000 tokena i prompt od 300 tokena ne koštaju proporcionalno onoliko vremena izračuna koliko bi njihov broj tokena mogao sugerirati — troškovi jednog pokretanja modela dominiraju, ne duljina onoga što čita.
Generiranje izlaznih tokena je temeljno drugačije. Svaki novi token ovisi o svakom prethodnom tokenu, uključujući one koje je model tek generirao — pa se token 500 odgovora ne može izračunati dok ne postoji token 499. To prisiljava sekvencijalnu petlju: jedan prolaz unaprijed po izlaznom tokenu, jedan za drugim, bez mogućnosti paralelizacije preko niza. Proizvodnja 500 izlaznih tokena znači pokretanje modela 500 puta zaredom, ne jednom.
Ta asimetrija u izračunu — jedan paralelan prolaz za ulaz, N sekvencijalnih prolaza za N izlaznih tokena — razlog je zašto cijene svakog velikog pružatelja izgledaju isto bez obzira na tvrtku, arhitekturu modela ili regiju. Nije toliko poslovna odluka koliko izravan prijenos temeljnog troška izračuna.
Što ovo znači za vaše promptove
Praktičan zaključak je izravan: opširan odgovor modela košta nesrazmjerno više od dugog prompta s kratkim odgovorom, čak i kad ukupan broj tokena izgleda sličan. Ako pokušavate smanjiti trošak API-ja, skraćivanje duljine izlaza obično štedi više po tokenu nego skraćivanje ulaza.
Nekoliko konkretnih poluga:
- Izričito ograničite duljinu odgovora. Uputa u sistemskom promptu poput “odgovori u jednom odlomku” ili ograničenje
max_tokensčini više za trošak nego skraćivanje vlastitog prompta. - Tražite strukturirani izlaz umjesto proze. JSON objekt s tri polja često je puno kraći nego isto objašnjeno rečenicama, a jednako koristan za daljnju obradu.
- Nemojte previše objašnjavati u sistemskom promptu da biste uštedjeli na izlazu. Dulji, precizniji sistemski prompt (ulaz, jeftin) koji pouzdano proizvodi kratak točan odgovor (izlaz, skup) obično je bolja trgovina nego kratak nejasan prompt koji tjera model da odgovori dugim odgovorom pun ograda.
- Koristite jeftiniji model za visok volumen jednostavnog izlaza. Ako zadatak ne treba zaključivanje vrhunskog modela — klasifikacija, ekstrakcija, kratki odgovori — cijena izlaza budžetnog modela često je red veličine niža.
Izračun stvarnog iznosa u novcu
Omjer objašnjava zašto izlaz košta više, ali točan iznos u novcu ovisi o tome koji model koristite i koliko tokena svaka strana zahtjeva zapravo troši. Budući da omjer ulaz/izlaz — i množitelj između njih — doista varira po modelu (budžetni model i vodeći model ne primjenjuju isti omjer), jedini pouzdan način da saznate svoj stvarni trošak je uvrstiti vlastite brojke po modelu.
CodeKitHub-ov kalkulator cijena LLM API-ja radi upravo to: odaberite model, unesite broj ulaznih i izlaznih tokena, a on prikazuje trošak ulaza, trošak izlaza i ukupno — plus mjesečnu procjenu ako otprilike znate koliko zahtjeva ćete napraviti. Ako niste sigurni koliko tokena vaš stvarni prompt koristi, alat Token Counter daje vam točan broj koristeći stvarni tokenizator, a ne grubu procjenu na temelju broja znakova.
Oba rade u potpunosti u vašem pregledniku — bez API ključa, bez računa, ništa se ne šalje nikamo.