
Prečo výstupné tokeny LLM API stoja 4-8x viac ako vstupné
Publikované 25. 7. 2026
Pozrite sa na cenník ktoréhokoľvek veľkého LLM API — OpenAI, Anthropic, Google, nezáleží na tom — a všimnete si vždy rovnaký tvar: výstupné tokeny stoja niekoľkonásobne viac ako vstupné. A nie je to malá prirážka. Naprieč aktuálnymi modelmi sa pomer konzistentne pohybuje medzi 4x a 8x. Nie je to cenová zvláštnosť jedného konkrétneho poskytovateľa — je to priamy dôsledok toho, ako tieto modely v skutočnosti fungujú.
Skutočný dôvod: vstup je paralelný, výstup je sekvenčný
Spracovanie vstupných tokenov — váš prompt, systémová správa, história konverzácie — prebieha v jedinom dopredom priechode (forward pass). Model prečíta celý vstup naraz a vypočíta pozornosť (attention) naprieč celým textom paralelne. Moderné GPU sú v tomto type dávkového, paralelného výpočtu mimoriadne dobré, takže prompt s 3 000 tokenmi a prompt s 300 tokenmi nestoja výpočtový čas úmerne k počtu tokenov — dominantným nákladom je réžia jedného spustenia modelu, nie dĺžka toho, čo číta.
Generovanie výstupných tokenov je zásadne odlišné. Každý nový token závisí od každého tokenu, ktorý mu predchádzal, vrátane tých, ktoré model práve vygeneroval — takže token 500 odpovede nemožno vypočítať skôr, než existuje token 499. To vynucuje sekvenčnú slučku: jeden dopredný priechod na jeden výstupný token, spúšťané jeden za druhým, bez možnosti paralelizácie naprieč sekvenciou. Vygenerovanie 500 výstupných tokenov znamená spustiť model 500-krát po sebe, nie raz.
Táto asymetria vo výpočtovej náročnosti — jeden paralelný priechod pre vstup, N sekvenčných priechodov pre N výstupných tokenov — je dôvod, prečo cenník každého veľkého poskytovateľa vyzerá rovnako bez ohľadu na spoločnosť, architektúru modelu alebo región. Nie je to ani tak obchodné rozhodnutie, ako skôr priame prenesenie skutočných výpočtových nákladov.
Čo to znamená pre vaše prompty
Praktický záver je priamočiary: rozvláčna odpoveď modelu stojí neúmerne viac ako dlhý prompt s krátkou odpoveďou, aj keď celkový počet tokenov vyzerá podobne. Ak sa snažíte znížiť výdavky na API, skrátenie výstupu zvyčajne ušetrí na token viac ako skrátenie vstupu.
Niekoľko konkrétnych páčok:
- Výslovne obmedzte dĺžku odpovede. Inštrukcia v systémovom prompte typu „odpovedz v jednom odseku“ alebo limit
max_tokensurobí pre náklady viac ako skracovanie vlastného promptu. - Žiadajte štruktúrovaný výstup namiesto súvislého textu. JSON objekt s tromi poľami je často oveľa kratší než ekvivalent vysvetlený vo vetách, a rovnako užitočný v ďalšom spracovaní.
- Nepreháňajte to s vysvetľovaním v systémovom prompte, aby ste ušetrili na výstupe. Dlhší, presnejší systémový prompt (vstup, lacný), ktorý spoľahlivo vyprodukuje krátku správnu odpoveď (výstup, drahý), je zvyčajne lepší obchod než krátky vágny prompt, ktorý prinúti model poistiť sa dlhou odpoveďou.
- Pre veľkoobjemový, nízkokomplexný výstup použite lacnejší model. Ak úloha nepotrebuje uvažovanie na úrovni špičkového modelu — klasifikácia, extrakcia, krátke odpovede — cenník výstupu modelu z nižšej cenovej kategórie je často o rád nižší.
Výpočet skutočnej sumy v peniazoch
Pomer vysvetľuje, prečo výstup stojí viac, ale presná suma v peniazoch závisí od toho, ktorý model používate a koľko tokenov skutočne spotrebuje každá strana požiadavky. Keďže pomer medzi vstupom a výstupom — a násobiteľ medzi nimi — sa skutočne líši podľa modelu (lacnejší model a vlajkový model neuplatňujú rovnaký pomer), jediný spoľahlivý spôsob, ako zistiť svoje skutočné náklady, je dosadiť vlastné čísla za konkrétny model.
Presne to robí kalkulačka cien LLM API od CodeKitHub: vyberte si model, zadajte počet vstupných a výstupných tokenov, a zobrazí sa vám cena za vstup, cena za výstup a celková suma — plus mesačný odhad, ak približne viete, koľko požiadaviek plánujete robiť. Ak si nie ste istí, koľko tokenov váš skutočný prompt spotrebuje, nástroj Počítadlo tokenov vám dá presný počet pomocou skutočného tokenizéra, nie hrubého odhadu založeného na počte znakov.
Oba nástroje bežia úplne vo vašom prehliadači — žiadny API kľúč, žiadny účet, nič sa nikam neposiela.