
Proč výstupní tokeny LLM API stojí 4–8× víc než vstupní
Publikováno 25. 7. 2026
Podívejte se na ceník kteréhokoli velkého LLM API — OpenAI, Anthropic, Google, na tom nezáleží — a pokaždé uvidíte stejný tvar: výstupní tokeny stojí několikanásobně víc než vstupní. A není to malá přirážka. Napříč současnými modely se poměr drží konzistentně mezi 4× a 8×. Není to cenová zvláštnost jednoho dodavatele; je to přímý důsledek toho, jak tyto modely doopravdy běží.
Skutečný důvod: vstup je paralelní, výstup je sekvenční
Zpracování vstupních tokenů — vašeho promptu, systémové zprávy, historie konverzace — probíhá v jediném dopředném průchodu. Model přečte celý vstup najednou a spočítá attention přes něj celý paralelně. Moderní GPU jsou v tomhle druhu dávkových, paralelních výpočtů extrémně dobré, takže prompt o 3 000 tokenech a prompt o 300 tokenech nestojí úměrně tolik výpočetního času, kolik by počty tokenů naznačovaly — dominantním nákladem je režie jednoho spuštění modelu, ne délka toho, co čte.
Generování výstupních tokenů je zásadně jiné. Každý nový token závisí na všech tokenech před ním, včetně těch, které model právě vygeneroval — takže token 500 odpovědi nelze spočítat, dokud neexistuje token 499. To vynucuje sekvenční smyčku: jeden dopředný průchod na výstupní token, spouštěné jeden po druhém, bez možnosti paralelizace napříč sekvencí. Vyprodukovat 500 výstupních tokenů znamená spustit model 500× za sebou, ne jednou.
Tato asymetrie ve výpočtu — jeden paralelní průchod pro vstup, N sekvenčních průchodů pro N výstupních tokenů — je důvod, proč vypadá ceník každého velkého poskytovatele stejně bez ohledu na firmu, architekturu modelu nebo region. Není to ani tak obchodní rozhodnutí jako přímé přenesení podkladových výpočetních nákladů.
Co z toho plyne pro vaše prompty
Praktický závěr je přímočarý: upovídaná odpověď modelu stojí neúměrně víc než dlouhý prompt s krátkou odpovědí, i když celkový počet tokenů vypadá podobně. Pokud chcete snížit útratu za API, zkrácení délky výstupu obvykle ušetří na token víc než zkrácení vstupu.
Pár konkrétních pák:
- Explicitně omezte délku odpovědi. Instrukce v systémovém promptu jako „odpověz jedním odstavcem“ nebo limit
max_tokensudělá pro náklady víc než zkracování vlastního promptu. - Chtějte strukturovaný výstup místo prózy. JSON objekt se třemi poli je často mnohem kratší než totéž vysvětlené větami, a v dalším zpracování stejně užitečný.
- Nešetřete na systémovém promptu, abyste ušetřili na výstupu. Delší, přesnější systémový prompt (vstup, levný), který spolehlivě vede ke krátké správné odpovědi (výstup, drahý), je obvykle lepší obchod než krátký vágní prompt, kvůli kterému model jistí dlouhou odpovědí.
- Používejte levnější model pro objemný, nenáročný výstup. Pokud úloha nepotřebuje uvažování špičkového modelu — klasifikace, extrakce, krátké odpovědi — bývá cena výstupu rozpočtového modelu o řád nižší.
Jak spočítat skutečnou částku v dolarech
Poměr vysvětluje, proč výstup stojí víc, ale přesná částka závisí na tom, který model používáte a kolik tokenů každá strana požadavku skutečně spotřebuje. Protože se rozdělení vstup/výstup — i násobitel mezi nimi — mezi modely opravdu liší (rozpočtový a vlajkový model nepoužívají stejný poměr), jediný spolehlivý způsob, jak znát své reálné náklady, je dosadit svá skutečná čísla pro konkrétní model.
Přesně to dělá LLM API Pricing Calculator od CodeKitHub: vyberte model, zadejte počty vstupních a výstupních tokenů a uvidíte cenu vstupu, cenu výstupu a celkem — plus měsíční odhad, pokud zhruba víte, kolik požadavků uděláte. Pokud si nejste jistí, kolik tokenů váš prompt skutečně používá, nástroj Token Counter vám dá přesný počet pomocí skutečného tokenizéru, ne hrubý odhad podle znaků.
Oba běží kompletně ve vašem prohlížeči — žádný API klíč, žádný účet, nic se nikam neodesílá.