
Чому вихідні токени в LLM API коштують у 4-8 разів дорожче за вхідні
Опубліковано 25 лип. 2026 р.
Погляньте на сторінку цін будь-якого великого LLM API — OpenAI, Anthropic, Google, байдуже — і щоразу побачите одну й ту саму картину: вихідні токени коштують у кілька разів дорожче за вхідні. І це не невелика націнка. У сучасних моделях це співвідношення стабільно тримається в межах від 4x до 8x. Це не примха ціноутворення якогось окремого постачальника — це пряме наслідок того, як ці моделі насправді працюють.
Справжня причина: вхід паралельний, вихід послідовний
Обробка вхідних токенів — вашого промпту, системного повідомлення, історії розмови — відбувається за один прямий прохід. Модель зчитує весь вхід одразу і обчислює увагу по всьому масиву паралельно. Сучасні GPU дуже добре справляються саме з такими пакетними, паралельними обчисленнями, тому промпт на 3000 токенів і промпт на 300 токенів не коштують пропорційно стільки ж часу обчислень, скільки могла б підказати кількість токенів — домінує вартість самого запуску моделі, а не довжина того, що вона читає.
Генерація вихідних токенів принципово інша. Кожен новий токен залежить від усіх попередніх токенів, включно з тими, які модель щойно згенерувала — тож 500-й токен відповіді неможливо обчислити, поки не існує 499-й. Це змушує працювати послідовним циклом: один прямий прохід на кожен вихідний токен, один за одним, без можливості розпаралелити по послідовності. Згенерувати 500 вихідних токенів означає запустити модель 500 разів поспіль, а не один раз.
Ця асиметрія обчислень — один паралельний прохід для входу проти N послідовних проходів для N вихідних токенів — і є причиною того, чому ціноутворення в усіх великих постачальників виглядає однаково, незалежно від компанії, архітектури моделі чи регіону. Це не стільки бізнес-рішення, скільки пряме перенесення реальної вартості обчислень.
Що це означає для ваших промптів
Практичний висновок простий: багатослівна відповідь моделі коштує непропорційно дорожче, ніж довгий промпт із короткою відповіддю, навіть якщо загальна кількість токенів виглядає схожою. Якщо ви намагаєтеся скоротити витрати на API, обрізання довжини виходу зазвичай економить більше на токен, ніж обрізання довжини входу.
Кілька конкретних важелів:
- Явно обмежуйте довжину відповіді. Інструкція в системному промпті на кшталт “відповідай одним абзацом” або ліміт
max_tokensдає більше для вартості, ніж скорочення власного промпту. - Просіть структурований вихід замість прози. Об’єкт JSON із трьома полями часто набагато коротший за еквівалентне пояснення реченнями, і так само корисний далі в конвеєрі.
- Не намагайтеся заощадити на виході за рахунок недостатнього пояснення в системному промпті. Довший, точніший системний промпт (вхід, дешево), який надійно дає коротку правильну відповідь (вихід, дорого), зазвичай вигідніший, ніж короткий розпливчастий промпт, через який модель “підстраховується” довгою відповіддю.
- Використовуйте дешевшу модель для великих обсягів простого виходу. Якщо завдання не потребує міркувань флагманської моделі — класифікація, витягування даних, короткі відповіді — ціна виходу в бюджетній моделі часто на порядок нижча.
Як порахувати реальну суму в доларах
Співвідношення пояснює чому вихід коштує дорожче, але точна сума в доларах залежить від того, яку модель ви використовуєте і скільки токенів реально споживає кожна сторона запиту. Оскільки співвідношення вхід/вихід — і множник між ними — справді відрізняється від моделі до моделі (бюджетна модель і флагманська модель не застосовують те саме співвідношення), єдиний надійний спосіб дізнатися свою реальну вартість — підставити свої фактичні цифри для конкретної моделі.
Саме це й робить Калькулятор цін LLM API від CodeKitHub: обираєте модель, вводите кількість вхідних і вихідних токенів, і він показує вартість входу, вартість виходу і загальну суму — а також місячну оцінку, якщо ви приблизно знаєте, скільки запитів робитимете. Якщо не впевнені, скільки токенів займає ваш реальний промпт, інструмент Лічильник токенів дає точну кількість за допомогою справжнього токенізатора, а не приблизної оцінки за кількістю символів.
Обидва працюють повністю у вашому браузері — без API-ключа, без облікового запису, нічого нікуди не надсилається.