Що це за інструмент?
Мовні моделі обробляють текст не по символах і не по словах — вони розбивають його на "токени", фрагменти зазвичай у кілька символів (приблизно 4 символи чи 0,75 слова на токен для англійської, хоча це сильно залежить від мови й змісту). Кількість токенів безпосередньо визначає вартість запиту до API й те, чи вміщується ваш промпт у контекстне вікно моделі.
Цей інструмент використовує справжні кодування токенізатора — o200k_base (використовується GPT-4o та GPT-4o mini) і cl100k_base (використовується GPT-4 та GPT-3.5) — а не приблизне наближення "символи поділити на 4", тож кількість, яку ви бачите тут, збігається з тим, за що вас справді виставлять рахунок чи обмежать.
Навіщо його використовувати?
- Справжні кодування токенізатора (o200k_base, cl100k_base) — не здогадка за кількістю символів.
- Миттєве перемикання моделей, щоб порівняти, як той самий текст токенізується по-різному.
- Кількість символів і слів показується поряд для швидкої довідки.
- Оновлюється в реальному часі під час введення чи вставлення — без кнопки для натискання.
- На 100% локально — ваш промпт чи документ ніколи не завантажується, що важливо, якщо він містить конфіденційний чи чутливий текст.
Як користуватися
- Вставте чи введіть свій текст, промпт або код у поле.
- Оберіть модель, для якої рахуєте (GPT-4o / GPT-4o mini, або GPT-4 / GPT-3.5).
- Кількість токенів оновлюється миттєво — перемикайте моделі для порівняння.
- Використовуйте кількість символів/слів поряд як швидку перевірку чи для обмежень, не пов'язаних з токенами.
Приклад
Введення
"Hello, world!" (кодування GPT-4o)Результат
4 токени, 13 символів, 2 словаПоширені короткі фрази часто токенізуються як 1 токен на слово чи розділовий знак, але це залежить від регістру, пробілів і мови.
Який токенізатор варто перевіряти?
Ці два кодування не є взаємозамінними — оберіть те, що відповідає моделі, до якої ви справді звертаєтесь, оскільки той самий текст може токенізуватися в помітно різну кількість у кожному з них.
| Родина моделей | Токенізатор | Коли використовувати |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, моделі міркування o1/o3 | o200k_base | Будь-яка поточна модель OpenAI — це токенізатор, який OpenAI постачає для всіх новіших моделей, починаючи з GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Старіші чи застарілі моделі OpenAI, або якщо ваші виклики API досі спрямовані на GPT-3.5/GPT-4 (не GPT-4o) з міркувань вартості. |
| Claude, Gemini, Llama та інші моделі не від OpenAI | Жоден — тут не охоплено | Ці постачальники використовують власні токенізатори (не на основі tiktoken); кількість тут не збігатиметься з їхньою тарифікацією. |
Практичні поради
- Оцінка вартості API перед надсиланням запиту: помножте кількість токенів на ціну за токен вашої моделі, щоб швидко оцінити вартість, а не здогадуватися за кількістю символів.
- Перевірка, чи вміщується довгий документ у контекстне вікно моделі: спершу вставте весь текст сюди — це значно швидше, ніж методом спроб і помилок надсилати реальний запит до API, що зривається на півдорозі.
- Порівняння варіантів промпт-інженерії: якщо намагаєтесь скоротити системний промпт для економії, вставте кожну версію сюди, щоб побачити пряму економію токенів, а не просто "здається коротшим".
- Текст іншими мовами: кількість токенів для китайської, японської, корейської та інших нелатинських писемностей часто набагато вища на символ, ніж для англійської — перевіряйте це явно, а не покладайтесь на правило 4 символи на токен.
Часті запитання
Чому той самий текст дає різну кількість токенів для різних моделей?
GPT-4o та GPT-4o mini використовують новіший токенізатор (o200k_base), ніж GPT-4 та GPT-3.5 (cl100k_base) — ці два кодування розбивають текст на різний словник фрагментів, тож той самий вхідний текст може токенізуватися в різну кількість залежно від того, для якої моделі ви рахуєте.
Чи справді 1 токен становить приблизно 4 символи?
Це приблизне середнє для англійської прози, але воно сильно варіюється: поширені англійські слова часто становлять по 1 токену, тоді як рідкісні слова, код і особливо нелатинські писемності (китайська, японська, корейська, арабська) можуть займати помітно більше токенів на символ. Завжди перевіряйте точну кількість для всього, чутливого до вартості чи обмежень, а не покладайтеся на правило "4 символи".
Чи звертається цей інструмент до API OpenAI, щоб порахувати токени?
Ні. Він використовує реалізацію на JavaScript тих самих кодувань токенізатора (o200k_base, cl100k_base), що працює повністю у вашому браузері. Ключ API не потрібен, мережевий запит не виконується, а ваш текст нікуди не надсилається.
Чому кількість токенів має значення?
Дві причини: тарифікація API виставляється за токен (вхідний і вихідний), і кожна модель має максимальне контекстне вікно, виміряне в токенах — якщо ваш промпт плюс очікувана відповідь перевищують цей ліміт, запит завершується помилкою або обрізається. Перевірка кількості токенів заздалегідь дозволяє уникнути обох несподіванок.
Чи працює це для Claude, Gemini чи інших моделей не від OpenAI?
Показана кількість стосується саме токенізаторів OpenAI (o200k_base і cl100k_base). Інші постачальники використовують власні токенізатори, які можуть давати помітно іншу кількість для того самого тексту — цей інструмент їх не охоплює.
Скільки токенів варто очікувати на слово?
Для звичайної англійської прози приблизно 0,75 слова на токен — тож стаття на 1000 слів становить близько 1300 токенів. Код зазвичай токенізується менш ефективно через відступи й символи, а нелатинські писемності коштують ще більше: китайський текст часто використовує один або кілька токенів на символ. Якщо плануєте бюджет на API, вимірюйте свій реальний текст тут, а не оцінюйте лише за кількістю слів.