Что это за инструмент?
Языковые модели не обрабатывают текст посимвольно или пословно — они разбивают его на «токены», фрагменты, длиной часто составляющие несколько символов (примерно 4 символа или 0,75 слова на токен в английском языке, хотя эти показатели значительно варьируются в зависимости от языка и содержания). Количество токенов напрямую определяет стоимость использования API и то, поместится ли ваш запрос в контекстное окно модели.
Этот инструмент использует реальные кодировки токенизатора — o200k_base (используется в GPT-4o и GPT-4o mini) и cl100k_base (используется в GPT-4 и GPT-3.5) — а не приблизительное значение «количество символов, деленное на 4», поэтому показатель, который вы видите здесь, соответствует тому, что будет фактически включено в ваш счет или послужит ограничением.
Зачем его использовать?
- Реальные кодировки токенизатора (o200k_base, cl100k_base) — а не приблизительные оценки по количеству символов.
- Мгновенно переключайтесь между моделями, чтобы сравнить, как один и тот же текст разбивается на токены в разных моделях.
- Количество символов и слов указано рядом для удобства.
- Обновления происходят в режиме реального времени по мере ввода или вставки текста — не нужно нажимать никаких кнопок.
- 100 % локально — ваш запрос или документ никогда не загружается, что важно, если он содержит конфиденциальную или закрытую информацию.
Как использовать
- Вставьте или введите текст, запрос или код в поле.
- Выберите модель, с которой вы хотите работать (GPT-4o / GPT-4o mini или GPT-4 / GPT-3.5).
- Количество токенов обновляется мгновенно — переключайтесь между моделями, чтобы сравнить их.
- Используйте приведенные рядом данные о количестве символов/слов в качестве контрольной проверки или для ограничений, не связанных с токенами.
Пример
Ввод
"Hello, world!" (GPT-4o encoding)Результат
4 tokens, 13 characters, 2 wordsРаспространенные короткие фразы часто токенизируются по принципу «1 токен на слово или знак препинания», однако этот подход зависит от использования заглавных букв, пробелов и языка.
Какой токенизатор стоит попробовать?
Эти две схемы кодирования не являются взаимозаменяемыми — выбирайте ту, которая соответствует модели, которую вы фактически вызываете, поскольку при токенизации одного и того же текста количество токенов в каждой из них может заметно различаться.
| Семейство моделей | Токенизатор | Когда его использовать |
|---|---|---|
| Модели логического мышления GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 | o200k_base | Любая текущая версия модели OpenAI — это токенизатор, который OpenAI поставляет для всех новых моделей, начиная с GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Старые или устаревшие модели OpenAI, либо если ваши вызовы API по-прежнему направлены на GPT-3.5/GPT-4 (а не на GPT-4o) из соображений экономии. |
| Claude, Gemini, Llama и другие модели, не относящиеся к OpenAI | Ни то, ни другое — здесь это не рассматривается | Эти провайдеры используют собственные токенизаторы (не на основе tiktoken); показатели здесь не будут совпадать с данными в их счетах. |
Практические советы
- Расчет стоимости API перед отправкой запроса: чтобы быстро оценить стоимость, умножьте количество токенов на цену одного токена для вашей модели, вместо того чтобы ориентироваться на количество символов.
- Проверка, поместится ли длинный документ в окно контекста модели: сначала вставьте его сюда целиком — это гораздо быстрее, чем метод проб и ошибок при использовании реального вызова API, который может завершиться сбоем на полпути.
- Сравнение вариантов оптимизации промпта: если вы пытаетесь сократить системный промпт для экономии ресурсов, вставьте сюда каждую версию, чтобы сразу увидеть экономию токенов, а не просто «видимое сокращение».
- Текст на языках, отличных от английского: количество токенов в китайском, японском, корейском и других языках, использующих нелатинские алфавиты, зачастую значительно выше в расчете на один символ, чем в английском языке — следует проверять это конкретно, а не исходить из того, что правило «4 символа на токен» применимо.
Часто задаваемые вопросы
Почему один и тот же текст дает разное количество токенов при использовании разных моделей?
В моделях GPT-4o и GPT-4o mini используется более новая версия токенизатора (o200k_base), чем в GPT-4 и GPT-3.5 (cl100k_base) — эти два алгоритма токенизации разбивают текст на фрагменты с разным словарным запасом, поэтому один и тот же входной текст может быть токенизирован с разным количеством токенов в зависимости от того, какую модель вы используете.
Действительно ли 1 токен соответствует примерно 4 символам?
Это приблизительное среднее значение для английской прозы, но оно может значительно варьироваться: обычные английские слова часто соответствуют одному токену, тогда как редкие слова, код и, в особенности, нелатинские алфавиты (китайский, японский, корейский, арабский) могут занимать заметно больше токенов на один символ. Всегда проверяйте точное количество для всего, что зависит от стоимости или ограничений, а не полагайтесь на эмпирическое правило «4 символа».
Использует ли этот инструмент API OpenAI для подсчета токенов?
Нет. В нем используется реализация на JavaScript тех же кодировок токенизатора (o200k_base, cl100k_base), которая работает полностью в вашем браузере. API-ключ не требуется, сетевые запросы не отправляются, и ваш текст никуда не передается.
Почему количество моих токенов имеет значение?
Есть две причины: оплата за использование API производится за каждый токен (входной и выходной), а для каждой модели установлен максимальный размер контекстного окна, измеряемый в токенах — если ваш запрос вместе с ожидаемым ответом превышает этот предел, запрос завершается сбоем или будет усечен. Заранее проверив количество токенов, вы сможете избежать обеих неприятных сюрпризов.
Работает ли это с моделями Claude, Gemini или другими моделями, не относящимися к OpenAI?
Приведенные данные относятся исключительно к токенизаторам OpenAI (o200k_base и cl100k_base). Другие поставщики используют собственные токенизаторы, которые могут давать существенно отличающиеся результаты при обработке одного и того же текста — данный инструмент не учитывает эти данные.