CodeKitHub
Русский
Текстовые инструменты

Счетчик токенов AI

Вставьте любой текст, запрос или код и узнайте, сколько именно токенов он содержит — с использованием тех же кодировок токенизатора, которые модели OpenAI используют внутренне (o200k_base для GPT-4o, cl100k_base для GPT-4/GPT-3.5), а не приблизительную оценку количества символов. Для справки рядом отображается количество символов и слов. Всё работает локально в вашем браузере.

0
Токены
0
Символы
0
Слова

Разные модели разбивают текст на токены по-разному — попробуйте сменить модель выше, чтобы увидеть, как изменится количество токенов. Все вычисления производятся локально; ваш текст никуда не загружается.

Что это за инструмент?

Языковые модели не обрабатывают текст посимвольно или пословно — они разбивают его на «токены», фрагменты, длиной часто составляющие несколько символов (примерно 4 символа или 0,75 слова на токен в английском языке, хотя эти показатели значительно варьируются в зависимости от языка и содержания). Количество токенов напрямую определяет стоимость использования API и то, поместится ли ваш запрос в контекстное окно модели.

Этот инструмент использует реальные кодировки токенизатора — o200k_base (используется в GPT-4o и GPT-4o mini) и cl100k_base (используется в GPT-4 и GPT-3.5) — а не приблизительное значение «количество символов, деленное на 4», поэтому показатель, который вы видите здесь, соответствует тому, что будет фактически включено в ваш счет или послужит ограничением.

Зачем его использовать?

  • Реальные кодировки токенизатора (o200k_base, cl100k_base) — а не приблизительные оценки по количеству символов.
  • Мгновенно переключайтесь между моделями, чтобы сравнить, как один и тот же текст разбивается на токены в разных моделях.
  • Количество символов и слов указано рядом для удобства.
  • Обновления происходят в режиме реального времени по мере ввода или вставки текста — не нужно нажимать никаких кнопок.
  • 100 % локально — ваш запрос или документ никогда не загружается, что важно, если он содержит конфиденциальную или закрытую информацию.

Как использовать

  1. Вставьте или введите текст, запрос или код в поле.
  2. Выберите модель, с которой вы хотите работать (GPT-4o / GPT-4o mini или GPT-4 / GPT-3.5).
  3. Количество токенов обновляется мгновенно — переключайтесь между моделями, чтобы сравнить их.
  4. Используйте приведенные рядом данные о количестве символов/слов в качестве контрольной проверки или для ограничений, не связанных с токенами.

Пример

Ввод

"Hello, world!" (GPT-4o encoding)

Результат

4 tokens, 13 characters, 2 words

Распространенные короткие фразы часто токенизируются по принципу «1 токен на слово или знак препинания», однако этот подход зависит от использования заглавных букв, пробелов и языка.

Какой токенизатор стоит попробовать?

Эти две схемы кодирования не являются взаимозаменяемыми — выбирайте ту, которая соответствует модели, которую вы фактически вызываете, поскольку при токенизации одного и того же текста количество токенов в каждой из них может заметно различаться.

Семейство моделейТокенизаторКогда его использовать
Модели логического мышления GPT-4o, GPT-4o mini, GPT-4.1, o1/o3o200k_baseЛюбая текущая версия модели OpenAI — это токенизатор, который OpenAI поставляет для всех новых моделей, начиная с GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseСтарые или устаревшие модели OpenAI, либо если ваши вызовы API по-прежнему направлены на GPT-3.5/GPT-4 (а не на GPT-4o) из соображений экономии.
Claude, Gemini, Llama и другие модели, не относящиеся к OpenAIНи то, ни другое — здесь это не рассматриваетсяЭти провайдеры используют собственные токенизаторы (не на основе tiktoken); показатели здесь не будут совпадать с данными в их счетах.

Практические советы

  • Расчет стоимости API перед отправкой запроса: чтобы быстро оценить стоимость, умножьте количество токенов на цену одного токена для вашей модели, вместо того чтобы ориентироваться на количество символов.
  • Проверка, поместится ли длинный документ в окно контекста модели: сначала вставьте его сюда целиком — это гораздо быстрее, чем метод проб и ошибок при использовании реального вызова API, который может завершиться сбоем на полпути.
  • Сравнение вариантов оптимизации промпта: если вы пытаетесь сократить системный промпт для экономии ресурсов, вставьте сюда каждую версию, чтобы сразу увидеть экономию токенов, а не просто «видимое сокращение».
  • Текст на языках, отличных от английского: количество токенов в китайском, японском, корейском и других языках, использующих нелатинские алфавиты, зачастую значительно выше в расчете на один символ, чем в английском языке — следует проверять это конкретно, а не исходить из того, что правило «4 символа на токен» применимо.

Часто задаваемые вопросы

Почему один и тот же текст дает разное количество токенов при использовании разных моделей?

В моделях GPT-4o и GPT-4o mini используется более новая версия токенизатора (o200k_base), чем в GPT-4 и GPT-3.5 (cl100k_base) — эти два алгоритма токенизации разбивают текст на фрагменты с разным словарным запасом, поэтому один и тот же входной текст может быть токенизирован с разным количеством токенов в зависимости от того, какую модель вы используете.

Действительно ли 1 токен соответствует примерно 4 символам?

Это приблизительное среднее значение для английской прозы, но оно может значительно варьироваться: обычные английские слова часто соответствуют одному токену, тогда как редкие слова, код и, в особенности, нелатинские алфавиты (китайский, японский, корейский, арабский) могут занимать заметно больше токенов на один символ. Всегда проверяйте точное количество для всего, что зависит от стоимости или ограничений, а не полагайтесь на эмпирическое правило «4 символа».

Использует ли этот инструмент API OpenAI для подсчета токенов?

Нет. В нем используется реализация на JavaScript тех же кодировок токенизатора (o200k_base, cl100k_base), которая работает полностью в вашем браузере. API-ключ не требуется, сетевые запросы не отправляются, и ваш текст никуда не передается.

Почему количество моих токенов имеет значение?

Есть две причины: оплата за использование API производится за каждый токен (входной и выходной), а для каждой модели установлен максимальный размер контекстного окна, измеряемый в токенах — если ваш запрос вместе с ожидаемым ответом превышает этот предел, запрос завершается сбоем или будет усечен. Заранее проверив количество токенов, вы сможете избежать обеих неприятных сюрпризов.

Работает ли это с моделями Claude, Gemini или другими моделями, не относящимися к OpenAI?

Приведенные данные относятся исключительно к токенизаторам OpenAI (o200k_base и cl100k_base). Другие поставщики используют собственные токенизаторы, которые могут давать существенно отличающиеся результаты при обработке одного и того же текста — данный инструмент не учитывает эти данные.

Похожие инструменты