Содержание
  1. Что такое токен в ИИ и зачем модель считает куски текста
  2. Как работает токенизация: байты, BPE и номер токена в словаре
  3. Сколько символов и слов в одном токене: цифры замера
  4. Почему на русском токенов больше: замер на параллельном корпусе
  5. Почему коэффициент токенов разный у разных моделей
  6. Насколько устойчив коэффициент: разброс токенов внутри одного языка
  7. Какие бывают токены: вход, выход, кэш и рассуждение
  8. Контекстное окно и лимит токенов: что занимает место
  9. Как токены превращаются в деньги
  10. Чем посчитать токены в своём тексте
  11. Как сократить расход токенов без потери качества
  12. Токены в ИИ и AI-токены на бирже: чем они различаются
  13. Кому считать токены: чат по подписке и работа через API
  14. Чек-лист: что проверить перед оплатой токенов
  15. Частые вопросы про токены в ИИ
Справочник

Токены в ИИ: что это, как считать и почему русский дороже

17 сентября 2026 · 14 минут чтения

Материал редакции Зерокодера. Числа получены собственным прогоном токенизаторов 17 сентября 2026 года, скрипт замера и корпус названы в тексте. Обновлено: сентябрь 2026.

Токены в ИИ — это куски текста, на которые языковая модель режет запрос перед обработкой: часть слова, целое слово, знак препинания или пробел. У каждого куска есть номер в словаре токенизатора, и дальше модель работает с номерами. Токенами меряют длину запроса, объём контекстного окна и счёт за работу через API. Русский текст занимает больше токенов, чем английский с тем же смыслом, и размер разницы задаёт словарь конкретной модели.

Главное:

  • Токен — кусок текста со своим номером в словаре; границы токена не совпадают ни со словом, ни с буквой.
  • Собственный замер: 30 статей Всеобщей декларации прав человека весят 2189 токенов против 1518 английских в словаре o200k_base (GPT-4o, GPT-5) и 4063 против 1519 в cl100k_base (GPT-4, GPT-3.5-turbo).
  • Коэффициент «русский дороже» принадлежит словарю: доля кириллицы выросла с 0,73% у cl100k_base до 7,03% у o200k_base, и раздувание упало с ×2,67 до ×1,44.
  • Внутри одного словаря разброс по отдельным текстам идёт от ×1,14 до ×2,00, поэтому коэффициент, снятый с одной фразы, коэффициентом языка не является.
  • Деньги списывают за вход и за выход: у DeepSeek правило записано как «The expense = number of tokens × price», и в бюджет на миллион токенов помещается 412 русских документов против 662 английских.

Что такое токен в ИИ и зачем модель считает куски текста

Токен в ИИ — минимальная единица текста, с которой работает языковая модель: приставка, корень, окончание, короткое слово, цифра, знак препинания или пробел со следующим словом. Библиотека tiktoken, официальный токенизатор OpenAI, объясняет смысл операции прямо: «Language models don’t see text like you and I, instead they see a sequence of numbers (known as tokens)» — модель видит последовательность чисел. Сам текст в вычисление не попадает: токенизатор заменяет кусок номером из словаря, модель предсказывает следующий номер, обратное преобразование собирает буквы. Поэтому длина запроса, объём памяти и стоимость измеряются в токенах. Как устроена сама модель, разобрано в материале что такое LLM.

Мини-вывод: токен — это способ, которым модель вообще получает текст.

Как работает токенизация: байты, BPE и номер токена в словаре

Токенизация текста идёт алгоритмом BPE — byte pair encoding, парное кодирование байтов. Словарь собирают заранее: алгоритм начинает с отдельных байтов и раз за разом склеивает самую частую пару в новую запись. README библиотеки tiktoken перечисляет свойства результата: «It’s reversible and lossless, so you can convert tokens back into the original text… It compresses the text: the token sequence is shorter than the bytes corresponding to the original text. On average, in practice, each token corresponds to about 4 bytes». Там же названа причина, по которой словарь перекошен в сторону английского: «It attempts to let the model see common subwords. For instance, «ing» is a common subword in English». Частое английское окончание получает собственную запись словаря, редкая русская словоформа — нет, и её приходится собирать из нескольких кусков.

Мини-вывод: словарь фиксируется до обучения модели и режет любой текст по своим правилам.

Сколько символов и слов в одном токене: цифры замера

В словаре o200k_base один токен покрыл 4,32 символа русского текста и 5,44 символа английского. Это собственный прогон на 9447 символах русской версии Всеобщей декларации прав человека против её английской версии. В словаре cl100k_base тот же русский текст даёт 2,33 символа на токен. В o200k_base русское слово режется в среднем на 1,71 токена, английское — на 1,12 токена; в cl100k_base русское слово занимает уже 3,17 токена. Отсюда пересчёт, который обычно спрашивают: в словаре o200k_base в 1000 токенов помещается 586 русских слов; в cl100k_base — 316. Правило Сбера для GigaChat — «В среднем один токен состоит из 3—4 символов» — попадает ровно между этими двумя замерами. Как сформулировать запрос по-русски компактно, показано в подборке промтов для ИИ на русском.

Мини-вывод: усреднённое «3–4 символа» верно только для своего словаря.

Почему на русском токенов больше: замер на параллельном корпусе

Русский текст дороже английского, потому что кириллица занимает в UTF-8 два байта против одного у латиницы, а словарь токенизатора собран в основном на английских данных. Размер эффекта редакция замерила сама. Корпус — статьи 1–30 Всеобщей декларации прав человека, официальный параллельный текст ООН с сайта un.org: одинаковый смысл и одинаковая структура. Русская версия весит 17 382 байта против 8262 английских, то есть ×2,10 по кодировке. После токенизации разрыв сжимается: 2189 токенов против 1518 в словаре o200k_base, ×1,44. Словарь отыгрывает бо́льшую часть разницы, созданной кодировкой, — и отыгрывает по-разному у разных моделей.

Токенизатор Русский, токенов Английский, токенов Раздувание Символов на токен, русский
o200k_base — GPT-4o, GPT-4.1, GPT-5 2189 1518 ×1,44 4,32
DeepSeek-V3 2422 1510 ×1,60 3,90
Qwen2.5-7B 2742 1519 ×1,81 3,45
cl100k_base — GPT-4, GPT-3.5-turbo, эмбеддинги 4063 1519 ×2,67 2,33

Мини-вывод: разница между русским и английским на одном тексте меняется почти вдвое со сменой словаря.

Почему коэффициент токенов разный у разных моделей

Коэффициент раздувания русского языка задаёт доля кириллицы в словаре токенизатора. Редакция посчитала её вторым проходом: сколько записей словаря содержат кириллическую букву. У cl100k_base таких записей 733 из 100 277, это 0,73%. У Qwen2.5-7B — 3996 из 151 665, или 2,63%. У DeepSeek-V3 — 5213 из 128 815, или 4,05%. У o200k_base — 14 070 из 200 019, или 7,03%. Доля растёт, раздувание падает, и порядок совпадает точно: 0,73% → ×2,67, 2,63% → ×1,81, 4,05% → ×1,60, 7,03% → ×1,44.

Словарь Кириллических записей Доля словаря Раздувание русского
cl100k_base 733 из 100 277 0,73% ×2,67
Qwen2.5-7B 3996 из 151 665 2,63% ×1,81
DeepSeek-V3 5213 из 128 815 4,05% ×1,60
o200k_base 14 070 из 200 019 7,03% ×1,44

Какая модель каким словарём режет текст, записано в самой библиотеке tiktoken, файл tiktoken/model.py: "gpt-5": "o200k_base", "gpt-4o": "o200k_base", "gpt-4": "cl100k_base", "gpt-3.5-turbo": "cl100k_base", "text-embedding-3-large": "cl100k_base". Переезд с GPT-4 на GPT-4o или GPT-5 сокращает счёт за один и тот же русский текст почти вдвое ещё до разговора о тарифах. Ответы русскоязычных моделей сравнивались отдельно — GigaChat против ChatGPT.

Мини-вывод: коэффициент русского языка — характеристика словаря; без имени словаря он бессмыслен.

Насколько устойчив коэффициент: разброс токенов внутри одного языка

Раздувание русского нестабильно даже внутри одного документа и словаря. По тем же тридцати статьям декларации в o200k_base разброс идёт от ×1,14 у статьи 22 до ×2,00 у статьи 10: юридические формулы с отглагольными существительными режутся хуже простых перечислений. На коротких бытовых запросах эффект ещё меньше: десять реплик вроде «Переведи этот договор на английский и выдели риски» дали 148 русских токенов против 117 английских, то есть ×1,26 в o200k_base; в cl100k_base те же реплики весят 240 токенов, ×2,05. Число, снятое с одной придуманной фразы, описывает эту фразу. В выдаче Яндекса по запросам кластера одновременно живут ×1,44 у thecode.media, «в 1,5–2 раза» у sber.pro, «в 2–3 раза дороже» у checkroi.ru и «1000 токенов ≈ 350–400 слов на русском» у блога GPTunneL на Хабре. Все четыре числа попадают в диапазон, который даёт замер, — просто для разных словарей.

Мини-вывод: спрашивая про коэффициент, уточняйте модель и тип текста.

Какие бывают токены: вход, выход, кэш и рассуждение

Токены делятся на четыре категории по месту в запросе и тарифицируются по-разному. Входные — промпт, системная инструкция, история переписки и приложенные файлы. Выходные — то, что модель сгенерировала в ответ, они почти всегда дороже входных. Кэшированные входные — повторяющаяся часть запроса, которую провайдер узнал и не считает заново. Токены рассуждения — внутренняя цепочка размышления у моделей с режимом thinking; DeepSeek объявляет его строкой «THINKING MODE Supports both non-thinking and thinking (default) modes»: пользователь цепочки не видит, её объём входит в счёт. Разница огромна: в тарифе deepseek-flash миллион входных токенов при попадании в кэш стоит $0,003 в непиковые часы, мимо кэша — $0,15, в пятьдесят раз дороже.

Мини-вывод: счёт складывается из четырёх потоков токенов, дороже всего обычно генерация.

Контекстное окно и лимит токенов: что занимает место

Контекстное окно — максимальное число токенов, которое модель удерживает за один проход. В окно входит всё сразу: системная инструкция, история диалога, приложенные документы, текущий вопрос и место под ответ. Когда сумма токенов превышает лимит, сервис либо отбрасывает самое старое сообщение, либо отказывается принимать запрос — и в первом случае модель буквально перестаёт помнить начало разговора. Размер окна называется в документации модели: у DeepSeek на странице цен заявлено CONTEXT LENGTH 1M и MAX OUTPUT MAXIMUM: 384K. Пересчёт в понятный объём даёт замер: в словаре o200k_base миллион токенов вмещает около 586 тысяч русских слов; в cl100k_base — около 316 тысяч.

Мини-вывод: длинная история диалога съедает то же окно, что и место под ответ.

Как токены превращаются в деньги

Стоимость запроса считает формула, которую провайдер печатает в документации: DeepSeek пишет «The expense = number of tokens × price» и уточняет, что тариф объявлен за миллион токенов и берётся с суммы входа и выхода — «We will bill based on the total number of input and output tokens by the model». Цена за миллион токенов у deepseek-v4-pro в непиковые часы составляет $0,66 за вход мимо кэша и $1,98 за выход. Наш замер переводит тариф в объём работы: бюджет в миллион токенов у токенизатора DeepSeek-V3 вмещает 412 копий русского текста декларации против 662 английских. При одинаковых деньгах русскоязычная задача получает примерно на треть меньше материала. Приёмы сокращения промпта разобраны в материале про сжатие Prompt с помощью LLMLingua.

Мини-вывод: цена линейна по токенам, поэтому экономия токенов равна экономии денег.

Чем посчитать токены в своём тексте

Токены считают до запроса и после него, и это два разных счёта: оценка даёт бюджет, факт — сумму в счёте провайдера.

До запроса. Первый способ — локальная библиотека. Для моделей OpenAI это tiktoken, три строки кода:

PYTHON3 строки
import tiktoken
enc = tiktoken.get_encoding("o200k_base")
print(len(enc.encode("Съешь ещё этих мягких французских булок, да выпей чаю.")))

Эта фраза даёт 18 токенов в o200k_base; в cl100k_base — 34 токена. Её английский перевод — 13 токенов в обоих словарях. Для открытых моделей ту же работу делает библиотека Tokenizers от Hugging Face, которая загружает словарь по имени репозитория, — так в этом замере считались DeepSeek-V3 и Qwen2.5-7B. Второй способ — метод подсчёта в API провайдера: документация GigaChat указывает запрос «POST /tokens/count».

После запроса. Фактический расход возвращает сам API, и провайдер считает настоящим именно его. DeepSeek в разделе «Token & Token Usage» пишет: «The actual number of tokens processed each time is based on the model’s return, which you can view from the usage results», и отдельно предупреждает, что при расхождении с оценкой опираться нужно на «the usage returned by the API as the source of truth». Накопленный расход лежит в кабинете: документация GigaChat называет два раздела личного кабинета Studio — Биллинг и Статистика, где показаны «количество затраченных сессий и токенов» и стоимость в рублях, с выгрузкой в xlsx.

Мини-вывод: до запуска считают бюджет, после вызова поле usage показывает, по чему выставлен счёт.

Как сократить расход токенов без потери качества

Расход токенов сокращают четыре приёма, и эффект каждого виден по числам замера. Первый: выбрать модель с современным словарём — переход с cl100k_base на o200k_base уменьшил вес того же русского текста с 4063 токенов до 2189, почти вдвое, без правок в тексте. Второй: убрать из промпта то, что модель уже получила: повторно приложенный документ стоит столько же, сколько в первый раз. Третий: держать постоянную часть запроса неизменной, чтобы провайдер засчитал кэш; в тарифе deepseek-flash попадание в кэш меняет цену входа с $0,15 на $0,003 за миллион токенов. Четвёртый: писать компактно — на десяти бытовых запросах замер дал 148 токенов против 117 у английских аналогов, разница приходится на многословные обороты.

Мини-вывод: самый крупный выигрыш даёт смена словаря; правка формулировок идёт вторым номером.

Токены в ИИ и AI-токены на бирже: чем они различаются

Токены в ИИ и AI-токены на криптобирже — разные объекты с одинаковым названием. Токен в языковой модели — кусок текста с номером в словаре, он живёт внутри обработки запроса и продаётся как объём вычислений. AI-токен на бирже — криптовалютный актив проекта, связанного с искусственным интеллектом: торгуется, хранится в кошельке и к обработке текста отношения не имеет. Путаница закреплена выдачей: по запросу «что такое токены в ии» на девятой позиции Яндекса стоит руководство Gate Learn с первым абзацем «Слияние искусственного интеллекта и блокчейна привело к появлению уникальных цифровых активов, известных как криптотокены AI» и списком Injective, The Graph, Render Token.

Мини-вывод: если рядом стоят «кошелёк», «биржа» или «листинг», речь о криптоактиве.

Кому считать токены: чат по подписке и работа через API

Считать токены нужно всем, кто упирается в лимит или платит по счётчику, но глубина счёта разная. Пользователю чата по подписке точное число не нужно: тариф оплачен, и достаточно понимать, что длинный диалог и файлы забивают контекстное окно, после чего модель теряет начало разговора. Разработчику на API нужен точный счёт до отправки: тариф берётся с каждого токена входа и выхода, и ошибка в оценке объёма становится ошибкой в бюджете. Отдельный случай — агенты, которые ходят в модель без человека: один неудачный цикл сжигает дневной лимит, поэтому счётчик ставят на каждый вызов.

Мини-вывод: в чате достаточно чувства меры, на API нужен счётчик.

Чек-лист: что проверить перед оплатой токенов

Что проверить Где посмотреть Почему это важно
Какой словарь у вашей модели tiktoken/model.py или карточка модели на Hugging Face На русском тексте ×2,67 у cl100k_base против ×1,44 у o200k_base
Сколько токенов в типовом запросе len(enc.encode(текст)) или POST /tokens/count Оценка «на глаз» ошибается вдвое на русском
Что входит в контекстное окно Документация модели, поле context length История и файлы занимают то же окно, что вопрос
Цена входа, выхода и кэша Страница тарифов провайдера У DeepSeek вход с кэшем и без различается в пятьдесят раз
Доля повторяющейся части промпта Собственный шаблон запроса Постоянная часть попадает в кэш и дешевеет

Частые вопросы про токены в ИИ

Токен — это слово? Нет. Токен — кусок текста, который может оказаться частью слова, целым словом или знаком препинания. По нашему замеру в словаре o200k_base русское слово в среднем занимает 1,71 токена, английское — 1,12 токена; в cl100k_base русское слово весит уже 3,17 токена.

Во сколько раз русский текст дороже английского? По собственному прогону на параллельном тексте ООН: ×1,44 в o200k_base, ×1,60 у DeepSeek-V3, ×1,81 у Qwen2.5-7B, ×2,67 в cl100k_base. Разброс по отдельным фрагментам внутри o200k_base — от ×1,14 до ×2,00.

Сколько русских слов в миллионе токенов? В словаре o200k_base около 586 тысяч; в cl100k_base — около 316 тысяч, по замеру на корпусе из 9447 символов русского текста.

Стоит ли писать промпты на английском ради экономии? Экономия меньше, чем принято считать: на бытовых запросах разница составила 148 токенов против 117, то есть ×1,26. Смена модели на словарь o200k_base даёт больший выигрыш без перевода.

Что происходит при превышении лимита токенов? Сервис отбрасывает самые старые сообщения диалога или отклоняет запрос целиком. В первом случае модель перестаёт видеть начало разговора, поэтому длинный диалог полезно перезапускать с кратким резюме.

Читайте также

3 материала