Содержание
- Что такое токен в ИИ и зачем модель считает куски текста
- Как работает токенизация: байты, BPE и номер токена в словаре
- Сколько символов и слов в одном токене: цифры замера
- Почему на русском токенов больше: замер на параллельном корпусе
- Почему коэффициент токенов разный у разных моделей
- Насколько устойчив коэффициент: разброс токенов внутри одного языка
- Какие бывают токены: вход, выход, кэш и рассуждение
- Контекстное окно и лимит токенов: что занимает место
- Как токены превращаются в деньги
- Чем посчитать токены в своём тексте
- Как сократить расход токенов без потери качества
- Токены в ИИ и AI-токены на бирже: чем они различаются
- Кому считать токены: чат по подписке и работа через API
- Чек-лист: что проверить перед оплатой токенов
- Частые вопросы про токены в ИИ
Токены в ИИ: что это, как считать и почему русский дороже
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Числа получены собственным прогоном токенизаторов 17 сентября 2026 года, скрипт замера и корпус названы в тексте. Обновлено: сентябрь 2026.
Токены в ИИ — это куски текста, на которые языковая модель режет запрос перед обработкой: часть слова, целое слово, знак препинания или пробел. У каждого куска есть номер в словаре токенизатора, и дальше модель работает с номерами. Токенами меряют длину запроса, объём контекстного окна и счёт за работу через API. Русский текст занимает больше токенов, чем английский с тем же смыслом, и размер разницы задаёт словарь конкретной модели.
Главное:
- Токен — кусок текста со своим номером в словаре; границы токена не совпадают ни со словом, ни с буквой.
- Собственный замер: 30 статей Всеобщей декларации прав человека весят 2189 токенов против 1518 английских в словаре o200k_base (GPT-4o, GPT-5) и 4063 против 1519 в cl100k_base (GPT-4, GPT-3.5-turbo).
- Коэффициент «русский дороже» принадлежит словарю: доля кириллицы выросла с 0,73% у cl100k_base до 7,03% у o200k_base, и раздувание упало с ×2,67 до ×1,44.
- Внутри одного словаря разброс по отдельным текстам идёт от ×1,14 до ×2,00, поэтому коэффициент, снятый с одной фразы, коэффициентом языка не является.
- Деньги списывают за вход и за выход: у DeepSeek правило записано как «The expense = number of tokens × price», и в бюджет на миллион токенов помещается 412 русских документов против 662 английских.
Что такое токен в ИИ и зачем модель считает куски текста
Токен в ИИ — минимальная единица текста, с которой работает языковая модель: приставка, корень, окончание, короткое слово, цифра, знак препинания или пробел со следующим словом. Библиотека tiktoken, официальный токенизатор OpenAI, объясняет смысл операции прямо: «Language models don’t see text like you and I, instead they see a sequence of numbers (known as tokens)» — модель видит последовательность чисел. Сам текст в вычисление не попадает: токенизатор заменяет кусок номером из словаря, модель предсказывает следующий номер, обратное преобразование собирает буквы. Поэтому длина запроса, объём памяти и стоимость измеряются в токенах. Как устроена сама модель, разобрано в материале что такое LLM.
Мини-вывод: токен — это способ, которым модель вообще получает текст.
Как работает токенизация: байты, BPE и номер токена в словаре
Токенизация текста идёт алгоритмом BPE — byte pair encoding, парное кодирование байтов. Словарь собирают заранее: алгоритм начинает с отдельных байтов и раз за разом склеивает самую частую пару в новую запись. README библиотеки tiktoken перечисляет свойства результата: «It’s reversible and lossless, so you can convert tokens back into the original text… It compresses the text: the token sequence is shorter than the bytes corresponding to the original text. On average, in practice, each token corresponds to about 4 bytes». Там же названа причина, по которой словарь перекошен в сторону английского: «It attempts to let the model see common subwords. For instance, «ing» is a common subword in English». Частое английское окончание получает собственную запись словаря, редкая русская словоформа — нет, и её приходится собирать из нескольких кусков.
Мини-вывод: словарь фиксируется до обучения модели и режет любой текст по своим правилам.
Сколько символов и слов в одном токене: цифры замера
В словаре o200k_base один токен покрыл 4,32 символа русского текста и 5,44 символа английского. Это собственный прогон на 9447 символах русской версии Всеобщей декларации прав человека против её английской версии. В словаре cl100k_base тот же русский текст даёт 2,33 символа на токен. В o200k_base русское слово режется в среднем на 1,71 токена, английское — на 1,12 токена; в cl100k_base русское слово занимает уже 3,17 токена. Отсюда пересчёт, который обычно спрашивают: в словаре o200k_base в 1000 токенов помещается 586 русских слов; в cl100k_base — 316. Правило Сбера для GigaChat — «В среднем один токен состоит из 3—4 символов» — попадает ровно между этими двумя замерами. Как сформулировать запрос по-русски компактно, показано в подборке промтов для ИИ на русском.
Мини-вывод: усреднённое «3–4 символа» верно только для своего словаря.
Почему на русском токенов больше: замер на параллельном корпусе
Русский текст дороже английского, потому что кириллица занимает в UTF-8 два байта против одного у латиницы, а словарь токенизатора собран в основном на английских данных. Размер эффекта редакция замерила сама. Корпус — статьи 1–30 Всеобщей декларации прав человека, официальный параллельный текст ООН с сайта un.org: одинаковый смысл и одинаковая структура. Русская версия весит 17 382 байта против 8262 английских, то есть ×2,10 по кодировке. После токенизации разрыв сжимается: 2189 токенов против 1518 в словаре o200k_base, ×1,44. Словарь отыгрывает бо́льшую часть разницы, созданной кодировкой, — и отыгрывает по-разному у разных моделей.
| Токенизатор | Русский, токенов | Английский, токенов | Раздувание | Символов на токен, русский |
|---|---|---|---|---|
| o200k_base — GPT-4o, GPT-4.1, GPT-5 | 2189 | 1518 | ×1,44 | 4,32 |
| DeepSeek-V3 | 2422 | 1510 | ×1,60 | 3,90 |
| Qwen2.5-7B | 2742 | 1519 | ×1,81 | 3,45 |
| cl100k_base — GPT-4, GPT-3.5-turbo, эмбеддинги | 4063 | 1519 | ×2,67 | 2,33 |
Мини-вывод: разница между русским и английским на одном тексте меняется почти вдвое со сменой словаря.
Почему коэффициент токенов разный у разных моделей
Коэффициент раздувания русского языка задаёт доля кириллицы в словаре токенизатора. Редакция посчитала её вторым проходом: сколько записей словаря содержат кириллическую букву. У cl100k_base таких записей 733 из 100 277, это 0,73%. У Qwen2.5-7B — 3996 из 151 665, или 2,63%. У DeepSeek-V3 — 5213 из 128 815, или 4,05%. У o200k_base — 14 070 из 200 019, или 7,03%. Доля растёт, раздувание падает, и порядок совпадает точно: 0,73% → ×2,67, 2,63% → ×1,81, 4,05% → ×1,60, 7,03% → ×1,44.
| Словарь | Кириллических записей | Доля словаря | Раздувание русского |
|---|---|---|---|
| cl100k_base | 733 из 100 277 | 0,73% | ×2,67 |
| Qwen2.5-7B | 3996 из 151 665 | 2,63% | ×1,81 |
| DeepSeek-V3 | 5213 из 128 815 | 4,05% | ×1,60 |
| o200k_base | 14 070 из 200 019 | 7,03% | ×1,44 |
Какая модель каким словарём режет текст, записано в самой библиотеке tiktoken, файл tiktoken/model.py: "gpt-5": "o200k_base", "gpt-4o": "o200k_base", "gpt-4": "cl100k_base", "gpt-3.5-turbo": "cl100k_base", "text-embedding-3-large": "cl100k_base". Переезд с GPT-4 на GPT-4o или GPT-5 сокращает счёт за один и тот же русский текст почти вдвое ещё до разговора о тарифах. Ответы русскоязычных моделей сравнивались отдельно — GigaChat против ChatGPT.
Мини-вывод: коэффициент русского языка — характеристика словаря; без имени словаря он бессмыслен.
Насколько устойчив коэффициент: разброс токенов внутри одного языка
Раздувание русского нестабильно даже внутри одного документа и словаря. По тем же тридцати статьям декларации в o200k_base разброс идёт от ×1,14 у статьи 22 до ×2,00 у статьи 10: юридические формулы с отглагольными существительными режутся хуже простых перечислений. На коротких бытовых запросах эффект ещё меньше: десять реплик вроде «Переведи этот договор на английский и выдели риски» дали 148 русских токенов против 117 английских, то есть ×1,26 в o200k_base; в cl100k_base те же реплики весят 240 токенов, ×2,05. Число, снятое с одной придуманной фразы, описывает эту фразу. В выдаче Яндекса по запросам кластера одновременно живут ×1,44 у thecode.media, «в 1,5–2 раза» у sber.pro, «в 2–3 раза дороже» у checkroi.ru и «1000 токенов ≈ 350–400 слов на русском» у блога GPTunneL на Хабре. Все четыре числа попадают в диапазон, который даёт замер, — просто для разных словарей.
Мини-вывод: спрашивая про коэффициент, уточняйте модель и тип текста.
Какие бывают токены: вход, выход, кэш и рассуждение
Токены делятся на четыре категории по месту в запросе и тарифицируются по-разному. Входные — промпт, системная инструкция, история переписки и приложенные файлы. Выходные — то, что модель сгенерировала в ответ, они почти всегда дороже входных. Кэшированные входные — повторяющаяся часть запроса, которую провайдер узнал и не считает заново. Токены рассуждения — внутренняя цепочка размышления у моделей с режимом thinking; DeepSeek объявляет его строкой «THINKING MODE Supports both non-thinking and thinking (default) modes»: пользователь цепочки не видит, её объём входит в счёт. Разница огромна: в тарифе deepseek-flash миллион входных токенов при попадании в кэш стоит $0,003 в непиковые часы, мимо кэша — $0,15, в пятьдесят раз дороже.
Мини-вывод: счёт складывается из четырёх потоков токенов, дороже всего обычно генерация.
Контекстное окно и лимит токенов: что занимает место
Контекстное окно — максимальное число токенов, которое модель удерживает за один проход. В окно входит всё сразу: системная инструкция, история диалога, приложенные документы, текущий вопрос и место под ответ. Когда сумма токенов превышает лимит, сервис либо отбрасывает самое старое сообщение, либо отказывается принимать запрос — и в первом случае модель буквально перестаёт помнить начало разговора. Размер окна называется в документации модели: у DeepSeek на странице цен заявлено CONTEXT LENGTH 1M и MAX OUTPUT MAXIMUM: 384K. Пересчёт в понятный объём даёт замер: в словаре o200k_base миллион токенов вмещает около 586 тысяч русских слов; в cl100k_base — около 316 тысяч.
Мини-вывод: длинная история диалога съедает то же окно, что и место под ответ.
Как токены превращаются в деньги
Стоимость запроса считает формула, которую провайдер печатает в документации: DeepSeek пишет «The expense = number of tokens × price» и уточняет, что тариф объявлен за миллион токенов и берётся с суммы входа и выхода — «We will bill based on the total number of input and output tokens by the model». Цена за миллион токенов у deepseek-v4-pro в непиковые часы составляет $0,66 за вход мимо кэша и $1,98 за выход. Наш замер переводит тариф в объём работы: бюджет в миллион токенов у токенизатора DeepSeek-V3 вмещает 412 копий русского текста декларации против 662 английских. При одинаковых деньгах русскоязычная задача получает примерно на треть меньше материала. Приёмы сокращения промпта разобраны в материале про сжатие Prompt с помощью LLMLingua.
Мини-вывод: цена линейна по токенам, поэтому экономия токенов равна экономии денег.
Чем посчитать токены в своём тексте
Токены считают до запроса и после него, и это два разных счёта: оценка даёт бюджет, факт — сумму в счёте провайдера.
До запроса. Первый способ — локальная библиотека. Для моделей OpenAI это tiktoken, три строки кода:
import tiktoken
enc = tiktoken.get_encoding("o200k_base")
print(len(enc.encode("Съешь ещё этих мягких французских булок, да выпей чаю.")))
Эта фраза даёт 18 токенов в o200k_base; в cl100k_base — 34 токена. Её английский перевод — 13 токенов в обоих словарях. Для открытых моделей ту же работу делает библиотека Tokenizers от Hugging Face, которая загружает словарь по имени репозитория, — так в этом замере считались DeepSeek-V3 и Qwen2.5-7B. Второй способ — метод подсчёта в API провайдера: документация GigaChat указывает запрос «POST /tokens/count».
После запроса. Фактический расход возвращает сам API, и провайдер считает настоящим именно его. DeepSeek в разделе «Token & Token Usage» пишет: «The actual number of tokens processed each time is based on the model’s return, which you can view from the usage results», и отдельно предупреждает, что при расхождении с оценкой опираться нужно на «the usage returned by the API as the source of truth». Накопленный расход лежит в кабинете: документация GigaChat называет два раздела личного кабинета Studio — Биллинг и Статистика, где показаны «количество затраченных сессий и токенов» и стоимость в рублях, с выгрузкой в xlsx.
Мини-вывод: до запуска считают бюджет, после вызова поле usage показывает, по чему выставлен счёт.
Как сократить расход токенов без потери качества
Расход токенов сокращают четыре приёма, и эффект каждого виден по числам замера. Первый: выбрать модель с современным словарём — переход с cl100k_base на o200k_base уменьшил вес того же русского текста с 4063 токенов до 2189, почти вдвое, без правок в тексте. Второй: убрать из промпта то, что модель уже получила: повторно приложенный документ стоит столько же, сколько в первый раз. Третий: держать постоянную часть запроса неизменной, чтобы провайдер засчитал кэш; в тарифе deepseek-flash попадание в кэш меняет цену входа с $0,15 на $0,003 за миллион токенов. Четвёртый: писать компактно — на десяти бытовых запросах замер дал 148 токенов против 117 у английских аналогов, разница приходится на многословные обороты.
Мини-вывод: самый крупный выигрыш даёт смена словаря; правка формулировок идёт вторым номером.
Токены в ИИ и AI-токены на бирже: чем они различаются
Токены в ИИ и AI-токены на криптобирже — разные объекты с одинаковым названием. Токен в языковой модели — кусок текста с номером в словаре, он живёт внутри обработки запроса и продаётся как объём вычислений. AI-токен на бирже — криптовалютный актив проекта, связанного с искусственным интеллектом: торгуется, хранится в кошельке и к обработке текста отношения не имеет. Путаница закреплена выдачей: по запросу «что такое токены в ии» на девятой позиции Яндекса стоит руководство Gate Learn с первым абзацем «Слияние искусственного интеллекта и блокчейна привело к появлению уникальных цифровых активов, известных как криптотокены AI» и списком Injective, The Graph, Render Token.
Мини-вывод: если рядом стоят «кошелёк», «биржа» или «листинг», речь о криптоактиве.
Кому считать токены: чат по подписке и работа через API
Считать токены нужно всем, кто упирается в лимит или платит по счётчику, но глубина счёта разная. Пользователю чата по подписке точное число не нужно: тариф оплачен, и достаточно понимать, что длинный диалог и файлы забивают контекстное окно, после чего модель теряет начало разговора. Разработчику на API нужен точный счёт до отправки: тариф берётся с каждого токена входа и выхода, и ошибка в оценке объёма становится ошибкой в бюджете. Отдельный случай — агенты, которые ходят в модель без человека: один неудачный цикл сжигает дневной лимит, поэтому счётчик ставят на каждый вызов.
Мини-вывод: в чате достаточно чувства меры, на API нужен счётчик.
Чек-лист: что проверить перед оплатой токенов
| Что проверить | Где посмотреть | Почему это важно |
|---|---|---|
| Какой словарь у вашей модели | tiktoken/model.py или карточка модели на Hugging Face |
На русском тексте ×2,67 у cl100k_base против ×1,44 у o200k_base |
| Сколько токенов в типовом запросе | len(enc.encode(текст)) или POST /tokens/count |
Оценка «на глаз» ошибается вдвое на русском |
| Что входит в контекстное окно | Документация модели, поле context length | История и файлы занимают то же окно, что вопрос |
| Цена входа, выхода и кэша | Страница тарифов провайдера | У DeepSeek вход с кэшем и без различается в пятьдесят раз |
| Доля повторяющейся части промпта | Собственный шаблон запроса | Постоянная часть попадает в кэш и дешевеет |
Частые вопросы про токены в ИИ
Токен — это слово? Нет. Токен — кусок текста, который может оказаться частью слова, целым словом или знаком препинания. По нашему замеру в словаре o200k_base русское слово в среднем занимает 1,71 токена, английское — 1,12 токена; в cl100k_base русское слово весит уже 3,17 токена.
Во сколько раз русский текст дороже английского? По собственному прогону на параллельном тексте ООН: ×1,44 в o200k_base, ×1,60 у DeepSeek-V3, ×1,81 у Qwen2.5-7B, ×2,67 в cl100k_base. Разброс по отдельным фрагментам внутри o200k_base — от ×1,14 до ×2,00.
Сколько русских слов в миллионе токенов? В словаре o200k_base около 586 тысяч; в cl100k_base — около 316 тысяч, по замеру на корпусе из 9447 символов русского текста.
Стоит ли писать промпты на английском ради экономии? Экономия меньше, чем принято считать: на бытовых запросах разница составила 148 токенов против 117, то есть ×1,26. Смена модели на словарь o200k_base даёт больший выигрыш без перевода.
Что происходит при превышении лимита токенов? Сервис отбрасывает самые старые сообщения диалога или отклоняет запрос целиком. В первом случае модель перестаёт видеть начало разговора, поэтому длинный диалог полезно перезапускать с кратким резюме.
