Содержание
- Что такое контекстное окно простыми словами
- Что занимает место в контекстном окне модели
- Сколько текста помещается в контекстное окно: замер на русском
- Контекстное окно ведущих моделей на 17 сентября 2026 года
- У какой нейросети самое большое контекстное окно
- Контекстное окно российских моделей: GigaChat и YandexGPT
- Что происходит при переполнении контекстного окна
- Почему заявленное контекстное окно больше рабочего
- Потолок ответа: второе число рядом с контекстным окном
- Контекстное окно и память нейросети: в чём разница
- Как посчитать, влезет ли документ в контекстное окно
- Что делать, когда контекстное окно кончается
- Почему контекстное окно нельзя сделать бесконечным
- Контекстное окно и контекстное меню: разные вещи
- Чек-лист: как не упереться в контекстное окно
- Частые вопросы про контекстное окно
Что такое контекстное окно: сколько влезает и что потом
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Размеры окон сняты с документации поставщиков 17 сентября 2026 года, адрес строки указан рядом с числом. Обновлено: сентябрь 2026.
Контекстное окно — это предел текста, который языковая модель обрабатывает за один вызов; меряется он в токенах, и всё, что в такое окно не поместилось, модель не видит вовсе. Внутрь одного лимита складываются системная инструкция, история диалога, приложенные файлы, ответы инструментов и сам будущий ответ. У флагманов сентября 2026 года окно держится около миллиона токенов, у GigaChat — 128 000.
Главное:
- Окно занимает не только ваш вопрос: системный промпт, вся переписка, приложенные документы и генерируемый ответ делят один лимит.
- Замер редакции на 34 русских страницах топ-10 выдачи: 3,91 символа на токен, то есть окно 1 048 576 токенов вмещает 2276 страниц русского текста по 1800 знаков.
- У Claude Opus 5 и Sonnet 5 окно 1 млн токенов, у Gemini 3.1 Pro — 1 048 576, у GPT-6 Astra — 1,05 млн, у Grok 4.6 — 500K, у GigaChat 2 Max — 128 000.
- При переполнении API отвечает ошибкой, чат молча выбрасывает старые реплики, локальный рантайм обрезает начало промпта без предупреждения.
- Паспортное число окна и глубина надёжной работы — величины разные: документация Google сама признаёт падение точности, когда искомых фрагментов несколько.
Что такое контекстное окно простыми словами
Контекстное окно языковой модели — это максимальное число токенов, которое модель принимает и удерживает за один вызов. Токен — кусок текста, который модель считает единицей: по замеру редакции токен русского текста весит в среднем 3,91 знака, а слово «контекстное» токенизатор o200k_base дробит на три части — «конт», «екст», «ное».
Сравнение: окно — это стол, на который перед ответом раскладывают бумаги. Легли инструкция, переписка и два документа — модель видит их разом и связывает между собой. Третий документ на стол уже не встал, и для модели его нет: она отвечает по видимому, не догадываясь о спрятанном.
Мини-вывод: контекстное окно языковой модели — это площадь стола в токенах; объём знаний модели измеряется отдельно.
Что занимает место в контекстном окне модели
В контекстное окно попадает вся заявка целиком — реплика пользователя там лишь одна из частей. Документация Anthropic перечисляет состав дословно: «Everything in the request counts toward the context window: the system prompt, every message in messages (including tool results, images, and documents), and your tool definitions» — считается системный промпт, каждое сообщение переписки вместе с результатами инструментов, картинками и документами, а также описания самих инструментов. Ответ, который модель сейчас пишет, расходует тот же лимит.
Следствие удивляет чаще прочего: инструкция на 5000 токенов в окне 128 000 забирает место у документа, который вы туда клали, а у агентов описания инструментов съедают тысячи токенов до первой реплики человека. Как устроена сама модель, разобрано в материале про большие языковые модели, а превращение текста в числа — в разборе эмбеддингов.
Мини-вывод: контекстное окно — бюджет на один вызов, и четыре статьи расхода в нём конкурируют.
Сколько текста помещается в контекстное окно: замер на русском
«Сколько влезет» зависит от языка: ходовое правило «один токен ≈ 0,75 английского слова» для русского завышает объём, кириллица дробится мельче.
Редакция посчитала курс на живом материале. Корпус — проза 34 русскоязычных страниц из выдачи Яндекса по кластеру «контекстное окно» 17 сентября 2026 года, объём 420 912 знаков, токенизатор o200k_base (tiktoken 0.12.0). Итог: 107 751 токен, то есть 3,91 символа на токен. Страница в 1800 знаков стоит 461 токен.
| Контекстное окно | Страниц русского текста по 1800 знаков |
|---|---|
| 128 000 токенов | 278 |
| 200K токенов | 434 |
| 1 048 576 токенов | 2276 |
Оговорка: o200k_base — кодировка OpenAI, у Claude, Gemini и GigaChat словари свои, и на том же тексте счёт разойдётся примерно в полтора раза.
Мини-вывод: 2276 страниц русского текста в окне на миллион токенов — это верхняя граница объёма; качество работы на такой длине измеряется отдельно.
Контекстное окно ведущих моделей на 17 сентября 2026 года
Размеры окон сняты со страниц поставщиков 17 сентября 2026 года; рядом с каждым числом стоит адрес, по которому оно проверяется.
| Модель | Контекстное окно | Потолок ответа | Где написано |
|---|---|---|---|
| GPT-6 Astra, GPT-5.6 Sol | 1,05 млн токенов | 128K | platform.openai.com/docs/models |
| Claude Opus 5, Sonnet 5, Fable 5.1 | 1 млн токенов | 128K | docs.claude.com, раздел models/overview |
| Claude Haiku 4.5 | 200K токенов | 64K | docs.claude.com, там же |
| Gemini 3.1 Pro | 1 048 576 токенов входа | 65 536 | ai.google.dev, карточка gemini-3.1-pro-preview, страница обновлена 18.08.2026 |
| Gemini 3.8 Flash | 1 048 576 токенов входа | 65 536 | ai.google.dev, карточка gemini-3.8-flash, страница обновлена 02.09.2026 |
| DeepSeek V4-Pro, DeepSeek Flash | 1 млн токенов | 384K | api-docs.deepseek.com, раздел pricing |
| Grok 4.6 | 500K токенов | — | docs.x.ai, раздел models |
| GigaChat 2 Max, Pro, Lite | 128 000 токенов | — | developers.sber.ru, карточки моделей GigaChat |
Две карточки Gemini датированы разными днями — 18 августа и 2 сентября. Это и есть причина писать дату рядом с числом: даже один поставщик правит страницы вразнобой, и таблица без даты стареет молча.
Мини-вывод: в сентябре 2026 года миллион токенов стал нормой флагмана, 128 000 — нормой рабочей модели.
У какой нейросети самое большое контекстное окно
Самое большое контекстное окно среди публичных моделей на 17 сентября 2026 года — 1,05 млн токенов у GPT-6 Astra и линейки GPT-5.6 по документации OpenAI. Вплотную идут Claude Opus 5, Sonnet 5, Fable 5.1 и DeepSeek V4-Pro с 1 млн токенов; у Gemini 3.1 Pro предел входа записан точным числом 1 048 576.
Разница между 1 000 000 и 1 048 576 неразличима на практике: 2170 страниц русского текста против 2276. Зазор между 1 млн и 128 000 другой: 2276 страниц против 278.
Мини-вывод: гонка за размером упёрлась в миллион, дальше решает качество работы на длинном тексте.
Контекстное окно российских моделей: GigaChat и YandexGPT
У российских моделей окно меньше. Документация Сбера называет для GigaChat 2 Max, GigaChat 2 Pro и GigaChat 2 Lite одно и то же число: «Размер контекстного окна 128 000 токенов». В страницах это примерно 278 страниц русского текста, но пересчёт сделан по кодировке o200k_base, а словарь GigaChat другой — точную длину даёт только счётчик Сбера.
Отдельная находка: карточка GigaChat 3 Ultra, обновлённая 17 июля 2026 года, размер окна не называет вовсе — этой строки на странице нет. Документацию YandexGPT проверить не удалось: обращение к справке Яндекса 17 сентября 2026 года упёрлось в капчу, и число без источника мы не приводим. Что умеет сама модель, разобрано в материале про YandexGPT 5 Pro.
Мини-вывод: по размеру контекстного окна российская модель отстаёт от флагманов примерно в восемь раз.
Что происходит при переполнении контекстного окна
При переполнении возможны три исхода, и опаснее всех тихий.
Ошибка от API. Документация Anthropic описывает случай буквально: если один вход уже превышает окно, API возвращает 400 invalid_request_error с текстом «prompt is too long». Если вход помещается, а генерация упирается в потолок по ходу, ответ обрывается со стоп-причиной model_context_window_exceeded.
Выбрасывание старых реплик в чате. Та же страница отмечает: чат-интерфейсы вроде claude.ai управляют окном по принципу «first in, first out» — самые ранние сообщения уходят первыми. Предупреждения нет, и со стороны это выглядит забывчивостью.
Тихое усечение в локальном рантайме. Здесь свидетельство чужое: прогон на Ollama 0.32.13 с моделью qwen2.5:7b опубликовал учебный центр «Школа Больших Данных», и рантайм там, по описанию автора, «молча выбросил лишнее» из начала промпта: ни ошибки, ни предупреждения. Свой стенд редакция не гоняла.
Мини-вывод: ошибка API — благо, она видна; забывчивость чата и обрезка рантайма маскируются под нормальный ответ.
Почему заявленное контекстное окно больше рабочего
Паспортное число отвечает ровно на один вопрос: сколько токенов сервер примет, не обрезав. Насколько глубоко модель прочитает принятое, там не написано ничего.
Стандартная проверка — «иголка в стоге сена»: в длинный бесполезный текст прячут один факт и спрашивают про него, двигая позицию. На одной иголке флагманы дают около 99 процентов. Документация Google сразу оговаривает границу: при нескольких искомых фрагментах «the model does not perform with the same accuracy» — точность падает, и насколько, зависит от содержимого.
Добавляются два эффекта: провал середины, когда факт из центра учитывается хуже краёв, и накопление мусора в долгом диалоге — отменённые решения продолжают влиять на ответ.
Мини-вывод: рабочую глубину окна выясняют пробой на собственных данных, паспортное число нужно для расчёта лимитов и цены.
Потолок ответа: второе число рядом с контекстным окном
Рядом с окном стоит второй лимит — максимальная длина одного ответа. Он меньше окна и ограничивает генерацию отдельно: у GPT-6 Astra и Claude Opus 5 это 128K токенов, у Gemini 3.1 Pro — 65 536, у Claude Haiku 4.5 — 64K, у DeepSeek — 384K.
Смысл простой: модель с окном на миллион токенов прочитает книгу целиком, но переписать её одним ответом не сможет. Задача «переведи весь документ за раз» упирается в этот потолок и решается разбиением.
Мини-вывод: размер контекстного окна отвечает за чтение, потолок ответа — за письмо, и путать их дорого.
Контекстное окно и память нейросети: в чём разница
Контекстное окно — это не память. Между двумя обращениями модель о вас ничего не помнит: приложение всякий раз собирает переписку в один текст и шлёт заново, а модель читает присланное с чистого листа. Память в чате — свойство обёртки вокруг модели, и за неё платят токенами в каждом запросе.
Поэтому «память» ChatGPT и проекты в Claude устроены иначе: это внешнее хранилище фактов, из которого приложение подмешивает нужное в очередной запрос. Токены окна оно тоже тратит, просто выбирает, что положить. Долговременная память агента живёт в базе, и в окно попадает выборка под текущий шаг.
Мини-вывод: окно — это стол, на который каждый раз заново раскладывают бумаги, а память — шкаф, из которого их достают.
Как посчитать, влезет ли документ в контекстное окно
Считать нужно до отправки, четырьмя шагами.
- Возьмите объём документа в знаках — редактор показывает его в статистике.
- Разделите на 3,91 для русского текста: получится оценка в токенах. Для английского делите на 5,07 — контрольная группа из трёх англоязычных страниц того же съёма дала именно такой курс, то есть русский текст расходует окно в 1,3 раза быстрее.
- Прибавьте инструкцию, историю диалога и место под ответ — обычно ещё 2000–10 000 токенов.
- Сравните сумму с окном модели из таблицы и оставьте запас в двадцать процентов.
Точнее считает счётчик поставщика: у OpenAI и Anthropic есть методы подсчёта до отправки. Пример: договор на 40 000 знаков — около 10 200 токенов, он входит даже в окно GigaChat на 128 000.
Мини-вывод: контекстное окно считается заранее арифметикой; узнавать его границу по факту отказа дороже.
Что делать, когда контекстное окно кончается
Четыре рабочих приёма, и они совместимы.
Новый диалог с выжимкой. Попросите модель собрать резюме договорённостей и перенесите его в свежий чат: вместо истории на десятки тысяч токенов останется нужное.
Важное — по краям. Инструкции и ключевые факты ставят в начало или конец запроса: середину длинного текста модели учитывают хуже.
Поиск вместо загрузки. Когда документов много, их индексируют и кладут в окно только найденные фрагменты. Как устроен конвейер — в материале про генерацию с извлечением.
Чистка системного промпта. Длинная инструкция оплачивается каждым запросом, и правила, которые ни на что не влияют, дешевле удалить. Как писать компактно — в разборе промптов для нейросетей.
Мини-вывод: переполнение лечится управлением содержимым, увеличение окна лишь отодвигает границу.
Почему контекстное окно нельзя сделать бесконечным
Ограничение растёт из устройства внимания. В трансформере каждый токен сопоставляется с каждым, поэтому вычисления растут квадратично: удвоение входа требует вчетверо больше работы. Второе ограничение — кэш ключей и значений: он растёт линейно с длиной и отъедает видеопамять поверх весов модели.
Платится это дважды. Временем: документация Google прямо отмечает, что длинный запрос увеличивает задержку до первого токена. Деньгами: провайдер считает вход заново в каждом обращении, поэтому раздутая на пару тысяч токенов инструкция списывает разницу с баланса столько раз, сколько в диалоге реплик.
Мини-вывод: длинное контекстное окно — это платная опция, и пустой мегабайт в запросе стоит столько же, сколько полезный.
Контекстное окно и контекстное меню: разные вещи
Контекстное меню и контекстное окно — термины из разных областей, и выдача их смешивает. По запросу «что такое контекстное окно» Яндекс 17 сентября 2026 года поднял в топ-10 две страницы про контекстное меню: skyeng.ru на третьей позиции и статью Википедии Context menu на шестой. Контекстное меню — выпадающий список команд по правой кнопке мыши в Windows и macOS: копировать, вставить, переименовать. Контекстное окно — предел данных на один вызов языковой модели, измеряемый в токенах. Общего у них только прилагательное. Искали список по правой кнопке — вам нужна статья про меню системы; искали предел нейросети — вы на месте.
Мини-вывод: два похожих термина из разных областей, которые выдача смешивает.
Чек-лист: как не упереться в контекстное окно
| Шаг | Действие | Ориентир |
|---|---|---|
| 1 | Посчитать объём в токенах | знаки ÷ 3,91 для русского |
| 2 | Проверить окно модели | от 128 000 у GigaChat до 1,05 млн у GPT-6 Astra |
| 3 | Оставить место под ответ | потолок ответа 64K–384K, но резерв нужен всегда |
| 4 | Поставить важное по краям | середина длинного текста учитывается хуже |
| 5 | Резать историю выжимкой | новый диалог с резюме вместо бесконечного чата |
| 6 | Много документов — искать перед загрузкой | поиск подкладывает только нужные фрагменты |
Числа в этой теме стареют быстро: размеры окон называют 5 страниц топ-10, и самые цитируемые датированы 2024 годом. Проверяйте дату рядом с числом — дата съёма стоит в шапке статьи.
Работе с длинными документами при конечном бюджете токенов учат на курсах Зерокодера по нейросетям.
Частые вопросы про контекстное окно
Что такое контекстное окно простыми словами?
Предел текста, который нейросеть удерживает во время одного ответа: инструкция, переписка, файлы и сам ответ. Меряется в токенах — 1800 знаков русского текста стоят примерно 461 токен по замеру редакции.
Что описывает контекстное окно модели?
Максимальное число токенов на один вызов. Качество работы это число не гарантирует: модель принимает миллион токенов и при этом хуже находит факты в середине длинного текста.
У какой нейросети самое большое контекстное окно?
На 17 сентября 2026 года — 1,05 млн токенов у GPT-6 Astra по документации OpenAI. Рядом Claude Opus 5 и DeepSeek V4-Pro с 1 млн.
Какое контекстное окно у GigaChat?
128 000 токенов у GigaChat 2 Max, Pro и Lite по документации Сбера. В страницах это около 278 страниц русского текста при счёте по кодировке o200k_base; у GigaChat словарь свой, поэтому оценка грубая. Карточка GigaChat 3 Ultra размер окна не называет.
Что происходит, когда контекстное окно переполнено?
API возвращает ошибку 400 с текстом «prompt is too long» либо обрывает генерацию со стоп-причиной model_context_window_exceeded. Чат-интерфейс выбрасывает самые старые сообщения по принципу «first in, first out». Локальный рантайм обрезает начало промпта молча.
Для чего нужно контекстное окно в языковых моделях?
Оно удерживает вычисления в разумных пределах: внимание растёт квадратично от длины входа, а кэш ключей и значений — линейно.
