Обновлено 19 августа 2026 года.

Создать нейросеть на базе российских моделей в 2026 году — значит взять готовые открытые веса и дообучить их под свою задачу. Сбер выложил GigaChat 3.1 Lightning под лицензией MIT, Яндекс — YandexGPT 5 Lite 8B, Т-Технологии — T-Pro 2.1 под Apache 2.0. Всё это лежит на Hugging Face и запускается на одной видеокарте.

Что разберём по шагам:

  • какие российские модели открыты на самом деле и на каких лицензионных условиях;
  • сколько весит файл модели и какая видеопамять под него нужна;
  • команды запуска, проверенные на актуальных версиях библиотек;
  • путь без своей видеокарты — API GigaChat и его бесплатный лимит токенов;
  • как дообучить модель на своих данных методом LoRA.

Как создать нейросеть на базе открытых российских моделей

Что понадобится, чтобы создать нейросеть

Собственная нейросеть сегодня собирается не из слоёв на PyTorch, а из четырёх готовых деталей.

  1. Открытые веса. Файл модели с Hugging Face — обычно в формате .safetensors для видеокарты или .gguf для запуска на процессоре и слабой карте.
  2. Движок инференса. llama.cpp или Ollama для домашней машины, vLLM либо SGLang для сервера.
  3. Свои данные. Инструкции, переписки, документы — то, чего нет в базовой модели и ради чего вы её дообучаете.
  4. Место запуска. Своя видеокарта, арендованный GPU в облаке или чужой API, если железа нет вовсе.

Знание Python нужно на уровне «скопировать и поправить путь к файлу». Обучать трансформер с нуля не потребуется: полный цикл предобучения GigaChat 3 шёл на корпусе из десяти языков и примерно 5,5 триллиона синтетических токенов — повторить это в одиночку нельзя и не нужно.

Если задача сводится к разбору документов или переписок, посмотрите, как это делают на практике: инструмент анализа тендеров за минуту на комплект и ИИ-разбор переписок, снизивший потери задач на 30%.

Вывод раздела: роль разработчика здесь — сборщик. Веса, движок и метод дообучения уже написаны за вас, ваш вклад — данные и постановка задачи.

ОНЛАЙН-ПРАКТИКУМ
ЗАПУСК нейросети DEEPSEEK R1 ЛОКАЛЬНО НА СВОЕМ КОМПЬЮТЕРЕ
ЧТО БУДЕТ НА ОБУЧЕНИИ?
  • ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
  • Где и как применять? Потестируем модель после установки на разных задачах
  • Как дообучить модель под себя?

Где взять российские модели с открытыми весами

Как выбрать российскую модель под своё железо и лицензию
Как выбрать российскую модель под своё железо и лицензию

Главный хаб — Hugging Face. Российские команды публикуют веса там же, где и все остальные: Сбер под аккаунтом ai-sage, Яндекс под yandex, Т-Технологии под t-tech. Ниже — что фактически доступно к скачиванию на август 2026 года.

Модель Размер Контекст Лицензия Опубликована
ai-sage/GigaChat3.1-10B-A1.8B 10B, активных 1,8B (MoE) 262 144 токена MIT 21.03.2026
ai-sage/GigaChat3.5-432B-A28B 432B, активных 28B (MoE) 262 144 токена MIT 05.07.2026
yandex/YandexGPT-5-Lite-8B-instruct 8B 32 768 токенов собственная лицензия Яндекса 28.03.2025
t-tech/T-pro-it-2.1 33B (на базе Qwen3-32B) 32 768, до 131 072 с YaRN Apache 2.0 16.12.2025

Размеры файлов, лицензия и дата последнего обновления видны прямо в карточке модели GigaChat 3.1 Lightning — сверяйтесь по первоисточнику, он обновляется в тот же день, что и веса.

Первоисточники иногда расходятся между собой, и это стоит держать в голове. У T-Pro 2.1 README карточки заявляет 32 768 токенов нативно с расширением до 131 072 через YaRN, а config.json того же репозитория содержит max_position_embeddings: 40960. В таблице оставлено число из README: его назвал автор модели, и оно строже. Контексты GigaChat 3.1 и 3.5 в таблице — из config.json их репозиториев, в обоих max_position_embeddings: 262144.

Различие лицензий здесь важнее размера. MIT у GigaChat 3 и Apache 2.0 у T-Pro разрешают коммерческое использование без порогов. Лицензия YandexGPT 5 Lite 8B тоже разрешает коммерцию, но с потолком: при превышении 10 миллионов выходных токенов в месяц нужно в течение 30 дней связаться с Яндексом, иначе лицензия аннулируется. Она же требует сохранять указание правообладателя — «Copyright (c) 2025, ООО „ЯНДЕКС“».

T-Pro 2.1 собран на базе Qwen3-32B с более плотной токенизацией русского — если разбираетесь в родословной, полезен наш обзор серии моделей Qwen 3.5.

Вывод раздела: прежде чем скачивать веса, откройте файл лицензии в репозитории. У двух моделей из четырёх условия свободные, у одной — с лимитом по объёму генерации.

Где запускать модель: своя карта или облако

Требования к железу удобно считать не по числу параметров, а по весу файла квантизованной версии. Он опубликован прямо в репозитории и не оставляет места догадкам.

Файл Квантизация Вес
YandexGPT-5-Lite-8B-instruct-Q4_K_M.gguf 4 бита 4,92 ГБ
GigaChat3.1-10B-A1.8B-q4_K_M.gguf 4 бита 6,47 ГБ
GigaChat3.1-10B-A1.8B-q6_K.gguf 6 бит 8,78 ГБ
GigaChat3.1-10B-A1.8B-q8_0.gguf 8 бит 11,35 ГБ
GigaChat3.1-10B-A1.8B-bf16.gguf без квантизации 21,36 ГБ

Правило простое: к весу файла добавьте запас под KV-кэш и получите минимум видеопамяти. YandexGPT 5 Lite в четырёхбитной версии умещается на карте с 8 ГБ VRAM, GigaChat 3.1 Lightning в той же квантизации — на 12 ГБ, а вот bf16-версия того же GigaChat уже требует 24 ГБ и выше.

Отдельная особенность GigaChat 3.1 Lightning — архитектура Mixture-of-Experts: из 10 миллиардов параметров на каждый токен работают только 1,8 миллиарда. Память он занимает по полному размеру, а вычисляет по активной части, поэтому на домашней карте отвечает заметно быстрее плотных моделей сопоставимого веса.

Облако нужно в двух случаях: под крупные модели вроде GigaChat 3.5 на 432B, которые Сбер прямо позиционирует для кластерных и on-prem сценариев, и под дообучение, где кроме весов в память ложатся градиенты и состояния оптимизатора. GPU-инстансы с почасовой оплатой дают VK Cloud, Yandex Cloud, Selectel и Timeweb Cloud.

Вывод раздела: для первого запуска хватает игровой карты с 12 ГБ видеопамяти. Облако берут под масштаб и под обучение — чтобы просто поговорить с моделью, оно не нужно.

Пример: как запустить модель за один вечер

Самый короткий путь — Ollama:

ollama run hf.co/ai-sage/GigaChat3.1-10B-A1.8B-GGUF:Q4_K_M ollama run yandex/YandexGPT-5-Lite-8B-instruct-GGUF

Вторая строка стоит дословно в карточке yandex/YandexGPT-5-Lite-8B-instruct-GGUF. Первая собрана по общей схеме Ollama-интеграции Hugging Face Hub: любой GGUF-репозиторий запускается шаблоном ollama run hf.co/<организация>/<репозиторий>:<квантование>. Сама карточка GigaChat 3.1 Lightning описывает только llama.cpp, про Ollama в ней ни слова.

Кто хочет держать модель за собственным HTTP-сервером, собирает llama.cpp. В карточке GigaChat 3.1 Lightning указаны минимальные требования: llama.cpp сборки не ниже 8495 и CMake не ниже 3.28.3.

git clone https://github.com/ggml-org/llama.cpp.git cd llama.cpp cmake -B build -DGGML_CUDA=ON cmake --build build --config Release --target llama-server -j 8 ./build/bin/llama-server -m GigaChat3.1-10B-A1.8B-q4_K_M.gguf \ -ctk q8_0 -ctv q8_0 -fa on --n-gpu-layers 999 \ --ctx-size 32768 --port 8080 --host 0.0.0.0 --jinja

На сервере с полноценной видеокартой обе модели поднимаются одной строкой через vLLM (актуальная версия на PyPI — 0.27.1):

vllm serve ai-sage/GigaChat3.1-10B-A1.8B --dtype auto

Через Python-код запуск выглядит так. Важная деталь: в transformers 5.0.0, вышедшей 26 января 2026 года, аргумент torch_dtype заменён на dtype, а поддержка TensorFlow и Flax удалена. Карточки моделей местами всё ещё показывают старое имя аргумента — на версии 5.15.0 оно вызывает предупреждение об устаревании.

from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "yandex/YandexGPT-5-Lite-8B-instruct" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, dtype="auto", device_map="auto") messages = [{"role": "user", "content": "Расскажи интересный факт"}] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, return_tensors="pt" ).to(model.device) outputs = model.generate(inputs, max_new_tokens=256) print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Вывод раздела: первый запуск занимает время скачивания файла. Основные грабли — устаревшие аргументы из старых руководств и попытка загрузить bf16-версию на карту, куда она не помещается.

Путь без своей видеокарты: API GigaChat

Путь к ключу GigaChat API для физлица
Путь к ключу GigaChat API для физлица

Если железа нет, российскую модель можно взять по API. Сбер раздаёт физлицам заметный бесплатный объём: во freemium-режиме выдаётся 365 000 000 токенов на генерацию текста, лимит обновляется раз в 12 месяцев. Разложено по семействам так: 250 млн на Lite, 40 млн на Pro, 25 млн на Max и 50 млн на GigaChat-3-Ultra. Ограничение — генерация идёт в один поток. Условия и цены пакетов сверх лимита опубликованы в тарифах GigaChat API для физлиц.

Порядок подключения по документации: зарегистрироваться в личном кабинете Studio по Сбер ID, создать проект GigaChat API, открыть в левой панели раздел Настройки API, нажать Получить ключ и сохранить три значения — Authorization Key, Client ID и Client Secret. Токен доступа выпускается запросом POST на https://ngw.devices.sberbank.ru:9443/api/v2/oauth со scope GIGACHAT_API_PERS и живёт 30 минут.

Два момента, о которых старые инструкции молчат.

Первый — адрес. С 17 июля 2026 года для подключения к GigaChat API используется https://api.giga.chat, прежний gigachat.devices.sberbank.ru остаётся переходным.

Второй — сертификат. Мы обратились к api.giga.chat обычным curl и получили ошибку проверки цепочки: «unable to get local issuer certificate». В сертификате домена издателем значится «The Ministry of Digital Development and Communications, Russian Trusted Sub CA». С отключённой проверкой тот же запрос отдал ожидаемый 401 — значит, дело не в сети, а именно в доверии к корневому сертификату. Документация подтверждает: для обмена сообщениями с GigaChat API нужен корневой сертификат Минцифры, скачивается он с портала Госуслуг, а в Python-SDK подкладывается параметром ca_bundle_file.

pip install gigachat # текущая версия на PyPI — 0.2.3 from gigachat import GigaChat giga = GigaChat( base_url="https://api.giga.chat/v1", credentials="ваш_authorization_key", ca_bundle_file="russian_trusted_root_ca_pem.crt", ) print(giga.chat("Привет! Как дела?"))

Вывод раздела: бесплатного лимита хватает на прототип и на пилот внутри команды. Первая же ошибка, на которую натыкаются почти все, — не отсутствие ключа, а неустановленный корневой сертификат.

О том, в каких сферах российские нейросети приносят пользу уже сегодня — расскажем на бесплатном вебинаре.

Как обучить свою нейросеть под свою задачу

Полное дообучение восьмимиллиардной модели требует памяти в разы больше, чем сами веса. Поэтому применяют LoRA — метод, который замораживает исходную матрицу весов и обучает вместо неё две маленькие низкоранговые матрицы. В документации библиотеки PEFT приводится оценка из исходной статьи: LoRA сокращает число обучаемых параметров в 10 000 раз, а требования к видеопамяти — втрое.

Рабочий каркас конфигурации выглядит так (актуальная версия peft на PyPI — 0.20.0):

from peft import LoraConfig, get_peft_model config = LoraConfig( r=16, lora_alpha=16, target_modules="all-linear", lora_dropout=0.1, bias="none", ) model = get_peft_model(model, config) model.print_trainable_parameters()

Значение target_modules=»all-linear» в документации PEFT названо QLoRA-режимом: адаптеры вешаются на все линейные слои, и качество приближается к полному дообучению. Ранг r — главный регулятор: чем он выше, тем больше ёмкость адаптера и расход памяти.

Данные важнее гиперпараметров. Открытые русскоязычные наборы, которые можно взять за основу или образец формата: t-tech/T-Wix под лицензией ODC-BY, IlyaGusev/saiga_scored, Vikhrmodels/Grounded-RAG-RU-v2 под Apache 2.0. Но настоящую пользу даёт собственный набор — ваши тикеты, регламенты, карточки товаров, разметка ответов оператора.

Есть и путь без обучения вовсе: подключить модель к своей базе документов через поиск по ним (RAG). Для большинства задач вроде «отвечать по нашей документации» он даёт результат быстрее, чем дообучение, и не требует переобучения при каждом изменении документов.

Своя модель на своём железе — ещё и вопрос контроля над данными. Так безопаснее: запросы не уходят в чужое облако, доступ к модели не зависит от санкций и решений внешнего провайдера, поведение настраивается системным промптом и дообучением. Когда речь о юридических, медицинских или персональных данных, этот довод обычно перевешивает удобство готового API.

Вывод раздела: начинайте с промптов, переходите к RAG, и только если качества всё ещё не хватает — беритесь за LoRA. Обратный порядок стоит недель работы впустую.

Что устарело в руководствах прошлых лет

Состав российских открытых моделей меняется быстрее, чем обновляются статьи. Проверьте свой конспект по этому списку.

  • Организация sberbank-ai переименована в ai-forever. Старое имя осталось рабочим псевдонимом: на запрос по адресу sberbank-ai/rugpt3small_based_on_gpt2 Hugging Face отвечает переадресацией (307) на ai-forever/rugpt3small_based_on_gpt2 и отдаёт файлы, поэтому from_pretrained(«sberbank-ai/rugpt3small_based_on_gpt2») из старых руководств продолжает работать. В новом коде пишите канонический адрес ai-forever/rugpt3small_based_on_gpt2. А вот саму модель для новых проектов стоит заменить по другой причине: последний раз она обновлялась 5 декабря 2023 года и проигрывает всему, что перечислено выше.
  • Семейства «YaLM 2» не существует. На Hugging Face лежит единственный старый репозиторий yandex/yalm-100b под Apache 2.0, обновлявшийся последний раз 26 июня 2022 года — за последние 30 дней у него ноль скачиваний. Актуальные открытые веса Яндекса — это YandexGPT 5 Lite 8B в вариантах pretrain, instruct и GGUF, других моделей генерации текста в организации нет.
  • Первое поколение GigaChat в API отключено. Запросы к моделям GigaChat, GigaChat-Pro и GigaChat-Max перенаправляются на второе поколение — GigaChat-2, GigaChat-2-Pro и GigaChat-2-Max.
  • GigaChat-20B-A3B — уже не новинка. Первая открытая MoE-модель Сбера вышла 13 декабря 2024 года; её сменили GigaChat 3 Lightning (19.11.2025), GigaChat 3.1 (21.03.2026) и GigaChat 3.5 (05.07.2026).
  • Аргумент torch_dtype устарел. В transformers 5.x он заменён на dtype, а значение по умолчанию теперь «auto»: модель грузится в той точности, в которой сохранена, без принудительного приведения к float32.

Проверять состав моделей проще всего по страницам организаций на Hugging Face — там видны дата последнего обновления и лицензия каждого репозитория. Заодно полезно следить, как быстро меняются линейки у зарубежных вендоров: мы разбирали это на примере обновления ChatGPT до GPT-5.4.

Вывод раздела: прежде чем копировать код из руководства, посмотрите на дату последнего изменения репозитория модели. Полгода в этой области — большой срок.

Частые вопросы о том, как создать нейросеть

Можно ли использовать российские открытые модели в коммерческом проекте?

GigaChat 3 и T-Pro 2.1 — да, без дополнительных условий: они распространяются под MIT и Apache 2.0 соответственно. У YandexGPT 5 Lite 8B лицензия разрешает коммерческое использование, но при превышении 10 миллионов выходных токенов в месяц требует в течение 30 дней связаться с Яндексом.

Какая видеокарта нужна для запуска?

Для четырёхбитных версий ориентируйтесь на вес файла: YandexGPT-5-Lite-8B-instruct-Q4_K_M весит 4,92 ГБ, GigaChat3.1-10B-A1.8B-q4_K_M — 6,47 ГБ. Карты на 8–12 ГБ видеопамяти достаточно, версия bf16 того же GigaChat занимает 21,36 ГБ и требует 24 ГБ и выше.

Сколько стоит создать нейросеть на API GigaChat?

Физлицу на старте бесплатно: во freemium-режиме выдаётся 365 000 000 токенов на генерацию текста с обновлением лимита раз в 12 месяцев. Сверх лимита продаются пакеты — например, 20 000 000 токенов GigaChat 2 Lite стоят 1300 ₽ с НДС.

Нужно ли обучать модель с нуля?

Нет. Обучение с нуля — это корпус на десяти языках и триллионы токенов, доступные крупным лабораториям. Прикладной путь: готовые открытые веса, затем промпты, затем поиск по своим документам и лишь в последнюю очередь дообучение LoRA.

Почему запрос к GigaChat API возвращает ошибку сертификата?

Домен api.giga.chat подписан сертификатом «Russian Trusted Sub CA» Минцифры. Без установленного корневого сертификата клиент выдаёт «unable to get local issuer certificate». Сертификат скачивается с портала Госуслуг и подключается либо на уровне ОС, либо параметром ca_bundle_file в SDK.

Заключение

Создать нейросеть на российских моделях сегодня — инженерная задача сборки. Открытые веса под свободными лицензиями есть у Сбера и Т-Технологий, у Яндекса — с лимитом по объёму генерации. Файл на 5–7 ГБ, одна команда Ollama, вечер на эксперименты — этого хватает, чтобы понять, тянет ли модель вашу задачу. Дальше решают ваши данные и способ их подключить.

РОССИЙСКИЕ НЕЙРОСЕТИ ДЛЯ ЖИЗНИ И КАРЬЕРЫ В 2025
Присоединяйся к онлайн-вебинару.
В прямом эфире разберем и потестируем лучшие на сегодняшний день отечественные ИИ!
Вы узнаете о том:
  • Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
  • Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
  • Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
Участвовать бесплатно
ОБЗОРНЫЙ ПРАКТИКУМ ПО НАШУМЕВШИМ НЕЙРОСЕТЯМ
Нейросети DEEPSEEK И QWEN
За 2 часа сделаем полный обзор новых мощных ИИ-моделей, которые бросают вызов нейросети ChatGPT
Вы узнаете:
  • Возможность получить Доступ в Нейроклуб на целый месяц
  • Как ИИ ускоряет работу и приносит деньги
  • За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Участвовать бесплатно