Обновлено 19 августа 2026 года.
Создать нейросеть на базе российских моделей в 2026 году — значит взять готовые открытые веса и дообучить их под свою задачу. Сбер выложил GigaChat 3.1 Lightning под лицензией MIT, Яндекс — YandexGPT 5 Lite 8B, Т-Технологии — T-Pro 2.1 под Apache 2.0. Всё это лежит на Hugging Face и запускается на одной видеокарте.
Что разберём по шагам:
- какие российские модели открыты на самом деле и на каких лицензионных условиях;
- сколько весит файл модели и какая видеопамять под него нужна;
- команды запуска, проверенные на актуальных версиях библиотек;
- путь без своей видеокарты — API GigaChat и его бесплатный лимит токенов;
- как дообучить модель на своих данных методом LoRA.

Что понадобится, чтобы создать нейросеть
Собственная нейросеть сегодня собирается не из слоёв на PyTorch, а из четырёх готовых деталей.
- Открытые веса. Файл модели с Hugging Face — обычно в формате .safetensors для видеокарты или .gguf для запуска на процессоре и слабой карте.
- Движок инференса. llama.cpp или Ollama для домашней машины, vLLM либо SGLang для сервера.
- Свои данные. Инструкции, переписки, документы — то, чего нет в базовой модели и ради чего вы её дообучаете.
- Место запуска. Своя видеокарта, арендованный GPU в облаке или чужой API, если железа нет вовсе.
Знание Python нужно на уровне «скопировать и поправить путь к файлу». Обучать трансформер с нуля не потребуется: полный цикл предобучения GigaChat 3 шёл на корпусе из десяти языков и примерно 5,5 триллиона синтетических токенов — повторить это в одиночку нельзя и не нужно.
Если задача сводится к разбору документов или переписок, посмотрите, как это делают на практике: инструмент анализа тендеров за минуту на комплект и ИИ-разбор переписок, снизивший потери задач на 30%.
Вывод раздела: роль разработчика здесь — сборщик. Веса, движок и метод дообучения уже написаны за вас, ваш вклад — данные и постановка задачи.

- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
- Где и как применять? Потестируем модель после установки на разных задачах
- Как дообучить модель под себя?
Где взять российские модели с открытыми весами

Главный хаб — Hugging Face. Российские команды публикуют веса там же, где и все остальные: Сбер под аккаунтом ai-sage, Яндекс под yandex, Т-Технологии под t-tech. Ниже — что фактически доступно к скачиванию на август 2026 года.
| Модель | Размер | Контекст | Лицензия | Опубликована |
|---|---|---|---|---|
| ai-sage/GigaChat3.1-10B-A1.8B | 10B, активных 1,8B (MoE) | 262 144 токена | MIT | 21.03.2026 |
| ai-sage/GigaChat3.5-432B-A28B | 432B, активных 28B (MoE) | 262 144 токена | MIT | 05.07.2026 |
| yandex/YandexGPT-5-Lite-8B-instruct | 8B | 32 768 токенов | собственная лицензия Яндекса | 28.03.2025 |
| t-tech/T-pro-it-2.1 | 33B (на базе Qwen3-32B) | 32 768, до 131 072 с YaRN | Apache 2.0 | 16.12.2025 |
Размеры файлов, лицензия и дата последнего обновления видны прямо в карточке модели GigaChat 3.1 Lightning — сверяйтесь по первоисточнику, он обновляется в тот же день, что и веса.
Первоисточники иногда расходятся между собой, и это стоит держать в голове. У T-Pro 2.1 README карточки заявляет 32 768 токенов нативно с расширением до 131 072 через YaRN, а config.json того же репозитория содержит max_position_embeddings: 40960. В таблице оставлено число из README: его назвал автор модели, и оно строже. Контексты GigaChat 3.1 и 3.5 в таблице — из config.json их репозиториев, в обоих max_position_embeddings: 262144.
Различие лицензий здесь важнее размера. MIT у GigaChat 3 и Apache 2.0 у T-Pro разрешают коммерческое использование без порогов. Лицензия YandexGPT 5 Lite 8B тоже разрешает коммерцию, но с потолком: при превышении 10 миллионов выходных токенов в месяц нужно в течение 30 дней связаться с Яндексом, иначе лицензия аннулируется. Она же требует сохранять указание правообладателя — «Copyright (c) 2025, ООО „ЯНДЕКС“».
T-Pro 2.1 собран на базе Qwen3-32B с более плотной токенизацией русского — если разбираетесь в родословной, полезен наш обзор серии моделей Qwen 3.5.
Вывод раздела: прежде чем скачивать веса, откройте файл лицензии в репозитории. У двух моделей из четырёх условия свободные, у одной — с лимитом по объёму генерации.
Где запускать модель: своя карта или облако
Требования к железу удобно считать не по числу параметров, а по весу файла квантизованной версии. Он опубликован прямо в репозитории и не оставляет места догадкам.
| Файл | Квантизация | Вес |
|---|---|---|
| YandexGPT-5-Lite-8B-instruct-Q4_K_M.gguf | 4 бита | 4,92 ГБ |
| GigaChat3.1-10B-A1.8B-q4_K_M.gguf | 4 бита | 6,47 ГБ |
| GigaChat3.1-10B-A1.8B-q6_K.gguf | 6 бит | 8,78 ГБ |
| GigaChat3.1-10B-A1.8B-q8_0.gguf | 8 бит | 11,35 ГБ |
| GigaChat3.1-10B-A1.8B-bf16.gguf | без квантизации | 21,36 ГБ |
Правило простое: к весу файла добавьте запас под KV-кэш и получите минимум видеопамяти. YandexGPT 5 Lite в четырёхбитной версии умещается на карте с 8 ГБ VRAM, GigaChat 3.1 Lightning в той же квантизации — на 12 ГБ, а вот bf16-версия того же GigaChat уже требует 24 ГБ и выше.
Отдельная особенность GigaChat 3.1 Lightning — архитектура Mixture-of-Experts: из 10 миллиардов параметров на каждый токен работают только 1,8 миллиарда. Память он занимает по полному размеру, а вычисляет по активной части, поэтому на домашней карте отвечает заметно быстрее плотных моделей сопоставимого веса.
Облако нужно в двух случаях: под крупные модели вроде GigaChat 3.5 на 432B, которые Сбер прямо позиционирует для кластерных и on-prem сценариев, и под дообучение, где кроме весов в память ложатся градиенты и состояния оптимизатора. GPU-инстансы с почасовой оплатой дают VK Cloud, Yandex Cloud, Selectel и Timeweb Cloud.
Вывод раздела: для первого запуска хватает игровой карты с 12 ГБ видеопамяти. Облако берут под масштаб и под обучение — чтобы просто поговорить с моделью, оно не нужно.
Пример: как запустить модель за один вечер
Самый короткий путь — Ollama:
ollama run hf.co/ai-sage/GigaChat3.1-10B-A1.8B-GGUF:Q4_K_M
ollama run yandex/YandexGPT-5-Lite-8B-instruct-GGUF
Вторая строка стоит дословно в карточке yandex/YandexGPT-5-Lite-8B-instruct-GGUF. Первая собрана по общей схеме Ollama-интеграции Hugging Face Hub: любой GGUF-репозиторий запускается шаблоном ollama run hf.co/<организация>/<репозиторий>:<квантование>. Сама карточка GigaChat 3.1 Lightning описывает только llama.cpp, про Ollama в ней ни слова.
Кто хочет держать модель за собственным HTTP-сервером, собирает llama.cpp. В карточке GigaChat 3.1 Lightning указаны минимальные требования: llama.cpp сборки не ниже 8495 и CMake не ниже 3.28.3.
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release --target llama-server -j 8
./build/bin/llama-server -m GigaChat3.1-10B-A1.8B-q4_K_M.gguf \
-ctk q8_0 -ctv q8_0 -fa on --n-gpu-layers 999 \
--ctx-size 32768 --port 8080 --host 0.0.0.0 --jinja
На сервере с полноценной видеокартой обе модели поднимаются одной строкой через vLLM (актуальная версия на PyPI — 0.27.1):
vllm serve ai-sage/GigaChat3.1-10B-A1.8B --dtype auto
Через Python-код запуск выглядит так. Важная деталь: в transformers 5.0.0, вышедшей 26 января 2026 года, аргумент torch_dtype заменён на dtype, а поддержка TensorFlow и Flax удалена. Карточки моделей местами всё ещё показывают старое имя аргумента — на версии 5.15.0 оно вызывает предупреждение об устаревании.
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "yandex/YandexGPT-5-Lite-8B-instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "Расскажи интересный факт"}]
inputs = tokenizer.apply_chat_template(
messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Вывод раздела: первый запуск занимает время скачивания файла. Основные грабли — устаревшие аргументы из старых руководств и попытка загрузить bf16-версию на карту, куда она не помещается.
Путь без своей видеокарты: API GigaChat

Если железа нет, российскую модель можно взять по API. Сбер раздаёт физлицам заметный бесплатный объём: во freemium-режиме выдаётся 365 000 000 токенов на генерацию текста, лимит обновляется раз в 12 месяцев. Разложено по семействам так: 250 млн на Lite, 40 млн на Pro, 25 млн на Max и 50 млн на GigaChat-3-Ultra. Ограничение — генерация идёт в один поток. Условия и цены пакетов сверх лимита опубликованы в тарифах GigaChat API для физлиц.
Порядок подключения по документации: зарегистрироваться в личном кабинете Studio по Сбер ID, создать проект GigaChat API, открыть в левой панели раздел Настройки API, нажать Получить ключ и сохранить три значения — Authorization Key, Client ID и Client Secret. Токен доступа выпускается запросом POST на https://ngw.devices.sberbank.ru:9443/api/v2/oauth со scope GIGACHAT_API_PERS и живёт 30 минут.
Два момента, о которых старые инструкции молчат.
Первый — адрес. С 17 июля 2026 года для подключения к GigaChat API используется https://api.giga.chat, прежний gigachat.devices.sberbank.ru остаётся переходным.
Второй — сертификат. Мы обратились к api.giga.chat обычным curl и получили ошибку проверки цепочки: «unable to get local issuer certificate». В сертификате домена издателем значится «The Ministry of Digital Development and Communications, Russian Trusted Sub CA». С отключённой проверкой тот же запрос отдал ожидаемый 401 — значит, дело не в сети, а именно в доверии к корневому сертификату. Документация подтверждает: для обмена сообщениями с GigaChat API нужен корневой сертификат Минцифры, скачивается он с портала Госуслуг, а в Python-SDK подкладывается параметром ca_bundle_file.
pip install gigachat # текущая версия на PyPI — 0.2.3
from gigachat import GigaChat
giga = GigaChat(
base_url="https://api.giga.chat/v1",
credentials="ваш_authorization_key",
ca_bundle_file="russian_trusted_root_ca_pem.crt",
)
print(giga.chat("Привет! Как дела?"))
Вывод раздела: бесплатного лимита хватает на прототип и на пилот внутри команды. Первая же ошибка, на которую натыкаются почти все, — не отсутствие ключа, а неустановленный корневой сертификат.
О том, в каких сферах российские нейросети приносят пользу уже сегодня — расскажем на бесплатном вебинаре.
Как обучить свою нейросеть под свою задачу
Полное дообучение восьмимиллиардной модели требует памяти в разы больше, чем сами веса. Поэтому применяют LoRA — метод, который замораживает исходную матрицу весов и обучает вместо неё две маленькие низкоранговые матрицы. В документации библиотеки PEFT приводится оценка из исходной статьи: LoRA сокращает число обучаемых параметров в 10 000 раз, а требования к видеопамяти — втрое.
Рабочий каркас конфигурации выглядит так (актуальная версия peft на PyPI — 0.20.0):
from peft import LoraConfig, get_peft_model
config = LoraConfig(
r=16,
lora_alpha=16,
target_modules="all-linear",
lora_dropout=0.1,
bias="none",
)
model = get_peft_model(model, config)
model.print_trainable_parameters()
Значение target_modules=»all-linear» в документации PEFT названо QLoRA-режимом: адаптеры вешаются на все линейные слои, и качество приближается к полному дообучению. Ранг r — главный регулятор: чем он выше, тем больше ёмкость адаптера и расход памяти.
Данные важнее гиперпараметров. Открытые русскоязычные наборы, которые можно взять за основу или образец формата: t-tech/T-Wix под лицензией ODC-BY, IlyaGusev/saiga_scored, Vikhrmodels/Grounded-RAG-RU-v2 под Apache 2.0. Но настоящую пользу даёт собственный набор — ваши тикеты, регламенты, карточки товаров, разметка ответов оператора.
Есть и путь без обучения вовсе: подключить модель к своей базе документов через поиск по ним (RAG). Для большинства задач вроде «отвечать по нашей документации» он даёт результат быстрее, чем дообучение, и не требует переобучения при каждом изменении документов.
Своя модель на своём железе — ещё и вопрос контроля над данными. Так безопаснее: запросы не уходят в чужое облако, доступ к модели не зависит от санкций и решений внешнего провайдера, поведение настраивается системным промптом и дообучением. Когда речь о юридических, медицинских или персональных данных, этот довод обычно перевешивает удобство готового API.
Вывод раздела: начинайте с промптов, переходите к RAG, и только если качества всё ещё не хватает — беритесь за LoRA. Обратный порядок стоит недель работы впустую.
Что устарело в руководствах прошлых лет
Состав российских открытых моделей меняется быстрее, чем обновляются статьи. Проверьте свой конспект по этому списку.
- Организация sberbank-ai переименована в ai-forever. Старое имя осталось рабочим псевдонимом: на запрос по адресу sberbank-ai/rugpt3small_based_on_gpt2 Hugging Face отвечает переадресацией (307) на ai-forever/rugpt3small_based_on_gpt2 и отдаёт файлы, поэтому from_pretrained(«sberbank-ai/rugpt3small_based_on_gpt2») из старых руководств продолжает работать. В новом коде пишите канонический адрес ai-forever/rugpt3small_based_on_gpt2. А вот саму модель для новых проектов стоит заменить по другой причине: последний раз она обновлялась 5 декабря 2023 года и проигрывает всему, что перечислено выше.
- Семейства «YaLM 2» не существует. На Hugging Face лежит единственный старый репозиторий yandex/yalm-100b под Apache 2.0, обновлявшийся последний раз 26 июня 2022 года — за последние 30 дней у него ноль скачиваний. Актуальные открытые веса Яндекса — это YandexGPT 5 Lite 8B в вариантах pretrain, instruct и GGUF, других моделей генерации текста в организации нет.
- Первое поколение GigaChat в API отключено. Запросы к моделям GigaChat, GigaChat-Pro и GigaChat-Max перенаправляются на второе поколение — GigaChat-2, GigaChat-2-Pro и GigaChat-2-Max.
- GigaChat-20B-A3B — уже не новинка. Первая открытая MoE-модель Сбера вышла 13 декабря 2024 года; её сменили GigaChat 3 Lightning (19.11.2025), GigaChat 3.1 (21.03.2026) и GigaChat 3.5 (05.07.2026).
- Аргумент torch_dtype устарел. В transformers 5.x он заменён на dtype, а значение по умолчанию теперь «auto»: модель грузится в той точности, в которой сохранена, без принудительного приведения к float32.
Проверять состав моделей проще всего по страницам организаций на Hugging Face — там видны дата последнего обновления и лицензия каждого репозитория. Заодно полезно следить, как быстро меняются линейки у зарубежных вендоров: мы разбирали это на примере обновления ChatGPT до GPT-5.4.
Вывод раздела: прежде чем копировать код из руководства, посмотрите на дату последнего изменения репозитория модели. Полгода в этой области — большой срок.
Частые вопросы о том, как создать нейросеть
Можно ли использовать российские открытые модели в коммерческом проекте?
GigaChat 3 и T-Pro 2.1 — да, без дополнительных условий: они распространяются под MIT и Apache 2.0 соответственно. У YandexGPT 5 Lite 8B лицензия разрешает коммерческое использование, но при превышении 10 миллионов выходных токенов в месяц требует в течение 30 дней связаться с Яндексом.
Какая видеокарта нужна для запуска?
Для четырёхбитных версий ориентируйтесь на вес файла: YandexGPT-5-Lite-8B-instruct-Q4_K_M весит 4,92 ГБ, GigaChat3.1-10B-A1.8B-q4_K_M — 6,47 ГБ. Карты на 8–12 ГБ видеопамяти достаточно, версия bf16 того же GigaChat занимает 21,36 ГБ и требует 24 ГБ и выше.
Сколько стоит создать нейросеть на API GigaChat?
Физлицу на старте бесплатно: во freemium-режиме выдаётся 365 000 000 токенов на генерацию текста с обновлением лимита раз в 12 месяцев. Сверх лимита продаются пакеты — например, 20 000 000 токенов GigaChat 2 Lite стоят 1300 ₽ с НДС.
Нужно ли обучать модель с нуля?
Нет. Обучение с нуля — это корпус на десяти языках и триллионы токенов, доступные крупным лабораториям. Прикладной путь: готовые открытые веса, затем промпты, затем поиск по своим документам и лишь в последнюю очередь дообучение LoRA.
Почему запрос к GigaChat API возвращает ошибку сертификата?
Домен api.giga.chat подписан сертификатом «Russian Trusted Sub CA» Минцифры. Без установленного корневого сертификата клиент выдаёт «unable to get local issuer certificate». Сертификат скачивается с портала Госуслуг и подключается либо на уровне ОС, либо параметром ca_bundle_file в SDK.
Заключение
Создать нейросеть на российских моделях сегодня — инженерная задача сборки. Открытые веса под свободными лицензиями есть у Сбера и Т-Технологий, у Яндекса — с лимитом по объёму генерации. Файл на 5–7 ГБ, одна команда Ollama, вечер на эксперименты — этого хватает, чтобы понять, тянет ли модель вашу задачу. Дальше решают ваши данные и способ их подключить.
- Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
- Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
- Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
- Возможность получить Доступ в Нейроклуб на целый месяц
- Как ИИ ускоряет работу и приносит деньги
- За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!