Содержание
  1. Что такое локальная нейросеть и чем она отличается от облачной
  2. Что нужно, чтобы запустить локальную нейросеть у себя
  3. Топ-6 локальных нейросетей 2026 года
  4. Сравнительная таблица: вес, контекст, лицензия
  5. Что изменилось со времён подборки 2025 года
  6. Как выбрать локальную нейросеть под свою задачу
  7. Зачем запускать нейросеть локально
  8. Частые вопросы о локальных нейросетях
Подборки и сравненияОбновлено · 08.2026

6 лучших локальных нейросетей для вашего проекта в 2025 году

6 октября 2025 · 16 минут чтения

Локальная нейросеть — это языковая модель, которая работает на вашем компьютере, а не на чужом сервере: веса скачиваются один раз, запросы никуда не уходят, интернет после установки не нужен. В августе 2026 года для запуска достаточно одной программы-движка и файла модели на 1–20 ГБ; порог входа задают требования движка: LM Studio рекомендует 16 ГБ оперативной памяти и от 4 ГБ видеопамяти на Windows, а на Mac — Apple Silicon.

Коротко, что важно знать перед стартом:

  • Размер скачиваемых весов — первый ориентир: Qwen3.5 9B весит 6,6 ГБ, Gemma 4 12B — 7,6 ГБ, GPT-OSS 20B — 14 ГБ (каталог Ollama).
  • Лицензии за год сдвинулись в сторону бизнеса: Gemma 4 вышла под Apache 2.0, тогда как Gemma 3 распространялась по отдельным Gemma Terms of Use.
  • Русский язык больше не требует компромисса: GigaChat-20B-A3B выложен в GGUF под лицензией MIT и запускается той же командой, что и любая западная модель.
  • Модель должна поместиться в видеопамять целиком — иначе, по документации Ollama, она грузится «entirely in system memory» и её считает процессор.
  • Подборка 2025 года устарела наполовину: у четырёх из шести моделей вышли новые поколения, у одной изменилась лицензия.

Что такое локальная нейросеть и чем она отличается от облачной

Локальная (или саморазмещаемая) нейросеть — это модель, которая работает полностью на вашем оборудовании: ноутбуке, рабочей станции или офисном сервере. В отличие от сервисов вроде ChatGPT, где запрос уходит на чужие серверы, здесь все вычисления происходят внутри вашей машины. Вы контролируете модель, её окружение и данные, и не платите за каждый запрос.

Разница ощущается в трёх местах. Первое — данные: договор, медкарта или выгрузка из CRM не покидают периметр компании. Второе — деньги: вместо оплаты за токены вы один раз платите за железо и электричество. Третье — предсказуемость: провайдер не отключит модель, не поднимет цены и не поменяет её поведение посреди рабочего процесса.

Платите вы за это качеством и скоростью. Модель на 9–20 млрд параметров уступает флагманам облака на сложных задачах, а на слабом железе отвечает медленно. Поэтому выбор локальной модели — это всегда торг между размером весов и доступной памятью. Как устроен этот торг у бесплатных решений, мы разбирали в материале о бесплатных нейросетях.

Что нужно, чтобы запустить локальную нейросеть у себя

Путь запуска локальной нейросети: от проверки памяти до первого ответа
Путь запуска локальной нейросети: от проверки памяти до первого ответа

Порядок действий короче, чем кажется: оценить память → поставить движок → скачать модель → проверить, что она легла на видеокарту.

  1. Оцените память. Главный ограничитель — объём видеопамяти (VRAM), на втором месте оперативная память (ОЗУ). Разработчики LM Studio в системных требованиях указывают для Windows: «At least 16GB of RAM is recommended» и «at least 4GB of dedicated VRAM is recommended», а также обязательную поддержку набора инструкций AVX2 для x64. Для macOS заявлен Apple Silicon (M1/M2/M3/M4) и «macOS 14.0 or newer is required», для Linux — Ubuntu 20.04 и новее.
  2. Поставьте движок. Это программа, которая грузит веса и отдаёт ответы. Массовых вариантов два: Ollama — работа из терминала плюс локальный API, и LM Studio — графическое приложение с каталогом моделей внутри. Под капотом у обоих библиотека llama.cpp, которая и считает квантованные модели формата GGUF. Сразу после установки решите, где будут лежать веса: по документации Ollama каталог хранения переопределяет переменная OLLAMA_MODELS, и выставить её дешевле до первой загрузки.
  3. Скачайте модель. Модели для локального запуска поставляются квантованными — это сжатая версия весов, которая требует меньше памяти. Обозначения вида Q4_K_M или Q8_0 в имени файла и есть уровень сжатия: чем ниже число, тем меньше файл и тем заметнее просадка качества. Загрузка и запуск у Ollama — одна команда, в карточке GigaChat она приведена дословно: ollama run hf.co/ai-sage/GigaChat-20B-A3B-instruct-v1.5-GGUF:Q4_K_M. Для llama.cpp там же дан вызов с явным путём к файлу весов: ./bin/llama-simple-chat -m /path/to/GigaChat-20B-A3B-instruct_v1.5_bf16.gguf.
  4. Проверьте, куда легла модель. В документации Ollama это описано прямо: «100% GPU means the model was loaded entirely into the GPU», «100% CPU means the model was loaded entirely in system memory». Первое — быстрый ответ, второе — модель считается процессором и отвечает медленно.

Одна деталь, которую подборки обычно пропускают, а она стоит человеку освободившегося системного диска: веса скачиваются в фиксированную папку. По документации Ollama это ~/.ollama/models на macOS, /usr/share/ollama/.ollama/models на Linux и C:\Users\%username%\.ollama\models на Windows — именно этот каталог и переносит на другой диск переменная OLLAMA_MODELS из второго шага. Три-четыре модели — это уже десятки гигабайт, поэтому каталог стоит переназначить до первой загрузки, а не после.

Пошаговую установку движка с командами мы разбирали отдельно — в инструкции по настройке модели в Ollama.

Мини-вывод: связка «движок + квантованная модель» ставится за один вечер, а главный риск не в установке, а в том, что модель не влезет в видеопамять и будет считаться процессором.

Топ-6 локальных нейросетей 2026 года

Список собран 23 августа 2026 года по карточкам моделей в каталоге Ollama и на Hugging Face: брали то, что реально скачивают и что помещается в память домашней или офисной машины. Размер в гигабайтах ниже — это вес скачиваемого файла, а не требование к видеопамяти: сверх весов движку нужен запас на контекст и служебные буферы.

1. Qwen3.5 — универсал на каждый день

Семейство от Alibaba, в каталоге Ollama доступны версии 0.8B, 2B, 4B, 9B, 27B, 35B и 122B. Ходовой вариант — 9B: файл 6,6 ГБ, контекст 256K токенов. В карточке Qwen/Qwen3.5-9B на Hugging Face указано, что модель нативно поддерживает 262 144 токена и расширяется до 1 010 000 через YaRN, а сама она описана как «Causal Language Model with Vision Encoder» — то есть понимает и картинки.

Лицензия: Apache 2.0 — коммерческое использование разрешено. Кому: тем, кому нужна одна модель на все задачи. Ограничение: на 9B сложные цепочки рассуждений даются хуже, чем облачным флагманам.

2. Gemma 4 — тот случай, когда изменилась лицензия

Google выпустил Gemma 4 2 апреля 2026 года и — впервые для семейства — под Apache 2.0. В блоге Google Open Source это сформулировано прямо: модели выходят под «OSI-approved Apache 2.0 license» и покрывают линейку «ranging from edge devices to 31B parameters». Для бизнеса это снимает главную претензию к прошлым поколениям: Gemma 3 распространялась по отдельным Gemma Terms of Use с собственной политикой запрещённого использования.

В каталоге Ollama семейство представлено вариантами E2B, E4B, 12B, 26B (Mixture of Experts с 4B активных параметров) и 31B. Веса: 12B — 7,6 ГБ, 26B — 18 ГБ, 31B — 20 ГБ. Контекст 128K у E2B и E4B, 256K у старших версий. Официальное описание: «designed to deliver frontier-level performance at each size… well-suited for reasoning, agentic workflows, coding, and multimodal understanding».

Кому: компаниям, которым нужна юридически чистая модель для продукта. Ограничение: 31B требует памяти уровня рабочей станции, а не ноутбука.

3. GPT-OSS 20B — открытая модель OpenAI

OpenAI описывает семейство как «open-weight models designed for powerful reasoning, agentic tasks, and versatile developer use cases». Локально интересна младшая версия: 20B, файл 14 ГБ, контекст 128K. В карточке модели прямо указан порог памяти — 20B запускается «as little as 16GB memory», старшая 120B (65 ГБ) рассчитана на одну видеокарту с 80 ГБ.

Лицензия: «Permissive Apache 2.0 license». Кому: тем, кто строит агентов и цепочки вызовов инструментов. Ограничение: 14 ГБ весов — это уже не про офисный ноутбук со встроенной графикой.

4. GigaChat-20B-A3B — русская модель с открытыми весами

Сбер выложил GigaChat-20B-A3B-instruct в открытый доступ, включая готовые GGUF-сборки — то есть модель запускается тем же движком, что и остальные из списка. В карточке ai-sage/GigaChat-20B-A3B-instruct-v1.5-GGUF указана лицензия MIT, 21 млрд параметров и поддержка контекста в 131 тысячу токенов. Размеры файлов по уровням квантования: Q4_0 — 11,7 ГБ, Q4_K_M — 12,5 ГБ, Q6_K — 16,9 ГБ, Q8_0 — 21,9 ГБ, BF16 — 41,2 ГБ.

Запускается одной командой из карточки модели: ollama run hf.co/ai-sage/GigaChat-20B-A3B-instruct-v1.5-GGUF:Q4_K_M. Для llama.cpp там же приведён вызов llama-simple-chat с путём к файлу весов.

Кому: задачам, где текст в основном русскоязычный, а данные нельзя выпускать за периметр — договоры, обращения клиентов, внутренние регламенты. Смежный сценарий — разбор потока отзывов на своей машине, мы описывали его в статье об анализе тональности отзывов. Ограничение: по общим знаниям модель уступает старшим западным, а самое лёгкое квантование Q4_0 всё равно весит 11,7 ГБ.

5. DeepSeek-R1 — рассуждения на своём железе

Семейство рассуждающих моделей, описание в каталоге: «a family of open reasoning models with performance approaching that of leading models, such as O3 and Gemini 2.5 Pro». Веса лицензированы под MIT — «The model weights are licensed under the MIT License». Дистилляты покрывают весь диапазон железа: 1.5b — 1,1 ГБ, 7b — 4,7 ГБ, 8b — 5,2 ГБ, 14b — 9,0 ГБ, 32b — 20 ГБ, 70b — 43 ГБ. Контекст 128K.

Кому: задачам, где нужен ход рассуждения — математика, разбор логики, проверка выкладок. Ограничение: модель тратит токены на размышление, поэтому ответ приходит заметно дольше обычного чата.

6. Mistral 7B — ветеран для слабого железа

Модель, с которой у многих начинался локальный ИИ, из каталога никуда не делась: «The 7B model released by Mistral AI, updated to version 0.3», файл 4,4 ГБ, контекст 32K, лицензия Apache. Версия 0.3 датирована 22 мая 2024 года — свежих поколений в этой строке каталога с тех пор не выходило, и это честная причина не ставить её первым номером.

Кому: слабым машинам и задачам без длинного контекста — черновики, переформулировки, простая классификация: 4,4 ГБ — самый лёгкий файл в этой шестёрке. Ограничение: контекст 32K против 128–256K у моделей 2026 года; пачку документов в неё не положить.

Сравнительная таблица: вес, контекст, лицензия

Все цифры — из карточек моделей в каталоге Ollama и на Hugging Face на 23 августа 2026 года. Столбец «вес файла» показывает размер загрузки, а не требуемый объём видеопамяти.

Модель Параметры Вес файла Контекст Лицензия
Qwen3.5 9B 9B 6,6 ГБ 256K Apache 2.0
Gemma 4 12B 12B 7,6 ГБ 256K Apache 2.0
GPT-OSS 20B 20B 14 ГБ 128K Apache 2.0
GigaChat-20B-A3B v1.5 21B 12,5 ГБ (Q4_K_M) 131K MIT
DeepSeek-R1 14B 14B 9,0 ГБ 128K MIT
Mistral 7B v0.3 7B 4,4 ГБ 32K Apache 2.0

Если читать таблицу с конца, картина 2026 года такая: разрешительная лицензия перестала быть отличием — Apache 2.0 или MIT теперь у всех шести. Отличаются вес, длина контекста и язык, на котором модель говорит без акцента.

Порог памяти производитель называет редко: из шести моделей он заявлен только у GPT-OSS 20B — «as little as 16GB memory». Для остальных ориентируйтесь на вес файла и берите запас сверх него: веса должны поместиться в память целиком, а контекст занимает место дополнительно.

Мини-вывод: сначала смотрите на вес файла и лицензию, потом на бенчмарки — модель, которая не поместилась в память, проиграет любой более слабой, которая поместилась.

Что изменилось со времён подборки 2025 года

Локальные модели устаревают быстрее, чем статьи о них. Мы прошли по прошлому составу списка и сверили каждую позицию с каталогами — вот что с ними стало.

  • Gemma 3 → Gemma 4. Главное изменение — не размеры, а право: Gemma 4 вышла 2 апреля 2026 года под Apache 2.0, тогда как прошлые поколения жили под собственными Gemma Terms of Use. Формулировка «проприетарная лицензия Google с ограничениями для коммерческого использования» к Gemma 4 больше не относится.
  • Phi-3 Mini → Phi-4. В каталоге Ollama актуальная строка — «Phi-4 is a 14B parameter, state-of-the-art open model from Microsoft», файл 9,1 ГБ, контекст 16K. Phi-3 остаётся доступной (3.8b и 14b), но статуса свежей модели у неё уже нет.
  • OLMo-2-1B → Olmo 3. У Allen Institute for AI на Hugging Face выложено третье поколение: Olmo-3-7B-Instruct, Olmo-3-7B-Think и Olmo-3-32B-Think. В свежих релизах фигурируют размеры 7B и 32B — исследовательская линейка выросла из одномиллиардного класса.
  • Jamba Mini → Jamba2 Mini и Jamba Reasoning 3B. AI21 Labs обновила семейство: рядом с 52-миллиардными Jamba 1.6, 1.7 и Jamba2 Mini появилась Jamba-Reasoning-3B, в том числе в формате GGUF. Для домашней машины интересна именно она: 52B требует ресурсов уровня сервера.
  • Dolphin 2.9 Mistral 7B → Dolphin 3.0 и Dolphin-Mistral-24B. Линейка переехала на 24-миллиардную базу: на Hugging Face у команды dphn лежат Dolphin3.0-Mistral-24B в формате GGUF и Dolphin-Mistral-24B-Venice-Edition. Сборки 2.0 и 2.1 на семимиллиардной базе значатся в архиве, а репозиторий с именем «Dolphin 2.9 Mistral 7B» в поиске Hugging Face 23 августа 2026 года не нашёлся — искать актуальную сборку стоит по 24-миллиардной линейке.
  • Mistral 7B. Единственная позиция прошлого списка, которая осталась в новом, — 32,2 млн загрузок в каталоге Ollama и лицензия Apache.

Появились и новые лица, которых год назад в подборках не было: GPT-OSS от OpenAI, Qwen3.5 и открытые веса GigaChat. Для сравнения масштабов — в каталоге Ollama у llama3.1 118,7 млн загрузок, у deepseek-r1 91,7 млн, у gemma4 23,1 млн, у qwen3.5 18,2 млн.

Мини-вывод: перед установкой любой модели из статьи годичной давности проверяйте карточку в каталоге — поколение и лицензия меняются чаще, чем публикуются обзоры.

Как выбрать локальную нейросеть под свою задачу

Три критерия закрывают почти весь выбор, и порядок у них именно такой.

  1. Память — первый фильтр. Сравните вес файла с объёмом видеопамяти и оставьте запас на контекст. Модель, которая не поместилась в видеопамять, уедет в оперативную: документация Ollama описывает это состояние как «100% CPU means the model was loaded entirely in system memory» — модель считается процессором и отвечает медленно.
  2. Лицензия — второй, если это работа. Apache 2.0 и MIT разрешают коммерческое использование. У части моделей условия свои: до Gemma 4 у семейства Google действовали отдельные Gemma Terms of Use со своей политикой запрещённого использования. Правило простое — открытые веса не равны свободной лицензии, файл лицензии в карточке модели стоит открыть до внедрения.
  3. Профиль задачи — третий. Узкая модель регулярно обыгрывает крупную на своей территории. Нужен код — берите кодовую линейку, нужны рассуждения — рассуждающую вроде DeepSeek-R1, нужен русский юридический текст — GigaChat. Количество параметров само по себе ничего не гарантирует.

Отдельно про язык: русскоязычный запрос понимают все шесть моделей, но качество формулировок различается сильнее, чем на английском. Проверять это стоит на своих же документах — десяти реальных запросов достаточно, чтобы увидеть разницу. Пример из смежной области: в подборке нейросетей для юристов видно, как требование к точности формулировок меняет выбор инструмента.

Зачем запускать нейросеть локально

  • Данные не покидают периметр. Персональные данные клиентов, финансовые отчёты, медицинские записи не уходят к стороннему обработчику — снимается целый класс юридических вопросов.
  • Нет платы за запрос. При тысячах обращений в день (внутренний чат-бот, разбор писем, классификация заявок) разница с оплатой по токенам считается в месячных счетах.
  • Модель можно дообучить. Открытые веса позволяют адаптировать модель под свои документы и терминологию.
  • Работает без интернета. После загрузки весов модель не зависит ни от сети, ни от сбоев провайдера, ни от смены его тарифов и правил.

Мини-вывод: локальный запуск выигрывает там, где важны приватность, объём однотипных запросов и предсказуемость, и проигрывает там, где нужен максимум качества на сложной задаче.

Частые вопросы о локальных нейросетях

Какая локальная нейросеть подойдёт для слабого компьютера?

Самые лёгкие варианты из актуальных каталогов — Qwen3.5 0.8B с файлом 1,0 ГБ, DeepSeek-R1 1.5B с файлом 1,1 ГБ и Qwen3.5 2B с файлом 2,7 ГБ. Из проверенных временем моделей самый лёгкий файл у Mistral 7B версии 0.3 — 4,4 ГБ, контекст 32K, лицензия Apache. Чем меньше файл, тем меньше памяти нужно, но тем заметнее просадка качества на сложных задачах.

Сколько видеопамяти нужно для локальной нейросети?

Единой цифры нет, ориентиров два. Разработчики LM Studio в системных требованиях для Windows рекомендуют «At least 16GB of RAM» и «at least 4GB of dedicated VRAM». Для конкретной модели порог называет её автор: например, для GPT-OSS 20B заявлено, что она работает «as little as 16GB memory». Практическое правило — веса должны поместиться в память целиком, а сверх них нужен запас на контекст.

Можно ли использовать локальную нейросеть в коммерческих целях?

Зависит от лицензии конкретной модели, а не от факта локального запуска. Лицензии Apache 2.0 и MIT коммерческое использование разрешают — под ними выходят Qwen3.5, GPT-OSS, DeepSeek-R1, Mistral 7B и GigaChat-20B-A3B. Семейство Gemma перешло на Apache 2.0 только с четвёртого поколения, вышедшего 2 апреля 2026 года; прошлые версии распространялись по отдельным Gemma Terms of Use со своей политикой запрещённого использования.

Какая локальная нейросеть лучше работает с русским языком?

Из моделей с открытыми весами русскоязычные задачи закрывает GigaChat-20B-A3B-instruct: он выложен в формате GGUF под лицензией MIT, имеет 21 млрд параметров и поддерживает контекст в 131 тысячу токенов. Файл в квантовании Q4_K_M весит 12,5 ГБ. Запускается командой ollama run hf.co/ai-sage/GigaChat-20B-A3B-instruct-v1.5-GGUF:Q4_K_M.

Чем Ollama отличается от LM Studio?

Ollama работает из терминала и поднимает локальный API, к которому подключаются сторонние приложения. LM Studio — графическое приложение с каталогом моделей и чатом внутри. Считают они одно и то же: обе программы построены вокруг библиотеки llama.cpp и работают с квантованными моделями формата GGUF. Ollama хранит скачанные веса в фиксированной папке — на Windows это C:\Users\%username%\.ollama\models, и путь переопределяется переменной OLLAMA_MODELS.

Вес файла модели: от чего отталкиваться при выборе (данные каталога Ollama, 23.08.2026)
Вес файла модели: от чего отталкиваться при выборе (данные каталога Ollama, 23.08.2026)

Читайте также

3 материала