Содержание
- Что такое Ollama и зачем запускать LLM локально
- Действительно ли Ollama бесплатна: лицензия и что остаётся платным
- Как бесплатно скачать Ollama: официальный сайт и версии для Windows, macOS и Linux
- Системные требования для бесплатного запуска Ollama
- Пошаговая установка Ollama на каждую платформу
- Какие бесплатные модели доступны в Ollama
- Как бесплатно скачать и запустить первую модель
- Бесплатный веб-интерфейс и клиенты для Ollama
- Бесплатное использование Ollama через API
- Ограничения бесплатного режима
- Частые ошибки при установке и запуске
- Источники и официальная документация
- Частые вопросы
Ollama бесплатно: скачать, установить и запустить
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 7 октября 2026 года; цитаты источников приведены дословно. Обновлено: октябрь 2026.
Ollama бесплатно распространяется как программа для запуска больших языковых моделей на своём компьютере: скачиваете установщик с официального сайта, ставите, командой ollama run gemma3 поднимаете модель, и она отвечает без облака и подписки. Плата за саму программу и за локальный запуск моделей не взимается. Дальше — что именно бесплатно, какие модели доступны и как пройти путь от скачивания до первого ответа.
Что такое Ollama и зачем запускать LLM локально
Ключевая функция — запуск LLM на вашем железе. Модель считает токены на вашем процессоре или видеокарте. В обзоре на thecode.media это объясняют через мотив конфиденциальности: для кода под NDA, внутренних документов компании или персональных данных, которые в России защищает 152-ФЗ, отправка текста во внешний чат создаёт проблему, которой при локальном запуске нет.
Третий мотив — работа без интернета. По данным axdigital.ru, скачали модель один раз (от 2 до 20 ГБ в зависимости от размера) — дальше интернет не нужен. Это удобно в поездке, в закрытом контуре или там, где канал нестабилен.
Спрос на инструмент заметный: по данным axdigital.ru, 43 790 запросов в месяц — столько раз люди ищут «ollama» в Яндексе. Наш собственный прогон 7 октября 2026 года по запросу «ollama бесплатно» показал: скачали топ-10 Яндекса по запросу «ollama бесплатно»: текст отдали 8 из 10. Медиана объёма читаемого текста топа — 2113 слов. Метку 2026 года несут 7 из 8 прочитанных страниц.
Действительно ли Ollama бесплатна: лицензия и что остаётся платным
Сама программа и локальный запуск моделей бесплатны. По данным thecode.media, Ollama — опенсорсная платформа с лицензией MIT. В обзоре на axdigital.ru формулировка прямая: Ollama с моделью Qwen2.5:7b — бесплатно навсегда, кроме электричества. Ни регистрация, ни подписка для локального режима не требуются.
Что остаётся вашими расходами при локальном режиме: электричество и диск. По данным vc.ru, для самой программы нужно минимум 4 ГБ места, но модели могут занимать уже десятки и даже сотни гигабайт — это важно учесть заранее.
| Что | Условие |
|---|---|
| Программа Ollama | Бесплатно |
| Локальный запуск моделей | Бесплатно |
| Облачная модель gemma4:cloud | Входит в бесплатный план |
| Планы Pro и Max | 20 $/мес или 200 $/год; 100 $/мес |
| Диск под модели | От 4 ГБ под программу, десятки и сотни ГБ под модели |
Как бесплатно скачать Ollama: официальный сайт и версии для Windows, macOS и Linux
Скачивать нужно с официального сайта. В обзоре на vc.ru совет прямой: если вы ищете, как скачать Ollama, лучше начинать только с официального сайта. Там же упомянут установочный скрипт вида ps1 | iex, а также обычный установщик; минимальное требование — Windows 10 или новее.
Для Windows на официальной странице загрузки есть отдельная страница Download Ollama on Windows. По данным Skillbox Media, для установки скачайте установочный клиент с сайта (1,16 ГБ).
Для macOS требование по версии системы называет Skillbox Media: клиент поддерживает macOS 14 Sonoma и новее. То же подтверждает vc.ru: для macOS указано требование macOS 14 Sonoma или новее.
Для Linux установка идёт через терминал. В обзоре на vc.ru раздел про скачивание описывает этот путь отдельно от Windows-установщика.
| Платформа | Минимальная версия ОС | Способ установки |
|---|---|---|
| Windows | Windows 10 или новее | Установщик с сайта, 1,16 ГБ |
| macOS | macOS 14 Sonoma или новее | Клиент с сайта |
| Linux | Не указана в источниках | Через терминал |
Проверить установку Ollama можно командой ollama --version: по данным thecode.media, в ответ должен прийти номер версии. Команда ollama list покажет список уже загруженных моделей — такой пример есть в материале на Хабре.
Системные требования для бесплатного запуска Ollama
Требования зависят от размера модели. Ориентиры собраны в обзоре на thecode.media и выглядят так.
| Размер модели | Диск | RAM | Видеокарта |
|---|---|---|---|
| 1–4B | 1–3 ГБ | 8 ГБ | Необязательна |
| 7–8B | ~5 ГБ | 16 ГБ | Желательна, но работает и на CPU |
| 14B | ~9 ГБ | 32 ГБ | Нужна, от 12 ГБ VRAM |
| 30B+ | 20+ ГБ | 64 ГБ | Обязательна, от 24 ГБ VRAM |
Skillbox Media даёт близкие цифры: скорость работы зависит от мощности компьютера: для комфортной работы с моделями среднего размера нужно минимум 16 ГБ оперативной памяти и видеокарта с 8 ГБ VRAM. Для крупных моделей там же: например, для популярной модели llama2:70b с 70 миллиардами параметров рекомендуется компьютер с 64 ГБ оперативной памяти.
Про видеокарты есть отдельные оговорки. В обзоре на Tproger: ROCm работает не на всех картах AMD, в основном на свежих RX 6000/7000 и Radeon Pro/Instinct. Apple Silicon (M1+) использует Metal (графический API Apple) автоматически. На голом CPU тоже работает, но в 5–10 раз медленнее.
Про память на Mac — отдельная арифметика. По данным axdigital.ru, unified memory там работает как VRAM, поэтому M2 Pro с 16 ГБ разгоняет 7B-модель до 40–60 токенов в секунду без внешнего GPU.
Пошаговая установка Ollama на каждую платформу
Порядок действий одинаков по смыслу, различается только способ доставки установщика.
Windows. Скачайте установочный клиент с официального сайта (1,16 ГБ по данным Skillbox Media). Запустите установщик. Минимальная система — Windows 10 или новее. После установки Ollama поднимается в фоне.
macOS. Скачайте клиент с сайта, требуется macOS 14 Sonoma или новее. Установите обычным перетаскиванием в Applications. На Apple Silicon ускорение через Metal включается автоматически.
Linux. Откройте терминал и выполните curl -fsSL https://ollama.com/install.sh | sh — эту команду приводит thecode.media. Скрипт определит дистрибутив, установит Ollama и зарегистрирует системный сервис. Проверьте установку командой ollama --version: в ответ должен прийти номер версии. По данным Tproger, сервис должен подняться в фоне на порту 11434; если этого не произошло, выполните ollama serve.
Проверка после установки: в терминале наберите ollama list и нажмите Enter — команда покажет, какие модели уже есть локально. Если список пуст, это нормально: модель ещё не скачана.
Отдельно про Docker и Open WebUI на Windows: для работы Docker Desktop на Windows требуется подсистема для Linux WSL2 — это из материала Skillbox Media.
Какие бесплатные модели доступны в Ollama
Библиотека Ollama насчитывает сотни моделей. В обзоре на thecode.media предупреждают, что у новичка глаза разбегаются, и дают рабочие ориентиры на середину 2026 года — с поправкой на то, что библиотека обновляется еженедельно и конкретные версии со временем поменяются.
Llama. По данным Tproger, llama3.2:latest — лучший старт: разумный баланс качества и ресурсов. Стартовая модель — llama3.2:latest: 3,2 миллиарда параметров, около 2 ГБ на диске. Если RAM мало, берите более лёгкую llama3.2:1b — всего 1,3 ГБ. Для мощного железа есть llama3.3:70b с заметно более сильными reasoning-способностями.
Qwen. В обзоре на axdigital.ru: Qwen2.5 от Alibaba обучалась на большом корпусе русских текстов — для смешанных задач (и код, и русский текст) это лучший выбор. Там же: если твои задачи на русском — начинайте с Qwen2.5. Qwen2.5:14b — лучший результат для смешанных задач: написание текстов, код, перевод, ответы на вопросы.
Gemma. В материале на Хабре для эксперимента берут модель gemma3 с размерностью 4b. Весит она немного, около 3,3 ГБ. Скорее всего, она сможет работать даже на офисном компьютере, у которого есть хотя бы 4 ГБ на борту. В официальной CLI-документации именно ollama run gemma3 приведена как базовая команда запуска модели — это отмечает vc.ru.
Phi и другие лёгкие. По данным Tproger, на 8 ГБ комфортно работают llama3.2:1b, qwen2.5:3b и phi-4-mini.
Под код. В обзоре на Tproger перечислены рекомендованные локальные модели для генерации кода и агентских воркфлоу: qwen3-coder — оптимизирована под кодогенерацию; gpt-oss:20b — добротный среднеуровневый вариант; gpt-oss:120b — высокое качество, требует серьёзного железа. Размеры qwen3-coder там же: 19 ГБ (вариант 30b, для машин с ≥ 24 ГБ RAM) или 290 ГБ (вариант 480b, для серверов).
Русскоязычные. По данным axdigital.ru, Vikhr-Nemo:12b — специализированная модель от Vikhrmodels; Saiga:7b — российская разработка на базе Llama, дообученная на русских диалогах; Mistral-Nemo:12b — французская модель с приличным русским.
Рассуждающие. В обзоре на thecode.media: для задач с рассуждениями — математика, логика, разбор сложных вопросов — есть DeepSeek-R1: эта модель «думает вслух» перед ответом и показывает цепочку рассуждений. Разбор версий — в статье DeepSeek R1 или V3: что выбрать под задачу.
| Модель | Назначение | Ориентир по размеру |
|---|---|---|
| llama3.2:latest | Универсальный старт | ~2 ГБ, 3,2 млрд параметров |
| llama3.2:1b | Слабое железо | 1,3 ГБ |
| gemma3:4b | Офисный ПК | ~3,3 ГБ |
| qwen2.5:7b | Русский + код | ~4,7 ГБ |
| qwen3-coder | Кодогенерация | 19 ГБ (30b) |
| gpt-oss:20b | Средний уровень | Требует больше железа |
| deepseek-r1:8b | Рассуждения | Версия на 8 млрд параметров |
Как бесплатно скачать и запустить первую модель
Основной путь — команда ollama pull. В обзоре на axdigital.ru показан пример: ollama pull qwen2.5:7b — скачается файл модели (~4,7 ГБ для 7B). В материале Skillbox Media приводится другой пример: ollama pull codellama:7b, после этого начнётся установка модели.
Запуск — команда ollama run. По данным Skillbox Media: ollama run codellama:7b — после запуска следующая строка начнётся с символов >>> — это приглашение для ввода команд. В материале на Хабре для загрузки используется ollama run gemma3.
Двоеточие в имени задаёт вариант модели: тег 8b — это версия на 8 миллиардов параметров, без тега скачается вариант по умолчанию — это из обзора на thecode.media.
В примере Tproger команда ollama show llama3.2:latest выводит характеристики именно llama3.2:latest: 3,2 миллиарда параметров и контекст 131 072 токена. Эти значения относятся к показанной модели.
Ниже — готовый промпт, чтобы проверить свежую модель на своей задаче.
Промпт, чтобы сравнить локальную модель с облачной на вашей задаче:
Ты — локальная модель, запущенная через Ollama на моём компьютере.
Задача: [ваша тема].
Стиль ответа: [ваш стиль].
Формат: 5 пунктов, каждый — одно предложение, без вступлений.
Ограничение: не выдумывай факты и числа; если данных нет, напиши «нет данных».
В конце добавь строку: «Проверь этот ответ на своём железе и замерь время до последнего токена».
Что менять под себя: [ваша тема] — конкретный вопрос, [ваш стиль] — деловой, разговорный, технический. Вариации той же задачи: пересказ документа в 10 пунктов; перевод абзаца с сохранением терминов; ревью фрагмента кода с указанием строк; черновик письма клиенту; список вопросов к тексту; сжатие длинной переписки в одно решение.
Бесплатный веб-интерфейс и клиенты для Ollama
Терминал подходит не всем. Первый путь — встроенный графический интерфейс Ollama App. По данным thecode.media, он появился в версии 0.10 и с тех пор стал штатной частью Ollama: ставится вместе с ней и открывается по клику на иконку в трее.
Второй путь — Open WebUI. В обзоре на thecode.media приведена команда запуска через Docker: docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main. После запуска интерфейс открывается в браузере по адресу localhost:3000. Там же оговорка: если вы ставили Open WebUI не через Docker, а напрямую (например, через pip install open-webui и open-webui serve), адрес будет другим — localhost:8080, порт по умолчанию у такой установки. Skillbox Media подтверждает адрес для Docker-варианта: теперь Open WebUI можно открыть в браузере по адресу http://localhost:3000.
Третий путь — сторонние клиенты. В обзоре на LobeHub перечислены пять бесплатных клиентов Ollama WebUI с открытым исходным кодом: LobeHub, Open WebUI, Enchanted, Chatbox и NextJS Ollama LLM UI. Там же сказано, что материал знакомит с фреймворком Ollama для локальных моделей, его преимуществами и недостатками и рекомендует эти пять клиентов для улучшения пользовательского опыта.
Альтернативы самой Ollama перечисляет Skillbox Media: помимо Ollama существуют и другие приложения с похожими возможностями: LM Studio, GPT4All и Jan.
Бесплатное использование Ollama через API
Ollama — это полноценный локальный сервер, который работает через HTTP-протокол по адресу http://localhost:11434 — так описывает его Skillbox Media. В обзоре на thecode.media та же мысль: пока вы переписываетесь с моделью в чате, под капотом происходит одно и то же: Ollama держит на компьютере REST API по адресу localhost:11434, и все интерфейсы ходят через него.
Есть и второй эндпоинт. По данным thecode.media, есть у Ollama и второй эндпоинт — /v1, совместимый с API OpenAI. Это значит, что код, написанный под OpenAI API, переносится на локальную модель сменой базового адреса.
В обзоре на thecode.media приведён готовый запрос к локальной модели gemma3. После её запуска выполните в терминале:
curl http://localhost:11434/api/chat -d '{
"model": "gemma3",
"messages": [
{ "role": "user", "content": "Почему небо голубое? Ответь одним абзацем." }
],
"stream": false
}'
В ответ придёт JSON с текстом от модели.
Практический пример интеграции приводит Skillbox Media: с помощью модели gemma3:4b автор написал скрипт на Python, который обращается к Ollama API и генерирует команду для создания пяти кубов в текущей сцене Blender.
Про контекст для агентов: кодинг-инструменты и агентские задачи требуют большого контекстного окна — для Claude Code рекомендовано минимум 64K токенов, это из материала Tproger.
Ограничения бесплатного режима
Первое ограничение — железо. Модели от 14 миллиардов параметров уже просят выделенную видеокарту с большим объёмом видеопамяти — на процессоре они запустятся, но скорость ответа будет напоминать печатную машинку. На голом CPU тоже работает, но в 5–10 раз медленнее — это оценка Tproger.
Второе — качество. Модель на 8 миллиардов параметров не напишет вам диссертацию уровня GPT, но переводит, суммаризирует, отвечает на вопросы и помогает с кодом вполне достойно. Качество ответов сильно зависит от модели: gpt-oss:120b приближается к облачным моделям по качеству, но может тормозить без мощного железа — это из обзора Tproger.
Третье — совместимость ускорителей. ROCm работает не на всех картах AMD, в основном на свежих RX 6000/7000 и Radeon Pro/Instinct. На Apple Silicon ускорение через Metal включается автоматически.
Четвёртое — место на диске. Для самой программы нужно минимум 4 ГБ места, но модели могут занимать уже десятки и даже сотни гигабайт — это важно учесть заранее.
Пятое — условия облачного режима зависят от модели и плана. По данным vc.ru, Pro стоит 20 долларов в месяц или 200 долларов в год, Max — 100 долларов в месяц. На официальной странице загрузки Ollama указано, что gemma4:cloud входит в бесплатный план, а большинство других облачных моделей требуют платного плана или купленных кредитов. Локальный запуск моделей отдельной подписки не требует.
Частые ошибки при установке и запуске
Модель не влезает в память. Симптом — ответы идут крайне медленно или процесс падает. Проверьте ориентиры: 7–8B хотят 16 ГБ оперативки, 14B — 32 ГБ, 30B+ — 64 ГБ. Если не тянет — llama3.2:1b (1,3 ГБ) или qwen2.5:3b.
Скачали не тот вариант. Двоеточие в имени задаёт вариант модели: тег 8b — это версия на 8 миллиардов параметров, без тега скачается вариант по умолчанию. Проверить, что лежит локально, помогает ollama list.
Команда ollama launch не работает. Чтобы команда ollama launch работала, нужна Ollama версии 0.15+. Обновите программу.
Open WebUI открывается не по тому адресу. Docker-вариант даёт localhost:3000, установка через pip — localhost:8080. Проверьте, каким способом ставили.
Docker Desktop не стартует на Windows. Для работы Docker Desktop на Windows требуется подсистема для Linux WSL2.
Агент не видит модель. Для Claude Code рекомендовано минимум 64K токенов контекста. Малый контекст обрезает агентские сценарии.
Модель отвечает слишком сухо или слишком вольно. Температура — параметр от 0 до 1: чем ниже, тем предсказуемее и суше ответы, чем выше — тем больше модель фантазирует. Меняется командой вида /set parameter temperature 0.3.
Не хватает места на системном диске. Модели могут занимать десятки и сотни гигабайт. Перенос папки моделей на другой диск описан в гайдах по настройке Ollama.
Источники и официальная документация
Проверять бесплатность и скачивание стоит по официальным страницам проекта: страница загрузки Ollama on Windows и главная страница ollama.com. Там же — каталог моделей: полный каталог моделей — на ollama.com/models, по данным Tproger. В официальной CLI-документации именно ollama run gemma3 приведена как базовая команда запуска модели.
Русскоязычные разборы, на которые опирается этот текст: материал на Хабре «Собственный ИИ локально, бесплатно и без GPU», гайд Tproger «Запускаем LLM локально через Ollama», обзор Skillbox Media «Ollama: что это, как выбрать модель, установить», статья thecode.media «Ollama: запускаем нейросеть локально без облака и подписок», гайд vc.ru «Как установить Ollama, как запустить Ollama и настроить в 2026 году», обзор axdigital.ru про локальный ИИ и модели для русского языка, а также подборка LobeHub «Пять отличных бесплатных клиентов Ollama WebUI».
Смежные материалы блога: Qwen не работает: причины сбоя и что делать, Как установить Дипсик на ПК: инструкция, Дипсик нейросеть на русском: как пользоваться.
Частые вопросы
Ollama бесплатно скачать можно с официального сайта?
Да, установщики лежат на официальном сайте проекта, включая отдельную страницу для Windows. В обзоре на vc.ru совет прямой: если вы ищете, как скачать Ollama, лучше начинать только с официального сайта. Для Windows минимальное требование — Windows 10 или новее, для macOS — macOS 14 Sonoma или новее.
Нужно ли платить за Ollama после установки?
Локальный запуск моделей платы не требует. В обзоре на axdigital.ru формулировка прямая: Ollama с моделью Qwen2.5:7b — бесплатно навсегда, кроме электричества. Платные планы Pro и Max относятся к облачным возможностям: Pro за 20 долларов в месяц или 200 долларов в год и Max за 100 долларов в месяц.
Сколько оперативной памяти нужно для бесплатного запуска?
Ориентиры зависят от размера модели. Модели на 3–4 миллиарда параметров работают на компьютере с 8 ГБ оперативной памяти, модели на 7–8 миллиардов хотят 16 ГБ, 14B — 32 ГБ, 30B+ — 64 ГБ. Skillbox Media даёт близкую оценку: для комфортной работы с моделями среднего размера нужно минимум 16 ГБ оперативной памяти и видеокарта с 8 ГБ VRAM.
Какую модель скачать первой?
По данным Tproger, llama3.2:latest — лучший старт: разумный баланс качества и ресурсов. Если RAM мало, берите более лёгкую llama3.2:1b — всего 1,3 ГБ. Для русскоязычных задач в обзоре на axdigital.ru советуют начинать с Qwen2.5.
Можно ли пользоваться Ollama без терминала?
Да, есть два пути. Первый — встроенный графический интерфейс Ollama App: он появился в версии 0.10 и с тех пор стал штатной частью Ollama, ставится вместе с ней и открывается по клику на иконку в трее. Второй — Open WebUI, который после Docker-запуска открывается в браузере по адресу localhost:3000.
