Содержание
  1. Сначала выберите формат и путь
  2. Путь Ollama: установка и запуск
  3. Путь LM Studio: установка и запуск
  4. GGUF и квантование файла
  5. Первая проверка ответа
  6. Диагностика локального запуска: клиент → файл → модель → запрос
  7. Копируемый промпт и три варианта
  8. Чек-лист запуска
  9. Частые вопросы
Гайды

Qwen GGUF: локальный чат через Ollama и LM Studio

8 октября 2026 · 10 минут чтения

Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 8 октября 2026 года; цитаты источников приведены дословно. Обновлено: октябрь 2026.

Запустить Qwen GGUF локально можно двумя путями. Путь Ollama — одна команда ollama run qwen3:0.6b в терминале. Путь LM Studio — установка приложения, поиск модели в каталоге и загрузка официального репозитория Qwen/Qwen3-0.6B-GGUF. Выбирайте один путь и доводите его до первого ответа в чате.

Редакция проверила, как устроена выдача по этому запросу: скачали топ-10 выдачи DuckDuckGo (ru-RU) по запросу «qwen gguf»: текст отдали 8 из 10. Медиана объёма читаемого текста топа — 2196 слов. Метку 2026 года несут 5 из 8 прочитанных страниц. Это означает: материал должен быть плотным по существу, без растянутых вступлений.

Сначала выберите формат и путь

GGUF — формат файла, в котором распространяются веса моделей для локального запуска. В документации LM Studio это описано прямо: чтобы запустить модель локально, нужен доступ к её «весам», модель распространяется файлами с весами, в том числе в формате GGUF. Значит, GGUF — формат упаковки весов модели.

Дальше развилка из двух веток:

Что сравниваем Ollama LM Studio
Способ установки Скачать приложение с сайта проекта; на Linux сервер запускается командой ollama serve Скачать установщик с сайта проекта
Первый запуск модели Команда в терминале: ollama run qwen3:0.6b Discover → поиск модели → Download → Chat → выбор модели в загрузчике
Где живёт модель В хранилище клиента после загрузки В хранилище приложения после загрузки
Интерфейс Терминал, плюс подключение сторонних приложений Графическое приложение
Кому подходит Тем, кто работает в терминале и подключает агентов Тем, кому нужен графический интерфейс и чат в окне

Обе ветки используют один и тот же семейный набор весов Qwen3. Разница — в клиенте и способе запуска.

Путь Ollama: установка и запуск

Установка клиента идёт по официальным ссылкам. На странице документации проекта сказано: Ollama можно установить для macOS, Windows или Linux и запустить через приложение либо терминал. То есть сначала скачиваете приложение с сайта Ollama, открываете его, дальше работаете либо из приложения, либо из терминала.

Документированный пример запуска конкретной модели — команда ollama run qwen3:0.6b. Редакция эту команду не запускала; она приведена как документированный пример проекта. В карточке модели на сайте проекта с пометкой qwen3:0.6b эта же команда указана как пример CLI.

Когда модель загружена, Ollama открывает чат прямо в терминале. Документация описывает выход: чтобы покинуть сессию, введите /bye.

Что нужно знать про метку модели. В карточке qwen3:0.6b указаны: параметры 752M, квантизация Q4_K_M, размер 523MB, архитектура qwen3, лицензия Apache License. Эти значения — из карточки на сайте проекта. Значит, qwen3:0.6b и файл Qwen3-0.6B-GGUF — родственные, но не идентичные по параметрам запуска: карточка на Hugging Face указывает 0.6B параметров, контекст 32 768 и квантизацию q8_0 для опубликованного репозитория.

Если сервер по какой-то причине не поднят, документация прямо описывает шаг: в Linux сервер запускают командой ollama serve, если он ещё не работает. На других системах сервер запускается через приложение.

Сервер Ollama принимает локальные запросы по адресу http://localhost:11434 из документации.

Смежный материал про работу с этим клиентом без оплаты: Ollama бесплатно: скачать, установить и запустить.

Путь LM Studio: установка и запуск

LM Studio — графическое приложение. Установка идёт с официального сайта проекта, ссылка расположена на странице документации.

Документированный путь описан в руководстве начала работы LM Studio. Ниже — порядок действий.

  1. Установить последнюю версию LM Studio с сайта проекта. В документации: сначала установите текущую версию LM Studio.
  2. Перейти на вкладку Discover. В документации: во вкладке Discover найдите и скачайте модель. Там есть подборка готовых вариантов, а также поиск модели по запросу.
  3. Выбрать модель и загрузить её.
  4. Перейти на вкладку Chat. В документации: во вкладке Chat откройте загрузчик модели. Загрузчик — это окно выбора уже скачанной или подгруженной вручную модели.
  5. Выбрать загруженную модель. При необходимости настроить параметры загрузки.
  6. Отправить первый запрос в чате. Точные подписи кнопок в тексте не привожу: русские ярлыки интерфейса зависят от версии и языка приложения, а официальной русской страницы с подписями в предоставленной документации нет.

Для модели Qwen вручную нужен официальный репозиторий Qwen/Qwen3-0.6B-GGUF. Он опубликован под лицензией apache-2.0, тег задачи — Text Generation, библиотека — GGUF, архитектура — qwen3.

Отдельно про импорт файла из папки. Документация упоминает, что в загрузчике можно выбрать модель, которую вы скачали или sideloaded. Слова sideloaded в официальной документации обозначают загрузку вне каталога. Однако утверждать, что любой GGUF-файл из любой папки будет прочитан корректно, нельзя — источник этого не подтверждает. Ориентируйтесь на штатный путь загрузки через Discover и встроенный загрузчик.

Материал про клиент поближе: LM Studio бесплатно: запуск LLM на своём ПК.

GGUF и квантование файла

Различие между файлами одного и того же семейства — в квантовании.

Что смотрим Qwen/Qwen3-0.6B-GGUF на Hugging Face qwen3:0.6b в карточке Ollama
Параметры 0.6B 752M
Параметры без эмбеддингов 0.44B —
Слоёв 28 —
Головы внимания (GQA) 16 для Q и 8 для KV —
Контекст 32 768 —
Квантование q8_0 Q4_K_M
Размер файла 8-bit Q8_0 — 639 MB 523 MB
Лицензия apache-2.0 Apache License Version 2.0
Архитектура qwen3 qwen3

Сами по себе цифры размера не отвечают на вопрос, какая версия лучше. Чем ниже разрядность квантизации, тем компактнее файл. В карточке Ollama для модели Qwen3 также описан набор параметров генерации с примерами рекомендаций для thinking и non-thinking режимов: Temperature, TopP, TopK, MinP и PresencePenalty. Это параметры моделей семейства Qwen3 в этой карточке; рекомендаций по подбору конкретных значений для 0.6B с замером качества в источниках нет.

Перед запуском проверьте шаблон чата и параметры выбранного клиента. Карточка Qwen содержит пример с флагом --jinja, карточка Ollama — шаблон сообщений. Это не подтверждает наличие отдельного Jinja2-файла в любом GGUF-репозитории.

Про лицензии: файлы опубликованы под разрешительной лицензией. Это не советы о юридическом статусе конкретных файлов; при коммерческом использовании смотрите текст лицензии на странице репозитория.

Первая проверка ответа

Связный ответ показывает результат одной попытки. Чтобы подтвердить локальный маршрут, также сверьте выбранную модель и адрес сервера в клиенте.

  1. Модель отвечает связным текстом. Мусорные символы или оборванные строки зафиксируйте вместе с параметрами запуска; они сами по себе не устанавливают причину.
  2. Модель отвечает на языке запроса. Семейство Qwen3 заявляет поддержку 100+ языков, но качество конкретного ответа проверяйте на собственной задаче.
  3. Ответ приходит без выхода за границы запроса. Если модель перескакивает в thinking-режим там, где не надо, обратите внимание на параметры шаблона.
  4. Запишите, завершилась ли сессия. В Ollama документирован выход /bye; причины неожиданного завершения нужно проверять отдельно.

Отдельный важный принцип: не надо смешивать чат в облаке и локальные веса. Сервис chat.qwen.ai работает с облачными моделями, а GGUF-файлы — с локальными весами. Это разные сущности, и сравнение результатов между ними не описывает то, что происходит на вашем компьютере.

Диагностика локального запуска: клиент → файл → модель → запрос

Когда что-то не работает, идти стоит по цепочке из четырёх звеньев. Диагностика — это не наш реальный опыт запуска, а разбор по документации, что проверять на каждом уровне.

Звено «клиент». Установилось ли приложение из официального источника? Обе документации опираются на скачивание с сайтов проектов. Проверьте, что инсталлятор взят с официального адреса.

Звено «файл». Загрузились ли веса? В Ollama команда запуска скачивает модель и стартует чат. В LM Studio карточка модели на вкладке Discover нужна, чтобы загрузка действительно началась.

Звено «модель». Загружена ли выбранная модель в память? В документации LM Studio описано, что загрузка означает выделение памяти под веса и другие параметры. Если на этом шаге ошибка, следующий запрос не уйдёт.

Звено «запрос». Проверьте, что сообщение отправлено выбранной локальной модели. При отсутствии ответа изучите состояние сервера и сообщения об ошибке; длительность ожидания сама по себе причины не устанавливает.

Отдельный смежный сбой, если не работает другой ассистент, разобран в статье Copilot не работает: причины и что делать — общий метод диагностики «клиент → вход → модель → запрос» переносится и сюда.

Если нужен платный доступ к моделям из России, посмотрите Как оплатить Z AI из России: способы и инструкции — полезно как параллельный путь, но к локальному запуску GGUF он отношения не имеет.

Копируемый промпт и три варианта

Задача промпта ниже — получить осмысленную первую проверку, что модель действительно отвечает на связные вопросы.

КОД8 строк
Ты локальная текстовая модель. Ответь по правилам:
1. Один короткий абзац, не больше пяти предложений.
2. Язык ответа — русский.
3. Без списков и без форматирования.
4. Ответь: какие три признака того, что локальная модель успешно запущена?

Тема проверки: [ваша тема]
Стиль ответа: [ваш стиль]

После запуска можно проверить модель в разных режимах работы. Ниже — три вариации той же задачи: меняется только формулировка запроса.

КОД
Привет. Ответь одной строкой по-русски: сообщение получено.
КОД
Опиши в двух предложениях, как отличить этап загрузки файла модели от этапа её запуска в чате.
КОД
Задай мне три вопроса про мою задачу [ваша задача] и после моих ответов предложи короткий план действий.

Чек-лист запуска

  • Выбран один путь: Ollama или LM Studio.
  • Клиент скачан с официального сайта проекта.
  • Для Ollama: метка модели — qwen3:0.6b.
  • Для LM Studio: репозиторий — Qwen/Qwen3-0.6B-GGUF.
  • Модель загружена в клиент.
  • В LM Studio модель выбрана в загрузчике на вкладке Chat.
  • Отправлен первый запрос. Получен связный ответ на понятном языке.
  • Проверены язык ответа, длина ответа, отсутствие мусора.
  • Проверены шаблон чата и при необходимости параметры генерации.
  • Не путаются облачный чат и локальные веса.

Частые вопросы

Что такое Qwen GGUF простыми словами?
GGUF — формат файла с весами модели для локального запуска. В документации LM Studio сказано, что для локального запуска нужен доступ к весам модели, которые распространяются модель распространяется файлами с весами, в том числе в формате GGUF. Само семейство Qwen3 — набор текстовых генеративных моделей, опубликованных под лицензией apache-2.0 в репозитории Qwen/Qwen3-0.6B-GGUF.

Чем Ollama отличается от LM Studio для запуска Qwen?
Ollama запускается командой в терминале, документированный пример — ollama run qwen3:0.6b. LM Studio запускается через графическое приложение: установка, вкладка Discover, поиск и загрузка модели, вкладка Chat, загрузчик. Оба клиента работают с локальными весами, но различаются способом установки и интерфейсом.

Обязательно ли скачивать какие-то файлы вручную для LM Studio?
В документации описан штатный путь: установить приложение, перейти на вкладку Discover, найти модель и загрузить её, а затем выбрать в загрузчике на вкладке Chat. Также в документации упоминается, что в загрузчике можно выбрать уже скачанную или подгруженную вручную модель. Утверждать, что любой GGUF-файл из любой папки сработает, нельзя: источник этого не подтверждает.

Можно ли использовать chat.qwen.ai вместе с локальными весами Qwen?
Это разные сущности. Облачный чат работает с облачными моделями, а GGUF-файл — с локальными весами на вашем устройстве. Сравнивать их результаты для проверки локального запуска смысла нет, а переносить настройки между ними тоже не стоит: у облачного сервиса и локального файла разные форматы взаимодействия.

Что делать, если модель не отвечает в LM Studio?
Пройти по цепочке: клиент → файл → модель → запрос. Проверить, что приложение установлено с официального сайта; что модель скачана после перехода на вкладку Discover; что она выбрана в загрузчике на вкладке Chat; что запрос отправлен в окне чата. Если что-то на одном шаге не подтверждается, следующий шаг смысла не имеет.

Читайте также

3 материала