Содержание
  1. Что такое Qwen3-TTS и что именно вы запускаете
  2. Где проверить условия доступа и доступность функции
  3. Документированный порядок установки и запуска
  4. Пример синтеза и критерии проверки результата
  5. Чем отличаются режимы и варианты задачи
  6. Что делать при типичной проблеме
  7. Частые вопросы
Гайды

Qwen3 TTS: как запустить по документации

9 октября 2026 · 10 минут чтения

Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 9 октября 2026 года; цитаты источников приведены дословно. Обновлено: октябрь 2026.

Qwen3 TTS как запустить: установите Python-пакет qwen-tts, выберите модель семейства Qwen3-TTS-12Hz (0.6B или 1.7B) и вызовите её через Python API или локальный Web UI. Это открытая серия моделей синтеза речи от команды Qwen в Alibaba Cloud, вышедшая 22 января 2026 года. Ниже — документированный порядок действий из официального репозитория QwenLM и то, что стоит проверить до установки. Мы скачали подборку результатов веб-поиска по запросу «qwen3 tts как запустить»: текст отдали 7 из 10.

Что такое Qwen3-TTS и что именно вы запускаете

В официальном репозитории QwenLM на GitHub серия описана так: выпущена серия Qwen3-TTS с широкими возможностями генерации речи, включая клонирование голоса, его дизайн, высококачественное человекоподобное воспроизведение и управление голосом на естественном языке. Там же указано, что модели покрывают 10 основных языков, включая русский, и поддерживают управление тоном, темпом и эмоцией через инструкции.

Релиз датирован 22 января 2026 года: выпущена серия Qwen3-TTS с вариантами 0.6B и 1.7B на основе Qwen3-TTS-Tokenizer-12Hz. То есть запускается не одна модель, а набор вариантов под разные задачи.

Три режима, которые различает документация:

  • Custom Voice — синтез с готовым голосом из набора и управлением стилем через инструкцию.
  • Voice Design — голос описывается словами, отдельного образца не нужно.
  • Voice Clone (Base) — клонирование по короткому аудио пользователя.

Модели различаются не только режимом, но и числом параметров. Ниже — таблица из официального README с ключевыми характеристиками.

Модель Что делает Языки Стриминг Инструкции
Qwen3-TTS-12Hz-1.7B-VoiceDesign Голос по описанию пользователя 10 языков, включая русский Да Да
Qwen3-TTS-12Hz-1.7B-CustomVoice Управление стилем, 9 готовых тембров 10 языков, включая русский Да Да
Qwen3-TTS-12Hz-1.7B-Base Клон голоса по 3 секундам аудио, база для дообучения 10 языков, включая русский Да —
Qwen3-TTS-12Hz-0.6B-CustomVoice 9 готовых тембров 10 языков, включая русский Да —
Qwen3-TTS-12Hz-0.6B-Base Клон голоса по 3 секундам аудио 10 языков, включая русский Да —

Выбор сводится к двум вопросам: нужен ли готовый голос или клон, и хватает ли ресурсов под 1.7B. Младшая 0.6B покрывает те же языки и режимы, кроме Voice Design.

Отдельно стоит помнить про токенизатор: Qwen3-TTS-Tokenizer-12Hz кодирует входную речь в коды и декодирует их обратно в речь. Он нужен для режимов с аудио на входе.

Где проверить условия доступа и доступность функции

До установки стоит убедиться в трёх вещах: есть ли совместимое железо, доступны ли веса модели и подходит ли режим под задачу.

Железо. Документация рекомендует FlashAttention 2 для снижения расхода памяти GPU. Там же оговорено, что FlashAttention 2 применим только при загрузке модели в torch.float16 или torch.bfloat16. Если на машине меньше 96 ГБ RAM и много ядер CPU, сборка идёт с ограничением параллельных задач: MAX_JOBS=4 pip install -U flash-attn --no-build-isolation. Web UI умеет работать и без GPU: в примерах документации есть запуск qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --device cpu.

Веса. Модели скачиваются автоматически при загрузке в пакете qwen-tts или в vLLM. Если качать во время работы неудобно, README даёт ручные команды — через ModelScope (рекомендовано для материкового Китая) или через Hugging Face. Обе ветки скачивают один и тот же набор: токенизатор и пять моделей 12Hz.

Режим. Voice Design доступен только в 1.7B. Клонирование требует аудио от 3 секунд и текстовой расшифровки этого аудио. Готовые голоса Custom Voice — это 9 тембров с описаниями, среди них Vivian, Serena, Uncle_Fu, Dylan, Eric, Ryan, Aiden, Ono_Anna, Sohee. Рекомендация из README: для лучшего качества использовать родной язык говорящего, хотя технически каждый голос говорит на любом поддерживаемом языке.

Доступность из России. Веса лежат на Hugging Face и ModelScope, а демо — на Hugging Face Spaces и ModelScope Studios. Официальный README эти площадки называет как основные точки входа. Доступность конкретных доменов из РФ зависит от вашего провайдера — проверьте перед скачиванием.

Документированный порядок установки и запуска

Порядок ниже — из раздела Quickstart официального репозитория. Он же повторяется в документации Web UI Demo.

Шаг 1. Отдельное окружение Python 3.12. README прямо просит свежее изолированное окружение, чтобы не конфликтовать с уже установленными пакетами:

ТЕРМИНАЛ
conda create -n qwen3-tts python=3.12 -y
conda activate qwen3-tts

Шаг 2. Установка пакета. Самый быстрый путь — из PyPI:

ТЕРМИНАЛ
pip install -U qwen-tts

Если вы собираетесь править код, README предлагает установку из исходников в редактируемом режиме: git clone, затем pip install -e ..

Шаг 3. FlashAttention 2 (по желанию). Снижает расход памяти GPU:

ТЕРМИНАЛ
pip install -U flash-attn --no-build-isolation

Шаг 4. Запуск Web UI. Документация Web UI Demo описывает команду qwen-tts-demo. Проверить доступные опции можно так:

ТЕРМИНАЛ
qwen-tts-demo --help

Запуск конкретной модели:

ТЕРМИНАЛ
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-0.6B-CustomVoice

Шаг 5. Python API. Для скриптов README даёт импорт Qwen3TTSModel из пакета qwen_tts. Веса указываются либо как id на Hugging Face, либо как локальный путь к скачанной папке. Все функции generate_* принимают дополнительные параметры генерации из Hugging Face Transformers, например max_new_tokens и top_p.

Шаг 6. vLLM (для серверного режима). Документация vLLM-Omni описывает запуск TTS через OpenAI-совместимый эндпоинт POST /v1/audio/speech командой vllm serve <model> --omni. В списке поддерживаемых моделей указаны Qwen/Qwen3-TTS-12Hz-1.7B-{CustomVoice,VoiceDesign,Base}. Для Qwen3-TTS там отмечены пресеты голосов и загрузка через /v1/audio/voices.

Пример синтеза и критерии проверки результата

Минимальный пример из README для Custom Voice: загрузка модели, вызов generate_custom_voice с текстом, языком, говорящим и необязательной инструкцией, запись результата в WAV через soundfile.

Ключевые параметры вызова:

  • text — строка или список строк для пакетной генерации;
  • language — явный код языка; Auto или пропуск включают автоопределение;
  • speaker — имя голоса из списка модели;
  • instruct — необязательная инструкция по стилю.

Проверить, какие голоса и языки поддерживает загруженная модель, можно методами model.get_supported_speakers() и model.get_supported_languages().

Для Voice Design вызов другой — generate_voice_design с текстом и описанием голоса на естественном языке. Для клонирования используется Base-модель и аудио от 3 секунд.

  1. Язык распознан верно — если указали Russian, звучит русская речь.
  2. Голос соответствует выбранному тембру или описанию.
  3. Инструкция по стилю сработала: смена тона или эмоции слышна.
  4. Длинный текст не обрывается и не «съедает» окончания.
  5. Ударения в спорных словах расставлены так, как нужно.

Пятый пункт — отдельная тема. В разборе aipolezno.ru сказано, что у официального пакета нет документированного надёжного способа вручную задавать ударения. Автор советует добавить контекст или переформулировать проблемное слово; результат нужно прослушать самостоятельно.

Чем отличаются режимы и варианты задачи

Разница между режимами — в том, откуда берётся голос и что попадает на вход модели.

Режим Вход Модель Когда подходит
Custom Voice Текст + имя голоса; инструкция для 1.7B. 1.7B или 0.6B CustomVoice Готовый голос; инструкция для 1.7B.
Voice Design Текст + описание голоса словами Только 1.7B VoiceDesign Голоса ещё нет, нужен «на заказ»
Voice Clone Аудио 3+ сек + расшифровка + новый текст 1.7B или 0.6B Base Нужен конкретный существующий голос

Отдельно стоит развести способы запуска. Локальный Web UI — интерактивная песочница на вашей машине. Python API — встраивание в скрипт. vLLM — серверный режим с OpenAI-совместимым эндпоинтом. DashScope — облачный API Alibaba, отдельная ветка документации.

Ещё одно измерение — размер модели. 1.7B даёт доступ к Voice Design и инструкциям, 0.6B покрывает Custom Voice и клонирование. На слабой машине разумнее начать с 0.6B и CPU-режима, а 1.7B пробовать после того, как базовый запуск заработал.

Смежные задачи, которые решает тот же стек: пакетная генерация списка строк за один вызов, сохранение голоса в файл для повторного использования в Web UI, дообучение Base-модели на своих данных.

Что делать при типичной проблеме

Документация Web UI Demo и русскоязычный разбор на aipolezno.ru перечисляют похожий набор сбоев. Ниже — что проверять, без обещаний, что именно у вас сломано.

qwen-tts-demo: command not found. Пакет не установился или окружение не активировано. Проверьте, что pip install -U qwen-tts прошёл в том же окружении, где вы запускаете команду.

Ошибка FlashAttention. README оговаривает два условия: совместимое железо и загрузка модели в torch.float16 или torch.bfloat16. Если сборка падает на машине с малым объёмом RAM, помогает ограничение параллельных задач через MAX_JOBS=4. FlashAttention не обязателен — без него модель загрузится, но займёт больше памяти GPU.

CUDA не найдена или закончилась память. Проверьте драйвер и доступность GPU. Как временный обход документация показывает запуск на CPU: --device cpu. Это медленнее, но позволяет проверить, что сам пайплайн работает.

Нет режима клонирования. Клонирование живёт в Base-моделях. Если запущена CustomVoice, вкладки клонирования не будет — переключите модель на Qwen3-TTS-12Hz-1.7B-Base или 0.6B-Base.

Микрофон недоступен с другого компьютера. В документации Web UI Demo для Base-модели требуется HTTPS: без него современные браузеры блокируют запись с микрофона. Там приведена настройка HTTPS с файлами cert.pem и key.pem, включая пример самоподписанного сертификата на 365 дней. Если не открывается сама страница, отдельно проверьте адрес прослушивания и правила межсетевого экрана.

Не тот язык на выходе. Укажите язык явно вместо Auto. README советует задавать целевой язык, если он известен.

Скачивание весов зависает. README предлагает ручную загрузку через ModelScope или Hugging Face CLI в локальную папку, а затем указание этого пути вместо id модели.

Частые вопросы

Как запустить Qwen3 TTS на своём компьютере?

Создайте окружение Python 3.12, установите пакет qwen-tts через pip, затем запустите qwen-tts-demo с именем нужной модели. Для скриптов используйте импорт Qwen3TTSModel из пакета qwen_tts. Полный порядок описан в Quickstart официального репозитория QwenLM.

Какая модель нужна для русского языка?

Все модели серии 12Hz поддерживают русский: он входит в список 10 основных языков официального README. Для готовых голосов берите CustomVoice, для клонирования — Base, для голоса по описанию — VoiceDesign в версии 1.7B. Рекомендация README про родной язык говорящего касается качества.

Чем 1.7B отличается от 0.6B?

Число параметров определяет доступные режимы и требования к железу. Voice Design и управление через инструкции есть только в 1.7B. Обе версии поддерживают 10 языков и стриминг. На слабой машине 0.6B запускается быстрее и может работать на CPU.

Как поставить ударение в русском слове?

Документированного надёжного способа вручную задавать ударения в официальном пакете разбор aipolezno.ru не называет. Автор предлагает добавить контекст или переформулировать проблемное слово. После генерации прослушайте результат: исправление ударения не гарантировано.

Можно ли запустить Qwen3 TTS без GPU?

Да, документация Web UI Demo приводит пример запуска с флагом --device cpu. В этом режиме FlashAttention не используется, а генерация идёт медленнее. Для проверки пайплайна и коротких текстов этого достаточно.

Если вы работаете с другими моделями Qwen, пригодятся материалы блога: промты для Qwen с готовыми запросами, локальный чат через Ollama и LM Studio и разбор лимитов Qwen. Для перевода текстов перед озвучкой есть отдельная статья про Qwen перевод.

Читайте также

3 материала