Содержание
  1. Что такое Wan 2.1 и кто её разработал
  2. Ключевые возможности: текст в видео и image-to-video
  3. Как скачать Wan 2.1: официальный сайт, GitHub, сборки
  4. Бесплатно или платно: условия и ограничения
  5. Установка локально: требования к железу и VRAM
  6. Пошаговая инструкция запуска через ComfyUI
  7. Официальный репозиторий и веса моделей
  8. Как работает режим image to video (I2V)
  9. Сравнение с Sora, Kling и Hunyuan
  10. Типичные ошибки при установке и запуске
  11. Системные требования и оптимальные настройки
  12. Частые вопросы
Справочник

Wan 2.1 нейросеть: генерация видео от Alibaba

23 сентября 2026 · 9 минут чтения

Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 23 сентября 2026 года; цитаты источников приведены дословно. Обновлено: сентябрь 2026.

Wan 2.1 нейросеть — открытая модель генерации видео от Alibaba, вышедшая в феврале 2025 года. Она делает видео из текста (T2V) и оживляет картинки (I2V), работает локально на потребительских видеокартах и распространяется под лицензией Apache 2.0. Мы скачали топ-10 Яндекса по запросу «wan 2.1 нейросеть»: текст отдали 8 из 10.

Что такое Wan 2.1 и кто её разработал

Архитектура построена на парадигме Diffusion Transformer: по формулировке videomaker.me, Wan 2.1 использует парадигму Diffusion Transformer для создания видео высокого качества на основе текста, изображений и других данных. SkyReels добавляет, что модель работает на архитектуре VAE+DiT. Встроенный VAE, по данным wan-ai.app, обеспечивает сохранение целостности кадра и детализации. Разработчик — Alibaba. aidive.org называет Wan 2.1 моделью ИИ от Alibaba для генерации видеороликов, выпущенной в феврале 2025 года. SeaArt приводит полное имя — Wan 2.1 (Tongyi Wanxiang) от Alibaba Cloud. Модель ориентирована на мультимодальную генерацию.

Ключевые возможности: текст в видео и image-to-video

Базовый сценарий — текст в видео. По формулировке сайта wan-21.com, Wan 2.1 превращает текст в качественные видео и делает это быстро: 1 минута контента генерируется за 15 секунд. Тот же источник сообщает о поддержке разрешения до 4K и более 100 художественных стилей. SkyReels уточняет параметры: текстовые запросы превращаются в видео 1080p за 15 секунд, поддерживаются китайский и английский языки и более 100 стилей.

Второй режим — image-to-video. В обзоре videomaker.me сказано: загрузите изображение, и Wan2.1 превратит его в короткое анимированное видео. wan-ai.app перечисляет три направления: T2V (текст-в-видео), I2V (изображение-в-видео) и V2A (видео-в-аудио) с выходом в разрешении 1080p. Дополнительно модель умеет генерировать изображения из текста (T2I) и редактировать готовые ролики. По данным yeschat.ai, Wan2.1 — это не только генератор видео: доступны высококачественные изображения (T2I) и преобразование видео в аудио (V2A).

Как скачать Wan 2.1: официальный сайт, GitHub, сборки

Веса и код распространяются через открытые платформы. По данным aidive.org, Wan 2.1 скачать можно с GitHub или HuggingFace. В обзоре yeschat.ai указано, что для разработчиков и пользователей, интересующихся технической стороной генератора, инструмент доступен на GitHub. wan-ai.app сообщает, что настройка Ван 2.1 доступна на Hugging Face с модульными компонентами для конкретных случаев использования. Как устроен этот хаб и как забрать оттуда модель, разобрано в статье Как скачать модель с Hugging Face.

Помимо локальной установки, модель доступна через облачные площадки: RunComfy предлагает протестировать Wan 2.1 онлайн, wan-ai.app и videomaker.me дают бесплатный доступ на своих сайтах. Отдельная сборка под мобильные устройства и открытые веса разобрана в материале Wan AI и 4PDA.

Бесплатно или платно: условия и ограничения

Модель открытая, поэтому локальный запуск не требует подписки. Сайт wan-21.com прямо отвечает: да, сейчас Wan 2.1 можно использовать бесплатно на облачных платформах. videomaker.me подтверждает: да, Wan 2.1 можно бесплатно попробовать на сайте. yeschat.ai добавляет, что попробовать Ван 2.1 можно бесплатно без регистрации и входа.

Ограничения касаются облачных сервисов. wan-21.com указывает, что отдельная генерация ограничена 5 минутами для оптимальной производительности и справедливого использования. aidive.org сообщает о ежедневных 50 бесплатных кредитах и о том, что нейросеть генерирует видео до 5 секунд в качестве 480p. RunComfy приводит тарифы: $0.044 за секунду для 480p и $0.088 за секунду для 720p, а генерация по референсам — $0.084 за секунду при длительности 3–15 с. При числе кадров выше 81 стоимость умножается на 1.25×.

Установка локально: требования к железу и VRAM

Порог входа невысокий для открытой видеомодели. wan-ai.app сообщает: Ван 2.1 работает на потребительских GPU (минимум 8.19 ГБ VRAM) с совместимостью с RTX 4090, создавая клипы длительностью 6 секунд менее чем за 3 минуты. aidive.org уточняет, что упрощённая версия T2V-1.3B совместима практически с любыми процессорами и требует 8,19 ГБ VRAM.

Версия VRAM Время генерации Разрешение
T2V-1.3B 8,19 ГБ 5 с видео ≈ 4 минуты 480p
Стандартные настройки ≈ 12 ГБ 5 с видео 720p
T2V-14B много видеопамяти 10–15 минут и больше 720p

Пошаговая инструкция запуска через ComfyUI

ComfyUI — узловой интерфейс для локального запуска диффузионных моделей; его устройство разобрано в статье ComfyUI: что это и что требует. Порядок работы с Wan 2.1 в нём выглядит так.

  1. Заберите веса модели с Hugging Face или GitHub и положите их в папку моделей ComfyUI.
  2. Соберите граф: загрузчик чекпойнта, текстовый энкодер, сэмплер, декодер VAE, узел сохранения видео.
  3. Задайте разрешение и соотношение сторон. RunComfy рекомендует 16:9, 9:16 или 1:1 для надёжных результатов.
  4. Выставьте число кадров. По умолчанию Wan 2.1 генерирует видео длиной до 81 кадра; допустимый диапазон — от 81 до 100.
  5. Задайте частоту кадров в пределах от 5 до 24 FPS.
  6. Введите промпт и запустите генерацию.

Для режима I2V вместо текстового узла подаётся изображение. Если видеокарты не хватает, RunComfy советует воспользоваться облачной площадкой и протестировать Wan 2.1 онлайн без локальных требований.

Официальный репозиторий и веса моделей

Код и веса лежат на GitHub и Hugging Face. aidive.org: Wan 2.1 скачать можно с GitHub или HuggingFace. wan-ai.app: настройка Ван 2.1 доступна на Hugging Face с модульными компонентами под конкретные случаи. yeschat.ai: инструмент доступен на GitHub для тех, кто интересуется технической стороной.

Что именно брать: для слабых машин — T2V-1.3B, для качества — T2V-14B. RunComfy описывает 14B как модель на 14 млрд параметров с детализированным выходом в 480p и 720p. SkyReels упоминает разделение на версии Wan2.1 Pro (ориентирована на качество) и Wan2.1 Fast (оптимизирована для скорости). SkyReels также сообщает, что Alibaba Cloud откроет исходный код Wan 2.1 во втором квартале 2025 года, включая наборы данных для обучения и API-инструменты.

Как работает режим image to video (I2V)

I2V берёт статичное изображение и достраивает движение. videomaker.me описывает это так: оживите фото — просто загрузите изображение, и Wan2.1 превратит его в короткое анимированное видео. wan-ai.app относит I2V к трём базовым режимам модели наряду с T2V и V2A.

Сравнение с Sora, Kling и Hunyuan

Прямых замеров «Wan против Sora» в выжимке нет, поэтому сравнение идёт по заявленным характеристикам. SkyReels сообщает, что Wan 2.1 AI устанавливает новые стандарты с показателем 84.7% на VBench и собственной архитектурой VAE+DiT, а также лидирует на VBench. Там же сказано, что модель справляется со сложными движениями, такими как вращения фигуристов, сохраняя качество 1080p.

Сайт wan-21.com формулирует позиционирование так: Wan 2.1 выделяется исключительным качеством, скоростью и универсальностью, а другие модели могут превосходить его в отдельных областях, тогда как Wan 2.1 предлагает комплексное решение, балансирующее качество, скорость и удобство. aidive.org добавляет, что качество видео сравнивают с результатами модели Veo 2 от Google, указывая на конкурентоспособность Alibaba Wan 2.1 на рынке генеративных ИИ. SkyReels относит к сильным сторонам двуязычные текстовые эффекты и соблюдение физических законов.

Модель Что известно из выжимки
Wan 2.1 84.7% на VBench, архитектура VAE+DiT, 1080p
Veo 2 качество сравнивают с Wan 2.1
Sora, Kling, Hunyuan прямых замеров в выжимке нет

Типичные ошибки при установке и запуске

Ошибка первая — взять 14B на слабую видеокарту. RunComfy указывает, что стандартные настройки требуют около 12 ГБ VRAM, а T2V-14B требует много видеопамяти. Для машин с 8,19 ГБ VRAM есть T2V-1.3B.

Ошибка вторая — выйти за диапазон кадров. RunComfy: число кадров должно быть между 81 и 100, а частота кадров — между 5 и 24 FPS. Значения вне диапазона приведут к ошибке.

Ошибка третья — нестандартное соотношение сторон. RunComfy советует 16:9, 9:16 или 1:1 для надёжных результатов.

Ошибка четвёртая — недооценить время. SeaArt: для 720P модель 14B может занять от 10 до 15 минут и больше в зависимости от оборудования и сложности задачи. Ошибка пятая — забыть про стоимость кадров: при num_frames выше 81 цена умножается на 1.25×.

Системные требования и оптимальные настройки

Сводка требований по данным обзоров. Минимум для T2V-1.3B — 8,19 ГБ VRAM по данным aidive.org; совместимость с RTX 4090 wan-ai.app относит к Wan 2.1 в целом. Стандартные настройки — около 12 ГБ VRAM. Полная модель 14B требует много видеопамяти.

Частые вопросы

Wan 2.1 нейросеть бесплатно — это реально?

Да. Сайт wan-21.com отвечает, что сейчас Wan 2.1 можно использовать бесплатно на облачных платформах. videomaker.me подтверждает бесплатную пробу на своём сайте, yeschat.ai — бесплатный доступ без регистрации и входа. Локальный запуск открытой модели подписки не требует. Ограничения касаются облачных сервисов: aidive.org указывает 50 бесплатных кредитов в день.

Можно ли использовать Wan 2.1 в коммерческих целях?

Да. wan-21.com прямо отвечает: видео, созданные Wan 2.1, можно использовать в коммерческих целях. Модель выпущена с открытым исходным кодом под лицензией Apache 2.0, что снимает ограничения на коммерческое применение. Исследователи и энтузиасты, по данным videomaker.me, используют возможности модели в академических и коммерческих проектах.

Как установить Wan 2.1 локально?

Скачайте веса с GitHub или Hugging Face, положите их в папку моделей ComfyUI и соберите граф генерации. Минимальный порог — 8,19 ГБ VRAM для версии T2V-1.3B, стандартные настройки требуют около 12 ГБ. Задайте соотношение сторон 16:9, 9:16 или 1:1, число кадров от 81 до 100 и частоту от 5 до 24 FPS. При нехватке видеокарты доступен облачный запуск.

Какая версия Wan 2.1 пойдёт на RTX 4090?

На RTX 4090 берут T2V-1.3B: aidive.org даёт ей порог 8,19 ГБ VRAM, SeaArt — 5-секундное видео в 480P примерно за 4 минуты. Отметку 6 секунд менее чем за 3 минуты wan-ai.app приводит для Wan 2.1 без указания версии. Полная модель T2V-14B требует много видеопамяти и даёт 720p за 10–15 минут и больше.

Как сделать видео из картинки в Wan 2.1?

Загрузите изображение, и модель превратит его в короткое анимированное видео — так описывает режим videomaker.me. I2V входит в три базовых режима модели наряду с T2V и V2A. Модель сохраняет координацию тела и точность движений даже в сложных сценах, а система освещения корректирует тени и цветовой баланс. Для локального запуска режим собирается в ComfyUI подачей изображения вместо текстового узла.

Ещё один обзор бесплатных видеогенераторов — в материале Топ бесплатных нейросетей для генерации видео.

Читайте также

3 материала