Обновлено: август 2026. Материал редакции Зерокодера.

Stable Audio — генератор музыки и звуковых эффектов по текстовому описанию от Stability AI, той же компании, что сделала Stable Diffusion. Актуальная версия — Stable Audio 3.0, представленная 20 мая 2026 года: семейство из четырёх моделей, треки длиной больше шести минут, стерео 44,1 кГц, три модели из четырёх выложены с открытыми весами и запускаются на своём железе.

Четыре уточнения, без которых остальной разбор читается неверно:

  • Версий уже четыре. 1.0 осенью 2023-го, 2.0 в апреле 2024-го, 2.5 в сентябре 2025-го и 3.0 в мае 2026-го. Ограничение в 45 секунд на бесплатном тарифе и 90 секунд на платном — это условия анонса 13 сентября 2023 года, и к сегодняшним моделям они отношения не имеют.
  • Stable Audio — это не один сервис, а линейка моделей. Small SFX, Small, Medium и Large различаются размером, максимальной длиной трека и способом доступа: младшие скачиваются, старшая доступна через API Stability AI.
  • Веса открыты, но не для всех сценариев бесплатно. Stability AI Community License разрешает коммерческое использование, пока годовая выручка компании не превысила 1 млн долларов; выше этого порога нужна корпоративная лицензия.
  • Обучающий набор расширился и изменился по составу. К стоковой библиотеке AudioSparx добавились записи с Freesound под лицензиями Creative Commons — в карточке модели перечислены и источники, и способ фильтрации защищённого материала.

Что это

Stable Audio создаёт аудио с нуля по текстовому промту: жанр, инструменты, настроение, темп — и на выходе готовая композиция в стерео 44,1 кГц. Логика та же, что у генераторов картинок: латентная диффузия, только вместо пикселей — звуковая волна.

Проект вырос из исследований лаборатории Harmonai внутри Stability AI и с самого начала строился вокруг лицензионных данных. Это главный аргумент компании в спорах с музыкальной индустрией: обучающий материал куплен или взят под свободной лицензией, а на корпоративном тарифе Stability AI даёт юридическую защиту по претензиям к сгенерированному аудио.

Если нужен обзор рынка генераторов звука целиком — у нас есть материал про генерацию музыки и звукового сопровождения нейросетями.

Stable Audio — интерфейс генерации музыки по текстовому описанию

ОНЛАЙН-ПРАКТИКУМ
ЗАПУСК нейросети DEEPSEEK R1 ЛОКАЛЬНО НА СВОЕМ КОМПЬЮТЕРЕ
ЧТО БУДЕТ НА ОБУЧЕНИИ?
  • ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
  • Где и как применять? Потестируем модель после установки на разных задачах
  • Как дообучить модель под себя?

Stable Audio 3.0: четыре модели под разные задачи

Как выбрать модель Stable Audio 3.0 под свою задачу
Как выбрать модель Stable Audio 3.0 под свою задачу

Главная перемена третьей версии — вместо одной флагманской модели вышло семейство. Stability AI назвала его так: Small SFX для звуковых эффектов, Small для полноценной композиции на устройстве, Medium с более высокой музыкальностью и длинными треками, Large для платформ и продуктов с большим объёмом генераций. По описанию компании младшая пара работает с треками до двух минут, а Medium и Large — больше шести минут.

В официальном репозитории проекта параметры сведены в таблицу — вот она в переводе:

Модель Параметров Максимум аудио Где запускается
Small-Music 433 млн 120 секунд CPU, в том числе Mac
Small-SFX 433 млн 120 секунд CPU, в том числе Mac
Medium 1,4 млрд 380 секунд GPU (CUDA)
Large 2,7 млрд 380 секунд только через API

380 секунд — это 6 минут 20 секунд, то есть длина обычной песни с запасом. Для сравнения: версия 2.0 упиралась в три минуты, а на старте в 2023-м бесплатный трек ограничивался 45 секундами, платный — 90.

Веса Small SFX, Small и Medium выложены на Hugging Face под Stability AI Community License. Large остаётся закрытой и доступна через API Stability AI. Открытые модели рассчитаны на потребительское железо: в карточке Medium заявлена генерация меньше чем за 2 секунды на H200 и «меньше нескольких секунд» на MacBook Pro M4.

Источник этой скорости — способ дообучения. В версии 2.5 Stability AI применила метод ARC — Adversarial Relativistic-Contrastive, состязательное дообучение поверх диффузионной модели без дистилляции. Оно сократило число шагов вывода, поэтому трек на три минуты стал генерироваться меньше чем за две секунды на GPU. Третья версия унаследовала этот подход, добавив к нему новый автоэнкодер.

Что именно изменилось между 2.5 и 3.0 в интерфейсе веб-приложения, мы разбирали в отдельной статье — что нового в Stable Audio 2.5.

Что умеет

Генерировать музыку и звук по тексту. Базовый режим: описание на английском плюс желаемая длительность — на выходе стерео 44,1 кГц. Модели покрывают и музыку, и звуковые эффекты, причём под эффекты выделена отдельная лёгкая модель Small SFX.

Переделывать загруженное аудио. Режим audio-to-audio появился в версии 2.0: вы загружаете свой сэмпл и текстом объясняете, во что его превратить. Наигранная на телефоне мелодия становится основой аранжировки.

Править отдельный кусок трека. Инпейнтинг — то, чего в старых обзорах Stable Audio нет вообще. Stability AI перечисляет три сценария: правка одного сегмента, правка нескольких сегментов и причинное продолжение — достройка аудио за пределы исходной точки окончания. Практический смысл: не перегенерировать всю композицию из-за неудачных восьми тактов в середине.

Достраивать короткую запись. Продолжение работает и как отдельная задача: из фрагмента на несколько секунд модель разворачивает полноценный трек, опираясь на контекст загруженного.

Дообучаться на своей библиотеке. Корпоративное направление, которое Stability AI начала с версии 2.5: модель дообучают на звуковой библиотеке компании, чтобы генерации попадали в фирменное звучание бренда. Для этого же выпущена документация по обучению LoRA поверх открытых моделей.

Работать в коммерческих проектах. Права на выход остаются у пользователя, а обучение на лицензионных данных снимает основной риск претензий. На корпоративной лицензии Stability AI отдельно оговаривает юридическую защиту.

Дальше вопрос смещается к тому, куда девать результат. Про площадки и схемы у нас есть разбор — как зарабатывать на своей музыке.

Как писать промт

Порядок блоков промта по руководству Stability AI
Порядок блоков промта по руководству Stability AI

Stability AI опубликовала собственное руководство по промтам, и его структура заметно отличается от привычной по генераторам картинок. Компания предлагает порядок из пяти блоков: сначала жанр и стиль, затем ключевые инструменты, потом настроение, дальше конкретные детали и в конце дополнительные указания.

Внутри руководства выделены три обязательных кирпича промта: жанр или стиль, темп в ударах в минуту и общее настроение. Про настроение отдельная просьба — брать слова точнее: «euphoric» вместо «happy», «melancholic» вместо «sad».

Ориентиры по темпу компания даёт такие:

  • 60–80 BPM — баллады и блюз;
  • 80–100 BPM — R&B и хаус;
  • 100–120 BPM — поп и рок;
  • 120–140 BPM — диско и техно;
  • 140–160 BPM — дабстеп и метал.

К трём кирпичам добавляются музыкальные детали: ведущий инструмент, поддерживающие партии (бас, струнные, фортепиано), ритм-секция, текстуры вроде падов и реверберации, характер продакшена — студийный, lo-fi, винтажный, сырой. Из продвинутых приёмов руководство советует давать треку название, указывать географию, называть конкретный сценарий использования и ссылаться на эпоху — например, «80s gated reverb».

Пример промта из официального руководства выглядит так: «A relaxing Bossa Nova instrumental, perfect for an elevator. The mood is smooth, patient, and relaxing, 115 BPM». Никаких скобок, весов и служебных символов — обычное предложение, где каждое слово несёт параметр.

Как обучали нейросеть

Первая версия училась на сделке со стоковым поставщиком AudioSparx: более 800 тысяч аудиофайлов с музыкой, звуковыми эффектами и текстовыми метаданными, суммарно свыше 19 500 часов записей. В версии 2.0 набор от AudioSparx сохранился, а у артистов была возможность отказаться от участия в обучении.

К третьей версии набор вырос и стал смешанным. В карточке Stable Audio 3.0 Medium указано 1 278 902 записи: 806 284 из библиотеки AudioSparx и 472 618 с Freesound под лицензиями CC-0, CC-BY и CC-Sampling+. Защищённый авторским правом материал отфильтровывали музыкальным тегером PANNs. Отсюда и формулировка Stability AI «обучено на полностью лицензионных данных». Для коммерческого пользователя это конкретное основание положить трек в рекламный ролик.

Технические подробности

Все версии Stable Audio построены на латентной диффузии — том же семействе моделей, что и Stable Diffusion. Звук сначала сжимается в компактное латентное представление, диффузионная модель работает уже там, и только на выходе латент разворачивается обратно в волну. Отсюда и скорость: считать шумоподавление на нескольких сотнях мегабайт стереозвука напрямую было бы неподъёмно.

В первых версиях сборка была узнаваемой по картиночным моделям: вариационный автоэнкодер (VAE), текстовый кодировщик и диффузионная модель на архитектуре U-Net. Третья версия эту схему пересобрала. По описанию исследователей Stability AI, в её основе — новый семантико-акустический автоэнкодер, который проецирует аудио в компактное латентное пространство; в репозитории указана размерность латента 256. Диффузионная часть перешла на трансформер, а поверх неё лёг состязательный этап дообучения — тот самый, что дал скорость.

Заявленные цифры вывода: меньше 2 секунд на GPU H200 и «меньше нескольких секунд» на MacBook Pro M4. Модель поддерживает переменную длину генерации и инпейнтинг, то есть точечное редактирование и продолжение коротких записей.

Требования к железу различаются по моделям. Малые (433 млн параметров) считаются на процессоре, включая Mac. Medium (1,4 млрд) требует GPU с CUDA, причём в репозитории отдельно оговорено, что для неё нужна Flash Attention 2. Под разные платформы собраны разные бэкенды: CUDA и TensorRT для H200 и H100, MLX и CoreML для Apple Silicon, TFLite для кроссплатформенного запуска. Large (2,7 млрд) локально не запускается вообще — только через API.

Практический вывод для того, кто выбирает: если нужен звук на своём железе и без интернета, ваш потолок — Medium. Если нужна максимальная музыкальность и генерация потоком под продукт, придётся идти в API или корпоративную лицензию.

Архитектура Stable Audio: латентная диффузия

Сколько стоит

Четыре способа доступа к Stable Audio и их цена
Четыре способа доступа к Stable Audio и их цена

К третьей версии у Stable Audio четыре разных способа доступа, и денег они стоят по-разному.

Открытые веса — бесплатно, с порогом по выручке. Small SFX, Small и Medium выложены под Stability AI Community License. Её условие Stability AI формулирует прямо: использование базовых моделей бесплатно для всех, кроме случая, когда модели применяются в коммерческих целях, а годовая выручка организации превышает 1 млн долларов. Исследователи, разработчики, малый бизнес и авторы с выручкой ниже этой планки не платят ничего и могут распространять модели. Запрет один: на этих моделях и их выходах нельзя строить конкурирующие базовые архитектуры — файнтюны и LoRA при этом разрешены.

API Stability AI. Единственный способ получить Stable Audio 3.0 Large: старшая модель весами не выкладывалась.

Корпоративная лицензия. Нужна, когда выручка перешагнула миллион долларов, когда модель разворачивается на своей инфраструктуре или когда нужна юридическая защита по претензиям — Stability AI указывает её как часть корпоративного соглашения. Сюда же относится дообучение на звуковой библиотеке заказчика.

Подписка на веб-приложении. Витрина stableaudio.com с самого запуска работает по схеме «бесплатный уровень плюс Pro»: в анонсе сентября 2023-го бесплатный тариф ограничивался 45 секундами, а Pro описан как треки по 90 секунд с правом скачивания для коммерческих проектов. Сумму подписки в самом анонсе Stability AI не называла: цены компания держит на отдельной странице веб-приложения.

Слово «бесплатно» здесь значит другое, чем у большинства конкурентов: бесплатны сами веса. Модель скачивается на ваше железо и работает там без счётчика генераций. Про то, как вообще устроены бесплатные уровни у нейросетей, у нас есть разбор про бесплатные нейросети.

Тарифы и способы доступа к Stable Audio

Как запустить Stable Audio у себя

Открытые модели лежат на Hugging Face, код запуска — в официальном репозитории Stability AI. Установка идёт через пакетный менеджер uv, есть три набора зависимостей: только Python-API, вариант с интерфейсом на Gradio и вариант для обучения LoRA. Локальный веб-интерфейс поднимается одной командой — uv run python run_gradio.py --model medium.

Что важно проверить до запуска: у Medium в зависимостях Flash Attention 2, без неё модель не заработает. Малые модели рассчитаны на процессор, поэтому им хватит обычного ноутбука; на Mac предусмотрены сборки под CoreML и MLX. Технические условия перечислены в карточке Stable Audio 3.0 Medium на Hugging Face — там же состав обучающего набора и текст лицензии.

Что изменилось с 2023 года

Хронология по официальным анонсам Stability AI:

  • 13 сентября 2023 — Stable Audio 1.0. Латентная диффузия, музыка 44,1 кГц, обучение на библиотеке AudioSparx. Бесплатный уровень — до 45 секунд, Pro — треки по 90 секунд со скачиванием для коммерческих проектов.
  • 3 апреля 2024 — Stable Audio 2.0. Полные треки со связной структурой до трёх минут в стерео 44,1 кГц. Появился режим audio-to-audio: загруженный сэмпл превращается в другой звук по текстовой команде. Модель открыли для бесплатного использования на сайте.
  • 10 сентября 2025 — Stable Audio 2.5. Дообучение методом ARC, вывод меньше двух секунд на GPU для треков до трёх минут, инпейнтинг с опорой на загруженное аудио. Доступ через веб-приложение, API Stability AI и партнёрские площадки fal, Replicate и ComfyUI.
  • 20 мая 2026 — Stable Audio 3.0. Четыре модели, длина больше шести минут, правка одного и нескольких сегментов, причинное продолжение. Три модели из четырёх — с открытыми весами; подробности в анонсе Stability AI.

Из хронологии виден темп: примерно раз в год у Stable Audio менялись и потолок длины трека, и способ доступа к модели. Поэтому обзоры старше года описывают инструмент с другими ограничениями — связка «VAE плюс CLAP плюс U-Net» и набор из 19 500 часов относятся к 2023-му.

Кому подходит и где предел

Stable Audio заточен под прикладной звук: подложка под ролик, фоновая петля для игры, звуковой эффект, джингл, музыка для подкаста. Отдельная модель под SFX и режим правки сегментов — признаки того, что Stability AI целится в продакшен, где трек вписывают в готовый монтаж под уже смонтированный кадр.

Предел тоже понятен. Вокала в описании возможностей нет — модели работают с инструментальным материалом, и по этой части Stable Audio проигрывает генераторам песен с голосом. Промты в официальном руководстве англоязычные, все примеры построены на английской терминологии жанров и инструментов. Открытые веса дают независимость от сервиса, но старшая модель под них не попала, так что максимальное качество остаётся за API.

Если задача шире одного инструмента — собрать звуковую дорожку для подкаста или подобрать набор под саунд-дизайн, — посмотрите наш обзор семи AI-инструментов для саунд-дизайна и подкастов.

Частые вопросы

Сколько стоит Stable Audio? Зависит от способа доступа. Веса моделей Small SFX, Small и Medium скачиваются бесплатно под Stability AI Community License: она бесплатна для всех, кроме организаций, которые используют модели коммерчески и зарабатывают больше 1 млн долларов в год. Старшая модель Large доступна только через API Stability AI. Веб-приложение stableaudio.com работает по подписке с бесплатным уровнем и платным Pro.

Можно ли продавать музыку, сгенерированную в Stable Audio? Да. Community License разрешает коммерческое использование и распространение моделей до порога в 1 млн долларов годовой выручки; выше него нужна корпоративная лицензия. Отдельный аргумент для рекламы и клиентских проектов — обучение на лицензионных данных: в корпоративное соглашение Stability AI включает юридическую защиту.

Какой длины трек можно сгенерировать? До 120 секунд на малых моделях и до 380 секунд, то есть 6 минут 20 секунд, на Medium и Large. В версии 2.5 потолок составлял три минуты.

Можно ли запустить Stable Audio на своём компьютере? Да, три модели из четырёх выложены с открытыми весами на Hugging Face. Small и Small SFX по 433 млн параметров считаются на процессоре, включая Mac. Medium на 1,4 млрд параметров требует GPU с CUDA и Flash Attention 2. Заявленная скорость — меньше 2 секунд на H200 и меньше нескольких секунд на MacBook Pro M4. Large локально не запускается.

Чем Stable Audio 3.0 отличается от 2.5? Вместо одной модели вышло семейство из четырёх — Small SFX, Small, Medium и Large. Потолок длины вырос с трёх минут до 380 секунд у старших моделей. Появились правка одного и нескольких сегментов и причинное продолжение аудио за пределы исходной точки окончания. Три модели впервые отдали с открытыми весами под Stability AI Community License.

Как писать промт для Stable Audio? Официальное руководство Stability AI предлагает порядок из пяти блоков: жанр и стиль, ключевые инструменты, настроение, конкретные детали, дополнительные указания. Обязательными названы три элемента — жанр, темп в BPM и настроение, причём настроение рекомендуют описывать точными словами вроде «euphoric» или «melancholic». Пример из руководства: «A relaxing Bossa Nova instrumental, perfect for an elevator. The mood is smooth, patient, and relaxing, 115 BPM».

Stable Audio и Stable Diffusion — это одно и то же? Это разные модели одной компании, Stability AI, построенные на общем принципе латентной диффузии: данные сжимаются в латентное пространство, там же идёт шумоподавление, и только потом результат разворачивается обратно. Stable Diffusion работает с изображениями, Stable Audio — со звуком. Приёмы промтинга у них при этом разные: у аудио свои обязательные параметры вроде темпа.

Про генерацию картинок у нас собраны отдельные лайфхаки по Stable Diffusion.

На чём обучали Stable Audio 3.0? В карточке модели Medium указано 1 278 902 записи: 806 284 из библиотеки AudioSparx и 472 618 с Freesound под лицензиями CC-0, CC-BY и CC-Sampling+. Защищённый авторским правом материал отфильтровали музыкальным тегером PANNs.

РОССИЙСКИЕ НЕЙРОСЕТИ ДЛЯ ЖИЗНИ И КАРЬЕРЫ В 2025
Присоединяйся к онлайн-вебинару.
В прямом эфире разберем и потестируем лучшие на сегодняшний день отечественные ИИ!
Вы узнаете о том:
  • Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
  • Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
  • Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
Участвовать бесплатно
ОБЗОРНЫЙ ПРАКТИКУМ ПО НАШУМЕВШИМ НЕЙРОСЕТЯМ
Нейросети DEEPSEEK И QWEN
За 2 часа сделаем полный обзор новых мощных ИИ-моделей, которые бросают вызов нейросети ChatGPT
Вы узнаете:
  • Возможность получить Доступ в Нейроклуб на целый месяц
  • Как ИИ ускоряет работу и приносит деньги
  • За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Участвовать бесплатно