Игорь Градов
Игорь Градов
6 мин
ai

MiniMax выпустила нейросеть для генерации музыки с открытыми весами: песни до 5 минут на одной GPU

Китайская компания MiniMax 13 августа 2026 года выпустила MiniMax Music3, нейросеть для генерации музыки с открытыми весами (open weights), которая создаёт готовые песни длиной до пяти минут по текстовому описанию и тексту песни.

MiniMax выпустила нейросеть для генерации музыки с открытыми весами: песни до 5 минут на одной GPU
Почему это важно

Впервые открытая музыкальная модель выдаёт полноценный трек со словами и аранжировкой за одну генерацию, а не фрагмент на 30 секунд, и запускается на одной видеокарте с 8 ГБ памяти.

До сих пор нейросети для генерации музыки онлайн работали преимущественно через закрытые API (интерфейс для подключения к сервису) с поминутной оплатой: Suno, Udio, собственный сервис MiniMax. Открытые альтернативы либо генерировали короткие инструментальные отрывки, либо требовали серверного оборудования. MiniMax Music3, как сообщает Marktechpost, выложена с кодом для запуска, весами модели и тремя готовыми способами развёртывания в день релиза, что делает её пригодной для коммерческого использования, а не только для исследований.

Что Когда Кто выпустил Цена
MiniMax Music3, модель генерации песен по тексту 13 августа 2026 MiniMax (Китай) Бесплатно, открытые веса. Коммерческое использование разрешено с указанием «MiniMax-Music3» в интерфейсе продукта. При годовой выручке от продуктов на базе модели свыше 20 млн долларов нужно отдельное письменное разрешение от MiniMax

Что умеет MiniMax Music3?

  • Полная песня до 5 минут за одну генерацию. На выходе файл WAV, стерео, 32 кГц, 16 бит. Не отрывок, не лупы (зацикленные фрагменты), а трек с куплетами, припевом, бриджем и аутро.
  • Два отдельных входа. Первый вход принимает текст песни с разметкой секций: [Verse], [Chorus], [Bridge], [Instrumental], [Solo], [Outro] и другие. Второй вход принимает описание музыки: жанр, темп, вокальные характеристики, аранжировка. Модель также поставляется с утилитой music-caption-rewriter, которая разворачивает короткое описание в полный структурированный промпт (текстовую инструкцию для нейросети).
  • Работает на русском. Текст песни принимается на русском языке, что позволяет генерировать песни с русскоязычным вокалом.
  • Три способа запуска с разным порогом входа. От двух видеокарт для серверного решения до одной карты с 8 ГБ видеопамяти через ComfyUI (визуальный редактор для работы с нейросетями).

Как устроена архитектура?

Модель состоит из двух частей. Первая, Hybrid-LM, это связка двух языковых моделей: большая на 8 млрд параметров (Global LLM) отвечает за структуру и длинные музыкальные фразы, малая на 0,6 млрд параметров (Local LLM) добавляет акустические детали внутри каждого кадра.

Вторая часть, синтезатор звука на 2,4 млрд параметров, работает по принципу flow matching (метод непрерывного преобразования шума в звук). Он получает не дискретные токены, а непрерывные скрытые состояния обеих языковых моделей и превращает их в звук через Flow-VAE (декодер на 123 млн параметров, унаследованный от модели MiniMax Speech).

По данным модельной карточки, большая языковая модель инициализирована из Qwen3-8B, хотя исследовательский пост MiniMax указывает Qwen3.5-8B. Точная базовая модель пока не уточнена.

Как попробовать?

  1. ComfyUI (от 8 ГБ видеопамяти). Установите ComfyUI, загрузите готовый шаблон Text to Music и перепакованные веса в форматах FP16 или INT8 от Comfy-Org. Это путь с минимальным порогом входа для тех, кто предпочитает визуальный интерфейс без кода.
  2. Diffusers (от 22 ГБ видеопамяти, от 8 ГБ с offloading). Модульный пайплайн через библиотеку diffusers. При полной загрузке нужно около 24 ГБ, с автоматической выгрузкой на процессор (CPU offload) хватает 22 ГБ, а с пошаговой выгрузкой отдельных слоёв (leaf-level group offloading) модель помещается в 8 ГБ.
  3. SGLang-Omni (две видеокарты). Серверное решение для продакшена. Первая карта обрабатывает языковую модель и авторегрессивную генерацию, вторая занимается flow matching и декодированием звука. Документация, веса и код выложены на Hugging Face и GitHub.

Есть ли аналоги в России?

Прямого российского аналога с открытыми весами для генерации полных песен пока нет. Сервис «Сбера» GigaChat и YandexGPT работают с текстом, а не с музыкой. Для генерации фоновой музыки российские авторы чаще используют зарубежные онлайн-сервисы Suno и Udio, но оба работают через закрытый API с платной подпиской и не предоставляют весов для локального запуска.

MiniMax Music3, в отличие от них, можно запустить на своём оборудовании, не зависеть от подписки и не отправлять данные на сторонний сервер. Для авторов из РФ это существенно: генерация происходит локально, без ограничений по региону.

Мнение редакции dzen.guru

Я вижу в этом релизе два практических сдвига.

Первый: нейросеть для генерации музыки перестала быть сервисом с ежемесячной подпиской. Открытые веса означают, что вы платите только за электричество и железо. Для автора Дзена, которому нужен фон к видео, это разница между «50 долларов в месяц за Suno Pro» и «бесплатно на своей карте».

Второй: поддержка русского языка в тексте песни. По моим наблюдениям, большинство открытых музыкальных моделей до сих пор обрабатывали только английский текст, а русский вокал звучал как набор фонем. Здесь стоит проверить лично: качество русского вокала в генеративных моделях пока нестабильно, и MiniMax не публикует бенчмарков по языкам.

Оговорка: лицензия требует указывать «MiniMax-Music3» в интерфейсе вашего продукта. Если выручка от продукта на базе модели превысит 20 млн долларов в год, потребуется отдельное разрешение. Для подавляющего большинства авторов и небольших студий это несущественно, но знать об этом нужно до запуска.

Что сделать сегодня. Если у вас есть видеокарта с 8 ГБ памяти и установлен ComfyUI, скачайте шаблон и попробуйте сгенерировать фоновый трек для своего следующего ролика. Напишите текст на русском с тегами [Verse] и [Chorus], задайте жанр и темп. Результат сравните с тем, что выдаёт Suno по аналогичному промпту: так вы поймёте, стоит ли переходить на локальную генерацию.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Фоновая музыка к видео без оплаты подписки и без риска страйка за авторские права. Генерируйте треки локально и используйте коммерчески, не забывая об атрибуции в описании.

Маркетологу и рекламщику. Джинглы, звуковые логотипы, фоны для подкастов и рекламных роликов можно прототипировать за минуты. Это сокращает этап «ищем стоковую музыку или заказываем у композитора» до «генерируем и согласовываем».

Предпринимателю и разработчику в РФ. Модель запускается локально, не требует обращения к зарубежным API, не зависит от санкционных ограничений на платёжные системы. Три задокументированных пути развёртывания позволяют встроить генерацию музыки в продукт: от мобильного приложения для фитнеса до платформы для электронного обучения.

Частые вопросы

Можно ли использовать сгенерированные треки в коммерческих проектах?

Да, лицензия MiniMax-Music3 Community License разрешает коммерческое использование. Два условия: указать «MiniMax-Music3» на видном месте в интерфейсе продукта и получить письменное разрешение от MiniMax, если годовая выручка от продуктов на базе модели превысит 20 млн долларов.

Какая видеокарта нужна для запуска?

Минимальный вариант через ComfyUI с перепакованными весами INT8 работает от 8 ГБ видеопамяти. Через diffusers с выгрузкой слоёв на процессор тоже хватает 8 ГБ. Серверный вариант через SGLang-Omni требует двух видеокарт CUDA.

Генерирует ли модель только инструментал или песни с вокалом?

Модель генерирует полные песни с вокалом. Текст песни передаётся отдельным входом с разметкой секций. Для чисто инструментальных треков предусмотрен тег [Instrumental].

Открытая нейросеть для генерации музыки, которая выдаёт пятиминутный трек с вокалом на русском, запускается на карте за 20 тысяч рублей и не требует подписки: если вы до сих пор платили за музыкальные API, сегодня стоит хотя бы протестировать альтернативу.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент изнутри: ByteDance довела долю ускоренных задач с 27 % до 97 %
ai

Что такое ИИ-агент изнутри: ByteDance довела долю ускоренных задач с 27 % до 97 %

Автор Дзена или маркетолог, который слышит «ИИ-агент» по десять раз на дню, но до сих пор не понимает, как именно такой агент устроен изнутри и чем отличается…

7 мин
OCR-нейросеть docTR распознаёт русские счета локально и бесплатно: пошаговая настройка
ai

OCR-нейросеть docTR распознаёт русские счета локально и бесплатно: пошаговая настройка

Документооборот в России по-прежнему держится на бумаге и сканах: счета-фактуры, акты, накладные приходят картинками, и ручной перенос реквизитов в учётную…

7 мин
Groq AI привлекла $350 млн, но потеряла половину оценки: бывший конкурент Nvidia стал её клиентом
ai

Groq AI привлекла $350 млн, но потеряла половину оценки: бывший конкурент Nvidia стал её клиентом

Groq AI привлекает 350 млн долларов, но теперь работает на чипах Nvidia, а не против них: бывший конкурент стал клиентом, и это история про ловушку зависимости…

4 мин