Мир ИИ

MiniMax открыла веса музыкальной модели на пять минут песни

MiniMax открыла веса музыкальной модели на пять минут песни

13 августа MiniMax опубликовала веса Music 3.0 — модели примерно на 11,1 млрд параметров, которая по тексту песни и описанию звучания выдаёт законченный трек до пяти минут: вокал, аранжировку и сведение за один проход. Выход — стерео 32 кГц, 16 бит. Веса выложены на Hugging Face, GitHub и ModelScope, поддержка в ComfyUI появилась в тот же день. Внутри модель составная: восьмимиллиардная часть, инициализированная из Qwen3-8B, держит структуру песни на всю длину, а маленькая на 0,6 млрд восстанавливает акустические детали внутри каждого кадра. Аудиомоделей в каталоге KeyDealer нет, и эта статья не про доступ к ним у нас. Она про то, почему генерация целой песни устроена сложнее, чем кажется, и когда за это вообще стоит браться самому.

Почему целая песня — трудная задача

Разберём, отчего это подавали как достижение, а не как очередной релиз.

Сгенерировать десять секунд звука несложно: модель держит в голове небольшой фрагмент и делает его связным. Проблемы начинаются на длине.

Структура. У песни есть форма: куплет, припев, переход, повтор припева. Припев должен звучать как тот же самый припев, а не похоже на него. Это память на минуты, а не на секунды.

Идентичность голоса. Вокал на третьей минуте должен принадлежать тому же исполнителю, что и на первой. Модель, которая генерирует посекундно, легко уплывает — тембр меняется незаметно, но к концу это другой человек.

Согласование слоёв. Барабаны, бас, гармония и вокал должны находиться в одном темпе и в одной тональности всю дорогу. Расхождение в доли секунды слышно сразу.

Отсюда и составная архитектура. Большая часть работает с длинной структурой — что происходит в песне и куда она движется. Маленькая отвечает за то, чтобы каждый конкретный кусок звучал детально и чисто. Разделение труда: одна помнит форму, другая обеспечивает качество.

Подход перекликается с тем, что мы разбирали в открытой видеомодели LTX, где отдельные потоки для картинки и звука обмениваются информацией во время генерации. Идея общая: сложную задачу разбивают на части, работающие в разных масштабах.

Что с лицензией

Пункт, на который стоит смотреть раньше, чем на качество.

Веса опубликованы под собственной лицензией MiniMax-Music3 Community License. Это не Apache 2.0 и не MIT.

Разницу мы уже разбирали, когда выходили Qwen 3.8 27B под Apache 2.0 и веса DeepSeek V4 под MIT. Свободные лицензии не ограничивают коммерческое использование, не требуют раскрывать производные и не ставят условий по масштабу бизнеса. Собственные лицензии вендоров обычно содержат хотя бы одно ограничение из этого списка.

Что именно ограничивает конкретно эта лицензия, должен смотреть ваш юрист — мы не даём юридических заключений. Но общее правило простое: читать лицензию надо до того, как продукт собран, а не после. Выяснять условия, когда генерация уже встроена в сервис и работает у клиентов, — худший момент из возможных.

Отдельная деталь, которую отметили обозреватели: в этом релизе, в отличие от предыдущего, нет территориальных ограничений. Значит в прошлый раз были — и это лишний повод проверять условия каждый раз заново, а не переносить вывод с прошлой версии.

Что значит «за один проход»

Формулировка встречается в описании постоянно, и стоит объяснить, почему это важнее, чем звучит.

Традиционный способ собрать сгенерированную песню — конвейер из нескольких моделей. Одна пишет мелодию, вторая синтезирует вокал по тексту, третья добавляет инструменты, четвёртая сводит. Каждый шаг работает с результатом предыдущего и не знает замысла целиком.

Проблема такого конвейера не в качестве отдельных шагов, а в том, что накапливается рассогласование. Вокал синтезирован под одну ритмическую сетку, аранжировка легла на слегка другую, сведение пытается это примирить. Слушатель не назовёт причину, но услышит, что «звучит собранно из кусков».

Генерация за один проход означает, что модель держит все слои одновременно и они рождаются из общего представления о песне. Вокал попадает в долю не потому, что его подогнали, а потому что он и создавался вместе с ритмом.

Побочный эффект тоже стоит знать: править результат сложнее. В конвейере можно перегенерировать только вокал, оставив аранжировку. Здесь песня выходит целиком, и правка означает новую генерацию — иногда с совсем другим результатом. Для творческой работы это существенное ограничение, о котором в анонсах обычно не пишут.

Как это меняет рынок стоковой музыки

Небольшое наблюдение за пределами технической части.

Фоновая музыка для роликов, подкастов и презентаций — это устоявшийся рынок с библиотеками, лицензиями и подписками. Его ценность держалась на двух вещах: наличии каталога и юридической чистоте использования.

Открытые веса бьют по первой опоре, но не по второй. Сгенерировать трек становится дёшево, а вот вопрос о том, на чём обучалась модель и не всплывёт ли претензия, остаётся открытым — и с собственной лицензией вендора он не закрывается, а лишь переносится на вас.

Отсюда практичное для тех, кто делает контент на поток: экономия на стоковой подписке может обернуться риском, который считать сложнее, чем ежемесячный платёж. Если ролики коммерческие и идут в рекламу, юридическую чистоту стоит ценить выше стоимости трека.

Музыка отдельно от текста и картинок

Полезно понимать, чем аудиогенерация отличается экономически.

Проверка результата долгая. Картинку видно сразу, текст читается по диагонали. Песню надо прослушать, и оценить её за пять секунд нельзя. Это меняет цикл работы: перебрать двадцать вариантов текста — минуты, двадцать вариантов песни — почти два часа только на прослушивание.

Права сложнее. У музыки многослойные права, и вопрос о том, на чём модель обучалась, здесь звучит острее, чем в других модальностях. Тема стала заметнее буквально на этой неделе, когда выяснилось, куда физически уезжают книги, скупаемые для обучения.

Спрос неровный. Музыка нужна эпизодически: под ролик, под рекламу, под фон. Постоянного потока, который окупает своё железо, у большинства не бывает.

Последний пункт и определяет практический ответ на вопрос, разворачивать ли веса у себя.

Когда браться самому, а когда нет

Развилка та же, что и с видеомоделями, и цифры в ней жёстче, чем в тексте.

Разворачивать веса имеет смысл, если музыка нужна потоком и постоянно, если материал нельзя отдавать во внешний сервис, или если вам нужна собственная донастройка под узнаваемое звучание.

Брать готовый сервис имеет смысл, если треки нужны эпизодически. Видеокарта стоит денег каждый день, а не только в те часы, когда вы что-то генерируете. Простой железа — самая недооценённая статья в подобных расчётах.

Для типичной задачи «нужно несколько треков в месяц под ролики» ответ очевиден и не в пользу собственной установки. Ровно для этого сценария у нас есть отдельный сервис TrendMix: генерация контента без разворачивания весов и покупки железа, оплата по факту.

Чего мы не утверждаем

Мы не тестировали модель. Все характеристики — из публикаций, перечисленных в источниках.

Не оцениваем качество звучания. Субъективные оценки без прослушивания на своём материале не значат ничего, а прослушать мы не могли.

Не даём юридических заключений по лицензии. Отмечаем только, что она собственная, а не свободная, и что условия надо читать.

Аудиомоделей в каталоге нет. На 18 августа там 41 позиция: текстовые семейства и генерация изображений. Сроков появления аудио мы не называем.

Не знаем требований к железу. Заявленный размер модели даёт лишь грубый ориентир; реальные требования зависят от квантизации и длины генерируемого трека.

Что держать в голове

MiniMax открыла веса модели, которая делает законченную песню до пяти минут за один проход, с составной архитектурой: большая часть держит структуру, маленькая отвечает за детали звука.

Практический вывод — про лицензию и про экономику. Лицензия здесь собственная, а не свободная, и это надо проверять до сборки продукта. А своё железо под музыку окупается только при ровной постоянной нагрузке, которой у большинства задач просто нет.

Как мы отделяем проверенное от предполагаемого — на странице о проекте. Текстовые модели и генерация изображений — по одному ключу: keydealer.ru/login.

Частые вопросы

Что умеет MiniMax Music 3.0?

Генерировать законченную песню длиной до пяти минут за один проход: вокал, аранжировку и сведение. На вход подаются текст песни и описание нужного звучания. Выход — стерео 32 кГц, 16 бит.

Веса действительно открыты?

Да, опубликованы 13 августа 2026 года на Hugging Face, GitHub и ModelScope. Но под собственной лицензией MiniMax-Music3 Community License, а не под Apache 2.0 или MIT.

Насколько модель большая?

Около 11,1 млрд параметров. Внутри две части: 8-миллиардная модель отвечает за структуру песни, 0,6-миллиардная восстанавливает акустические детали.

Есть ли аудиомодели в каталоге KeyDealer?

Нет. На 18 августа 2026 года в каталоге 41 позиция: текстовые модели и генерация изображений. Аудио мы не отдаём.

Что делать, если нужна музыка, но не хочется разворачивать веса?

Использовать готовый сервис. Для контента под соцсети у нас есть TrendMix, где генерация уже развёрнута.

Источники