HeartMuLa 3B на русском: тест открытой альтернативы Suno
В сообществе обсуждали открытые модели, которые умеют генерировать песни и делать каверы. Мы не стали гадать: арендовали видеокарту, поставили HeartMuLa 3B — свободную модель под лицензией Apache 2.0 — и прогнали через неё один и тот же русский текст девять раз. Ниже результат со звуком, цифрами и стоимостью.
Коротко
Русскими буквами — не работает. Четыре прогона из шести оборвались за 5–38 секунд вместо трёх минут. Единственный трек, который дошёл до конца, поёт бессмыслицу: в расшифровке вокала обрывки арабского, английского и китайского, русских слов нет вообще.
Латиницей — работает. Тот же текст в транслите дал полноценные треки, и слова узнаются на слух.
Но выговор чужой. Модель русского никогда не слышала: ударения и мягкость плывут, к концу трека её уносит в посторонние языки.
Послушайте сами
Английский текст — как модель работает «как задумано»
Контрольный прогон на их собственном примере: ровная структура, полные 2 минуты 35 секунд, теги «piano, happy».
Русский текст латиницей — рабочий обходной путь
Тот же русский текст, записанный латиницей, теги «rock, male vocal, dark, cinematic, guitar». Полные 2 минуты 29 секунд.
Что услышал распознаватель в этом треке
«Город спит на дне… Фонари тонут в тишине… Я держу твоё имя в горсти… Не гасни, не гасни, останься со мной… Poka ne ostil let od svred… Dažde je sli drogi net»
Первые строки узнаются точно, дальше выговор плывёт — это и есть тот самый акцент.
Сколько это стоит
Видеопамять: около 20 ГБ, подойдёт карта от 24 ГБ.
Скорость: примерно реальное время — две с половиной минуты музыки считаются 164 секунды.
Установка: 21 ГБ файлов модели, разворачивается за вечер.
Наш тест: полтора часа аренды, девять треков — около 75 центов.
Вывод
Для русскоязычных песен модель пока не готова: транслит с чужим акцентом — не то, ради чего стоит уходить с привычного инструмента. Но лицензия свободная, разворачивается быстро, и на английском качество приличное. Если авторы выпустят обещанную версию на 7 миллиардов параметров или появится дообучение на русском — тест займёт час, и мы его повторим.
Отдельно полезная находка: в том же наборе есть открытый распознаватель текстов песен — он разбирает русский вокал на удивление сносно, и им мы ещё займёмся.
А пока — работающие промпты
Пока открытые модели догоняют, стиль проще получить промптом. В каталоге собраны готовые стилевые промпты по артистам и жанрам.
Модель обучали на английском, китайском, японском, корейском и испанском — русского в обучении не было. Русские буквы она не распознаёт как текст песни: в четырёх прогонах из шести генерация обрывалась за 5–38 секунд, а единственный полный трек спел бессмыслицу вместо слов.
Что значит «транслит работает»?
Если тот же русский текст записать латиницей («Gorod spit na dne»), модель допевает трек до конца и слова узнаются на слух. Но выговор остаётся чужим: ударения и мягкость плывут, получается славянско-балканский акцент.
Какая нужна видеокарта?
Модель занимает около 20 ГБ видеопамяти, то есть подойдёт карта от 24 ГБ. Мы брали в аренду A40 на 48 ГБ за 0,49 доллара в час; весь тест из девяти треков обошёлся примерно в 75 центов.
Можно ли использовать её коммерчески?
Веса самой HeartMuLa выложены под Apache 2.0 — это свободная лицензия, коммерческое использование разрешено. А вот у надстройки MuLaCover, которая делает каверы, лицензия уже некоммерческая: там нужно отдельное письменное разрешение авторов.
Заменит ли она Suno?
Пока нет. По оценкам самих авторов версия на 3 миллиарда параметров уступает Suno по субъективному качеству, а для русского языка непригодна без транслита. Версия на 7 миллиардов заявлена как сопоставимая с Suno, но она ещё не выпущена.