YuE2-3B на русском: открытая модель, которая поёт кириллицей
Открытые модели для генерации песен обычно спотыкаются на русском: текст приходится переписывать латиницей, и вокал всё равно звучит с чужим акцентом. Мы арендовали видеокарту, поставили YuE2-3B и дали ей русский текст обычными буквами — без транслита и без подсказок о языке. Ниже три трека, замеры и слепая проверка разборчивости.
Тест провели 16 сентября 2026 года на арендованной NVIDIA A40. Аренда обошлась примерно в 40 центов. Тексты песен написаны нами специально для теста.
Коротко
Кириллица работает. Текст обычными русскими буквами, без транслита. Произношение чистое, ударения на месте, иностранного акцента нет.
Разборчивость проверена машиной. Распознавание речи вслепую определило язык как русский с уверенностью 100% и вернуло текст почти дословно.
Стерео и быстро. На выходе настоящее стерео 48 кГц, а не продублированное моно. Считает быстрее реального времени, видеопамяти нужно около 9 ГБ.
Но лицензия некоммерческая. Для себя — бесплатно, включая заработок на своих треках. Компании нужно отдельно договариваться с авторами.
2 минуты 37 секунд за 118 секунд. Громкость −11,9 LUFS.
«Взлётка» — фолк-рок баллада, мужской тенор
1 минута 44 секунды за 89 секунд. Громкость −14,5 LUFS.
Как мы проверяли разборчивость
На слух себе можно простить что угодно, поэтому мы отдали готовые треки распознавателю речи вслепую — исходный текст ему не показывали. Язык он определил как русский с уверенностью 100%, а слова вернул почти дословно.
Написано против услышанного
«Как последний тёплый билет» → услышано «как последний тёплый взгляд»
«Вздох сентября и тридцать третий час» → услышано «Сдох сентября и тридцать третий час»
третий трек — распознан полностью, без расхождений
Это ошибки уровня «недослышал», а не «спел не то»: перепутаны похожие по звучанию слова, а не набор звуков вместо речи.
Цифры
Параметр
Трек 1
Трек 2
Трек 3
Длительность
2:47
2:37
1:44
Время генерации
119 с
118 с
89 с
Быстрее реального времени
1,4×
1,3×
1,2×
Корреляция левого и правого
0,86
0,91
0,61
Громкость
−13,6 LUFS
−11,9 LUFS
−14,5 LUFS
Обрыв генерации
нет
нет
нет
Корреляция каналов ниже единицы означает, что стерео настоящее, а не одна и та же дорожка в обоих ушах. Видеопамяти под нагрузкой — около 9 ГБ; веса занимают 7,3 ГБ плюс 0,5 ГБ аудио-декодер.
Чем отличается от HeartMuLa
В тот же день мы тестировали другую открытую модель — HeartMuLa 3B. Сравнение полезное, потому что видно, что именно значит «модель знает русский».
HeartMuLa 3B
YuE2-3B
Русский кириллицей
не работает
работает
Нужен транслит
да
нет
Акцент
иностранный
чистый
Каналы
моно
стерео 48 кГц
Видеопамять
~20 ГБ
~9 ГБ
Лицензия
Apache 2.0
CC BY-NC + разрешение
Получается размен: у HeartMuLa свободная лицензия, но русского она не знает. У YuE2 русский есть, но лицензия строже. Подробности по первой — в отдельном разборе.
Лицензия: читайте до того, как ставить
Это тот случай, когда лицензия важнее замеров. Веса YuE2 выложены под CC BY-NC 4.0 — «некоммерческая» — плюс отдельное разрешение авторов.
Для себя — можно. Авторы прямо разрешают личное использование и прямо пишут, что не берут отчислений с денег, которые вы заработали на созданных треках.
Компании — по договорённости. Если веса использует организация, а не человек, нужна отдельная лицензия. Публичного прайса нет, условия обсуждаются письмом.
Это не юридическая консультация. Мы пересказываем то, что написано в MODEL_LICENSE на момент теста. Условия могут измениться — проверяйте первоисточник.
Вывод
Для русского языка это первая открытая модель, которая не требует унизительных обходных путей: не нужно переписывать текст латиницей и мириться с акцентом. Качество звука — настоящее стерео, а не имитация, и считает она быстрее, чем играет. Порог входа низкий: девяти гигабайт видеопамяти хватает.
Оговорка честная: три трека — это проверка, а не бенчмарк. Мы не измеряли, как модель держит длинные формы, сложные размеры или редкие жанры, и не сравнивали её вслепую с коммерческими сервисами. Мы проверяли ровно один вопрос — поёт ли она по-русски так, чтобы слова было слышно. Ответ: поёт.
Стиль проще получить промптом
Своя модель — это видеокарта, установка и лицензия. Если нужен конкретный звук здесь и сейчас, быстрее взять готовый стилевой промпт: в каталоге они собраны по артистам и жанрам.
Да. Мы писали текст обычными русскими буквами, без латиницы и без подсказок о языке в настройках. Произношение чистое, ударения на месте, иностранного акцента нет. Это главное отличие от HeartMuLa, где кириллица давала бессмыслицу и приходилось переписывать текст латиницей.
Как вы проверяли, что слова разборчивы?
Не на слух. Готовые треки прогнали через распознавание речи Whisper large-v3 вслепую — то есть не давали ему исходный текст. Язык определился как русский с уверенностью 100%, слова вернулись почти дословно. Расхождения оказались уровня обычных ошибок распознавания на пении: «тёплый взгляд» вместо «тёплый билет».
Какая нужна видеокарта?
Под нагрузкой модель занимала около 9 гигабайт видеопамяти, так что хватит карты на 12–16 ГБ. Мы брали в аренду A40 на 48 ГБ за 0,49 доллара в час, но столько памяти не понадобилось.
Быстро ли она считает?
Быстрее реального времени в 1,2–1,4 раза: трек длиной 2 минуты 47 секунд сгенерировался за 119 секунд. Все три наших прогона уложились в минуту-две.
Можно ли использовать её коммерчески?
Не по умолчанию. Веса выложены под лицензией CC BY-NC 4.0 — «некоммерческая» — плюс отдельное разрешение авторов. Личное использование бесплатно, и авторы прямо пишут, что не берут отчислений с того, что вы заработали на своих треках. А вот использование весов компанией нужно согласовывать отдельно: публичного прайса нет, условия договорные.
Заменит ли она Suno?
Для русского языка это первая открытая модель, о которой такой вопрос вообще уместен. Но сравнивать по качеству мы не возьмёмся: три трека — это проверка, а не бенчмарк. И помните про лицензию: у Suno вы платите за подписку, здесь — договариваетесь с авторами, если речь о бизнесе.