Журналист The Atlantic Алекс Рейснер раскрыл масштабы серого обучения музыкальных нейросетей, обнаружив четыре гигантские базы на миллионы треков, скачанные в обход правил YouTube и Spotify. В эти базы данных без разрешения попали треки мировых звезд и инди-артистов, что ставит под угрозу права авторов и доходы музыкальной индустрии.
Журналист издания The Atlantic Алекс Рейснер опубликовал масштабное расследование, раскрывающее объёмы данных, на которых обучаются современные музыкальные нейросети. Поводом для разбора стал недавний случай на соревнованиях, где фигуристы выступили под трек, созданный ИИ. Песня содержала легко узнаваемые строчки из хита 1998 года группы New Radicals, но была переделана в стиле стадионного рока.
Подобные совпадения не случайны — ИИ-генераторы склонны копировать защищённый контент. В судебных исках против Suno лейблы привели десятки примеров, когда нейросеть выдавала треки, практически идентичные хитам Майкла Джексона, Эда Ширана или Чака Берри. Руководство стартапа ссылается на защитные алгоритмы и заявляет, что прямое копирование «не должно происходить», но секреты обучения моделей не раскрывает.
В ходе расследования были обнаружены четыре гигантских датасета, которые свободно распространяются в ИИ-сообществе. Самый крупный из них содержит 12 миллионов треков (для его прослушивания человеку потребовался бы 91 год), второй — 9 миллионов, а два поменьше — более чем по 100 тысяч песен. В эти базы данных попали работы Taylor Swift, Nirvana, Billie Eilish и The Beatles, а также десятки тысяч инди-исполнителей.
Как устроен процесс бесконтрольного сбора данных?
- Сбор данных в обход правил. Три из четырёх найденных датасетов распространяются в виде списков ссылок на платформы YouTube и Spotify. Разработчики используют автоматизированные инструменты для скачивания аудио в обход рекламы и систем монетизации, напрямую нарушая правила использования сервисов.
- Эксплуатация бесплатных архивов. Четвёртый датасет состоит из базы Free Music Archive (FMA). Ранее Google и Stability уже описывали использование этой платформы для обучения своих моделей. При этом коммерческое использование треков с FMA по правилам требует покупки лицензии.
- Прецеденты в индустрии. Ранее Google обучала свою модель на 44 миллионах треков, а OpenAI использовала базу из 1,2 миллиона песен для модели Jukebox, создающей вариации существующей музыки. Suno в судебных документах также признала, что скачивала из интернета практически все доступные файлы приемлемого качества.
Технологические компании защищают свои действия доктриной «добросовестного использования» (fair use). Но правообладатели и авторы не согласны. Например, когда руководство Free Music Archive попыталось обсудить с Google вопросы согласия и компенсации, компания сослалась на общую политику конфиденциальности, фактически отказавшись от диалога.
Ситуация усугубляется тем, что ИИ-треки наводняют стриминги. Spotify сообщил об удалении 75 миллионов спам-треков, а Deezer — что почти половина ежедневных загрузок создана ИИ. В то же время Sony обнаружила 135 тысяч ИИ-треков, ошибочно приписанных реальным артистам.
В ответ на бесконтрольный сбор данных некоторые авторы начинают защищаться технически. Музыкант и блогер Бенн Джордан в своём видео рассказал о софте для «отравления» нейросетей. Исследования подтверждают, что добавление в аудиофайлы неслышимого шума действительно способно значительно ухудшить качество работы ИИ-моделей.
⚡️ Присоединяйтесь к нашему закрытому сообществу в Max.
Ещё больше полезного и оперативного контента я публикую в своих Telegram-каналах. Присоединяйтесь к обсуждению!
mudi — всё о дистрибуции, работе с площадками и последних новостях. Подписаться →
mishas tips — инсайты, аналитика и разбор трендов всей музыкальной индустрии. Подписаться →
Музыкальный ИИ — слежу за тем, как искусственный интеллект меняет музыку прямо сейчас. Подписаться →