MuseGAN: Многодорожечные последовательные генеративные состязательные сети для символической генерации музыки и акомпанемента

MuseGAN: Multi-track Sequential Generative Adversarial Networks for Symbolic Music Generation and Accompaniment
Yi‐Hsuan Yang, Hao‐Wen Dong, Wen-Yi Hsiao, Li-Chia Yang
2018-04-25

MuseGANмодель композиторачеловеко-AI совместная генерация музыкигибридная модельвнутридорожечные и междорожечные объективные метрикимодель джеммингамногодорожечные последовательные генеративные состязательные сетигенерация piano-rollдатасет рок-музыкисимволическая генерация музыки
Генерация музыки имеет несколько существенных отличий от генерации изображений и видео. Во-первых, музыка — это искусство времени, требующее временной модели. Во-вторых, музыка обычно состоит из нескольких инструментов/дорожек с собственной временной динамикой, которые тем не менее взаимозависимо разворачиваются во времени. Наконец, музыкальные ноты в полифонии часто группируются в аккорды, арпеджио или мелодии, поэтому введение простого хронологического порядка нот не всегда уместно. В этой статье мы предлагаем три модели для символической многодорожечной генерации музыки в рамках генеративных состязательных сетей (GAN). Три модели, различающиеся базовыми допущениями и, соответственно, архитектурами сетей, называются jamming-модель, composer-модель и гибридная модель. Мы обучали предложенные модели на датасете из более чем ста тысяч тактов рок-музыки и применяли их для генерации piano-roll представлений пяти дорожек: бас, ударные, гитара, фортепиано и струнные. Для оценки результатов генерации, помимо субъективного пользовательского исследования, предложены несколько объективных метрик внутри дорожки и между дорожками. Мы показываем, что наши модели способны генерировать связную музыку длиной четыре такта с нуля (т.е. без человеческого ввода). Мы также расширяем модели для человек–ИИ кооперативной генерации музыки: при заданной конкретной дорожке, созданной человеком, мы можем сгенерировать четыре дополнительные дорожки для её сопровождения. Весь код, датасет и отрендеренные аудиосэмплы доступны по адресу https://salu133445.github.io/musegan/.
1
Модели расширены для сотрудничества человека и ИИ: при заданной человеческой дорожке система генерирует четыре сопровождающие дорожки.
2
Введены объективные метрики внутри-дорожечной и меж-дорожечной оценки и проведено субъективное пользовательское исследование для оценки генерируемой музыки.
3
Модели могут генерировать связную многодорожечную музыку длиной четыре такта с нуля без человеческого ввода.
4
Предложены три модели на основе GAN (jamming, composer, hybrid) для символической многодорожечной генерации музыки с различными архитектурными допущениями.
5
Модели обучены на наборе данных более 100 000 тактов рок-музыки и генерируют пианороллы из пяти дорожек (бас, ударные, гитара, пианино, струнные).

Символическая многодорожечная музыка (пианороллы пяти дорожек: бас, ударные, гитара, пианино, струнные)

Генеративное моделирование и сопровождение: создание согласованной четырёхтактной многодорожечной музыки и генерация дополнительных дорожек для человеческой партии с помощью моделей на базе GAN (jamming, composer, hybrid)

Publication Details
Publication Date
2018-04-25
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Yi‐Hsuan Yang
Hao‐Wen Dong
Wen-Yi Hsiao
Li-Chia Yang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%