MuseGAN: Многодорожечные последовательные генеративные состязательные сети для символической генерации музыки и акомпанемента
MuseGAN: Multi-track Sequential Generative Adversarial Networks for Symbolic Music Generation and Accompaniment
2018-04-25
SCID: 54.1/7x35gxzd
Discuss with AI
MuseGANмодель композиторачеловеко-AI совместная генерация музыкигибридная модельвнутридорожечные и междорожечные объективные метрикимодель джеммингамногодорожечные последовательные генеративные состязательные сетигенерация piano-rollдатасет рок-музыкисимволическая генерация музыки
Figures from the paper
Abstract (AI)
Генерация музыки имеет несколько существенных отличий от генерации изображений и видео. Во-первых, музыка — это искусство времени, требующее временной модели. Во-вторых, музыка обычно состоит из нескольких инструментов/дорожек с собственной временной динамикой, которые тем не менее взаимозависимо разворачиваются во времени. Наконец, музыкальные ноты в полифонии часто группируются в аккорды, арпеджио или мелодии, поэтому введение простого хронологического порядка нот не всегда уместно. В этой статье мы предлагаем три модели для символической многодорожечной генерации музыки в рамках генеративных состязательных сетей (GAN). Три модели, различающиеся базовыми допущениями и, соответственно, архитектурами сетей, называются jamming-модель, composer-модель и гибридная модель. Мы обучали предложенные модели на датасете из более чем ста тысяч тактов рок-музыки и применяли их для генерации piano-roll представлений пяти дорожек: бас, ударные, гитара, фортепиано и струнные. Для оценки результатов генерации, помимо субъективного пользовательского исследования, предложены несколько объективных метрик внутри дорожки и между дорожками. Мы показываем, что наши модели способны генерировать связную музыку длиной четыре такта с нуля (т.е. без человеческого ввода). Мы также расширяем модели для человек–ИИ кооперативной генерации музыки: при заданной конкретной дорожке, созданной человеком, мы можем сгенерировать четыре дополнительные дорожки для её сопровождения. Весь код, датасет и отрендеренные аудиосэмплы доступны по адресу https://salu133445.github.io/musegan/.
Key Findings
1
Модели расширены для сотрудничества человека и ИИ: при заданной человеческой дорожке система генерирует четыре сопровождающие дорожки.
2
Введены объективные метрики внутри-дорожечной и меж-дорожечной оценки и проведено субъективное пользовательское исследование для оценки генерируемой музыки.
3
Модели могут генерировать связную многодорожечную музыку длиной четыре такта с нуля без человеческого ввода.
4
Предложены три модели на основе GAN (jamming, composer, hybrid) для символической многодорожечной генерации музыки с различными архитектурными допущениями.
5
Модели обучены на наборе данных более 100 000 тактов рок-музыки и генерируют пианороллы из пяти дорожек (бас, ударные, гитара, пианино, струнные).
Research Object
Символическая многодорожечная музыка (пианороллы пяти дорожек: бас, ударные, гитара, пианино, струнные)
Research Subject
Генеративное моделирование и сопровождение: создание согласованной четырёхтактной многодорожечной музыки и генерация дополнительных дорожек для человеческой партии с помощью моделей на базе GAN (jamming, composer, hybrid)
Publication Details
Publication Date
2018-04-25
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest