Крупномасштабное контрастивное предварительное обучение на языково-аудиоданных слиянием признаков и расширением данных от ключевых слов к подписям
Large-Scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
2023-05-05
SCID: 54.1/5y5sm7gx
Discuss with AI
LAION-Audio-630Kконтрастивное предобучение языка и аудиослияние признаковаугментация ключевое слово–подписьпоиск аудио по тексту
Figures from the paper
Abstract (AI)
Контрастивное обучение продемонстрировало значительные успехи в области мультимодального обучения представлений. В данной работе мы предлагаем конвейер контрастивного предварительного обучения на языково-аудиоданных для формирования аудиопредставления путем объединения аудиоданных с описаниями на естественном языке. Для достижения этой цели сначала мы выпускаем LAION-Audio-630K — крупную коллекцию из 633 526 пар «аудио–текст», полученных из различных источников данных. Во-вторых, мы создаем модель контрастивного предварительного обучения на языково-аудиоданных с использованием различных аудио- и текстовых энкодеров. В архитектуру модели мы включаем механизм слияния признаков и расширение данных путем преобразования ключевых слов в подписи, что позволяет обрабатывать аудиовходы переменной длины и дополнительно повышает производительность. В-третьих, мы проводим всесторонние эксперименты для оценки модели по трем задачам: поиск аудио по тексту, классификация аудио в режиме обучения без примеров и классификация аудио с учителем. Результаты показывают, что наша модель превосходит другие методы в задаче поиска аудио по тексту. В задачах классификации аудио модель демонстрирует наилучшие опубликованные результаты в режиме обучения без примеров и достигает показателей, сопоставимых с результатами моделей в режиме, не являющемся zero-shot. LAION-Audio-630K1 и предложенная модель2 находятся в открытом доступе.
Key Findings
1
Слияние признаков позволяет обрабатывать аудиовходы переменной длины, а дополнение «ключевые слова–описание» предназначено для повышения качества модели.
2
Модель достигает передовых результатов в классификации аудио без обучения на целевых классах и показывает качество, сопоставимое с моделями обучения с учителем в обычном режиме.
3
Предложена модель контрастивного предварительного обучения языка и аудио, объединяющая настраиваемые аудио- и текстовые кодировщики с механизмами слияния признаков и дополнения «ключевые слова–описание».
4
Модель демонстрирует превосходные результаты в задаче поиска аудио по тексту по сравнению с оценёнными альтернативами.
5
Авторы выпускают общедоступный набор данных LAION-Audio-630K, содержащий 633 526 пар аудио–текст, собранных из различных источников.
Research Object
модели контрастивного предобучения на языково-аудиоданных и создаваемые ими аудиопредставления, обученные на крупномасштабных парах аудио–текст
Research Subject
эффективность и характеристики аудиопредставлений при обработке аудио переменной длительности, поиске аудио по тексту, а также классификации аудио в режимах zero-shot и с учителем
Publication Details
Publication Date
2023-05-05
Journal
Publisher
ISSN
Cited by
423
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest