OMG: к генерации движений с открытым словарём с помощью смеси контроллеров
OMG: Towards Open-vocabulary Motion Generation via Mixture of Controllers
2024-06-16
SCID: 54.1/bexsnujn
Discuss with AI
согласование эмбеддингов токенов CLIPMixture-of-Controllers (MoC) блоккросс-внимание с экспертами, специфичными для текстовых токеновмасштабный ненадписанный датасет движений (20M экземпляров)motion ControlNetгенерация движений по тексту с открытым словарембезусловная диффузионная модель (1B параметров)zero-shot генерация движений по тексту
Figures from the paper
Abstract (AI)
В последнее время наблюдается значительный прогресс в реалистичной генерации движений по тексту. Тем не менее существующие методы часто терпят неудачу или порождают неправдоподобные движения для невидимых текстовых запросов, что ограничивает их применение. В этой работе мы представляем OMG — новую архитектуру, обеспечивающую убедительную генерацию движений по zero-shot запросам с открытым словарём. Наша ключевая идея — аккуратно адаптировать парадигму предварительного обучения с последующей дообучением (pretrain-then-finetune) для задачи текст→движение. На этапе предварительного обучения модель улучшает генеративные способности, изучая богатые вне-доменные присущие свойства движений. Для этого мы масштабируем большой безусловный диффузионный модель до 1 млрд параметров, используя массовые аннотированные данные движений объёмом свыше 20 млн экземпляров. На этапе дообучения мы вводим motion ControlNet, который включает текстовые подсказки в качестве условной информации через обучаемую копию предобученной модели и предложенный блок Mixture-of-Controllers (MoC). Блок MoC адаптивно распознаёт различные диапазоны субдвижений с помощью механизма cross-attention и обрабатывает их отдельно текстово-токен-специфическими экспертами. Такая схема эффективно выравнивает эмбеддинги токенов CLIP текстовых подсказок с разными диапазонами компактных и выразительных признаков движений. Широкие эксперименты демонстрируют, что OMG обеспечивает значительные улучшения по сравнению с современными методами в задаче zero-shot генерации движений по тексту. Страница проекта: https://tr3e.github.io/omg-page.
Key Findings
1
Широкие эксперименты показывают, что OMG значительно превосходит методы состояния искусства в zero-shot генерации движений по тексту.
2
При донастройке вводится Motion ControlNet: обучаемая копия предобученной модели в сочетании с новым блоком Mixture-of-Controllers (MoC), который учитывает текстовые подсказки.
3
OMG обеспечивает генерацию движений по тексту в режиме zero-shot для открытого словаря, адаптируя парадигму предобучение-затем-донастройка.
4
Для предобучения используется большой безусловный диффузионный модель размером до 1 млрд параметров, обученная на более чем 20 млн неподписанных экземпляров движений для изучения богатых вне-доменных черт движений.
5
Блок MoC использует кросс-аттенцию для распознавания диапазонов суб-движений и обрабатывает их экспертами, специфичными для токенов текста, выравнивая эмбеддинги CLIP с компактными выразительными признаками движений.
Research Object
Система генерации движений по тексту (фреймворк OMG) для zero-shot генерации по открытому словарю текстовых подсказок
Research Subject
Улучшение zero-shot генерации движений по открытому словарю: предобучение большого безусловного диффузионного модел на массивных ненадписанных данных движений и дообучение через Motion ControlNet с блоком Mixture-of-Controllers, который выравнивает CLIP-эмбеддинги текстовых токенов с компактными выразительными признаками движений
Publication Details
Publication Date
2024-06-16
Journal
Publisher
ISSN
Cited by
24
Access Type
Author Information
Download PDF
Subscribe to digest