OMG: к генерации движений с открытым словарём с помощью смеси контроллеров

OMG: Towards Open-vocabulary Motion Generation via Mixture of Controllers
Xin Chen, Han Liang, Lan Xu, Sibei Yang, Ruonan Zhang, Sihan Ren, Yuecheng Xu, Jingyi Yu, Jiacheng Bao, Ruichi Zhang
2024-06-16

согласование эмбеддингов токенов CLIPMixture-of-Controllers (MoC) блоккросс-внимание с экспертами, специфичными для текстовых токеновмасштабный ненадписанный датасет движений (20M экземпляров)motion ControlNetгенерация движений по тексту с открытым словарембезусловная диффузионная модель (1B параметров)zero-shot генерация движений по тексту
В последнее время наблюдается значительный прогресс в реалистичной генерации движений по тексту. Тем не менее существующие методы часто терпят неудачу или порождают неправдоподобные движения для невидимых текстовых запросов, что ограничивает их применение. В этой работе мы представляем OMG — новую архитектуру, обеспечивающую убедительную генерацию движений по zero-shot запросам с открытым словарём. Наша ключевая идея — аккуратно адаптировать парадигму предварительного обучения с последующей дообучением (pretrain-then-finetune) для задачи текст→движение. На этапе предварительного обучения модель улучшает генеративные способности, изучая богатые вне-доменные присущие свойства движений. Для этого мы масштабируем большой безусловный диффузионный модель до 1 млрд параметров, используя массовые аннотированные данные движений объёмом свыше 20 млн экземпляров. На этапе дообучения мы вводим motion ControlNet, который включает текстовые подсказки в качестве условной информации через обучаемую копию предобученной модели и предложенный блок Mixture-of-Controllers (MoC). Блок MoC адаптивно распознаёт различные диапазоны субдвижений с помощью механизма cross-attention и обрабатывает их отдельно текстово-токен-специфическими экспертами. Такая схема эффективно выравнивает эмбеддинги токенов CLIP текстовых подсказок с разными диапазонами компактных и выразительных признаков движений. Широкие эксперименты демонстрируют, что OMG обеспечивает значительные улучшения по сравнению с современными методами в задаче zero-shot генерации движений по тексту. Страница проекта: https://tr3e.github.io/omg-page.
1
Широкие эксперименты показывают, что OMG значительно превосходит методы состояния искусства в zero-shot генерации движений по тексту.
2
При донастройке вводится Motion ControlNet: обучаемая копия предобученной модели в сочетании с новым блоком Mixture-of-Controllers (MoC), который учитывает текстовые подсказки.
3
OMG обеспечивает генерацию движений по тексту в режиме zero-shot для открытого словаря, адаптируя парадигму предобучение-затем-донастройка.
4
Для предобучения используется большой безусловный диффузионный модель размером до 1 млрд параметров, обученная на более чем 20 млн неподписанных экземпляров движений для изучения богатых вне-доменных черт движений.
5
Блок MoC использует кросс-аттенцию для распознавания диапазонов суб-движений и обрабатывает их экспертами, специфичными для токенов текста, выравнивая эмбеддинги CLIP с компактными выразительными признаками движений.

Система генерации движений по тексту (фреймворк OMG) для zero-shot генерации по открытому словарю текстовых подсказок

Улучшение zero-shot генерации движений по открытому словарю: предобучение большого безусловного диффузионного модел на массивных ненадписанных данных движений и дообучение через Motion ControlNet с блоком Mixture-of-Controllers, который выравнивает CLIP-эмбеддинги текстовых токенов с компактными выразительными признаками движений

Publication Details
Publication Date
2024-06-16
Journal
Publisher
ISSN
Cited by
24
Access Type
Author Information
Authors
Xin Chen
Han Liang
Lan Xu
Sibei Yang
Ruonan Zhang
Sihan Ren
Yuecheng Xu
Jingyi Yu
Jiacheng Bao
Ruichi Zhang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%