GenTron: диффузионные трансформеры для генерации изображений и видео

GenTron: Diffusion Transformers for Image and Video Generation
Ping Luo, Tao Xiang, Mengmeng Xu, Shoufa Chen, Jiawei Ren, Yuren Cong, Sen He, Yanping Xie, Animesh A. Sinha, Juan-Manuel Pérez-Rúa
2024-06-16

Диффузионные трансформерыGenTronТрансформер-основанная диффузияруководство без движениягенерация текста в видео
В этом исследовании мы рассматриваем диффузионные модели на основе трансформеров для генерации изображений и видео. Несмотря на доминирование архитектур трансформеров в различных областях благодаря их гибкости и масштабируемости, в области визуальной генерации преимущественно используются сверточные (CNN) U-Net архитектуры, особенно в диффузионных моделях. Мы представляем GenTron — семейство генеративных моделей, использующих трансформерную диффузию, чтобы устранить этот разрыв. Наш первый шаг заключался в адаптации Diffusion Transformers (DiTs) от классового к текстовому кондиционированию, что включало тщательное эмпирическое исследование механизма кондиционирования. Далее мы масштабировали GenTron примерно от 900M до более чем 3B параметров, наблюдая улучшение визуального качества. Кроме того, мы расширили GenTron для текст-видео генерации, введя новый метод motion-free guidance для повышения качества видео. В человеко-ориентированных оценках против SDXL GenTron достигает 51.1% побед по визуальному качеству (при 19.8% ничьих) и 42.3% побед по соответствию тексту (при 42.9% ничьих). GenTron особенно хорошо показал себя в T2I-CompBench, что подчеркивает его способность к композиционной генерации. Мы надеемся, что GenTron внесет значимый вклад и послужит полезной отправной точкой для будущих исследований. Для наиболее актуальных результатов см. https://www.shoufachen.com/gentron_website/ и версию на arXiv: https://arxiv.org/abs/2312.04557.
1
Адаптированы Diffusion Transformers (DiTs) с класс-условия на текстовое условие через обширное эмпирическое исследование механизмов кондиционирования.
2
GenTron представляет семейство генеративных моделей на основе трансформеров с диффузией для изображений и видео, устраняя зависимость от сверточных U-Net архитектур.
3
GenTron расширён до текст-видео генерации и использует новый метод motion-free guidance для улучшения качества видео.
4
GenTron демонстрирует хорошие результаты на T2I-CompBench, показывая сильные композиционные возможности текст-в-изображение генерации.
5
По человеческим оценкам против SDXL GenTron достигает 51.1% выигрышей по визуальному качеству (19.8% ничьи) и 42.3% выигрышей по соответствию тексту (42.9% ничьи).
6
Масштабирование GenTron с ~900M до более чем 3B параметров улучшает визуальное качество, что указывает на положительное поведение при масштабировании.

Семейство генеративных моделей GenTron на основе диффузионных трансформеров для генерации изображений и видео

Использование и оценка диффузионных архитектур на базе трансформеров (масштабирование от ≈900M до >3B параметров), механизмов кондиционирования для текстовой условности и метода motion-free guidance для текст‑видео с целью улучшения визуального качества и согласованности с текстом

Publication Details
Publication Date
2024-06-16
Journal
Publisher
ISSN
Cited by
38
Access Type
Author Information
Authors
Ping Luo
Tao Xiang
Mengmeng Xu
Shoufa Chen
Jiawei Ren
Yuren Cong
Sen He
Yanping Xie
Animesh A. Sinha
Juan-Manuel Pérez-Rúa
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%