GenTron: диффузионные трансформеры для генерации изображений и видео
GenTron: Diffusion Transformers for Image and Video Generation
2024-06-16
SCID: 54.1/syp3huy5
Discuss with AI
Диффузионные трансформерыGenTronТрансформер-основанная диффузияруководство без движениягенерация текста в видео
Figures from the paper
Abstract (AI)
В этом исследовании мы рассматриваем диффузионные модели на основе трансформеров для генерации изображений и видео. Несмотря на доминирование архитектур трансформеров в различных областях благодаря их гибкости и масштабируемости, в области визуальной генерации преимущественно используются сверточные (CNN) U-Net архитектуры, особенно в диффузионных моделях. Мы представляем GenTron — семейство генеративных моделей, использующих трансформерную диффузию, чтобы устранить этот разрыв. Наш первый шаг заключался в адаптации Diffusion Transformers (DiTs) от классового к текстовому кондиционированию, что включало тщательное эмпирическое исследование механизма кондиционирования. Далее мы масштабировали GenTron примерно от 900M до более чем 3B параметров, наблюдая улучшение визуального качества. Кроме того, мы расширили GenTron для текст-видео генерации, введя новый метод motion-free guidance для повышения качества видео. В человеко-ориентированных оценках против SDXL GenTron достигает 51.1% побед по визуальному качеству (при 19.8% ничьих) и 42.3% побед по соответствию тексту (при 42.9% ничьих). GenTron особенно хорошо показал себя в T2I-CompBench, что подчеркивает его способность к композиционной генерации. Мы надеемся, что GenTron внесет значимый вклад и послужит полезной отправной точкой для будущих исследований. Для наиболее актуальных результатов см. https://www.shoufachen.com/gentron_website/ и версию на arXiv: https://arxiv.org/abs/2312.04557.
Key Findings
1
Адаптированы Diffusion Transformers (DiTs) с класс-условия на текстовое условие через обширное эмпирическое исследование механизмов кондиционирования.
2
GenTron представляет семейство генеративных моделей на основе трансформеров с диффузией для изображений и видео, устраняя зависимость от сверточных U-Net архитектур.
3
GenTron расширён до текст-видео генерации и использует новый метод motion-free guidance для улучшения качества видео.
4
GenTron демонстрирует хорошие результаты на T2I-CompBench, показывая сильные композиционные возможности текст-в-изображение генерации.
5
По человеческим оценкам против SDXL GenTron достигает 51.1% выигрышей по визуальному качеству (19.8% ничьи) и 42.3% выигрышей по соответствию тексту (42.9% ничьи).
6
Масштабирование GenTron с ~900M до более чем 3B параметров улучшает визуальное качество, что указывает на положительное поведение при масштабировании.
Research Object
Семейство генеративных моделей GenTron на основе диффузионных трансформеров для генерации изображений и видео
Research Subject
Использование и оценка диффузионных архитектур на базе трансформеров (масштабирование от ≈900M до >3B параметров), механизмов кондиционирования для текстовой условности и метода motion-free guidance для текст‑видео с целью улучшения визуального качества и согласованности с текстом
Publication Details
Publication Date
2024-06-16
Journal
Publisher
ISSN
Cited by
38
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai8
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
LLaMA: открытые и эффективные базовые языковые модели2023
PaLM: Масштабирование языкового моделирования с помощью Pathways2022
Масштабируемые диффузионные модели на базе трансформеров2023
Масштабирование Vision Transformer2022
ImageNet: крупномасштабная иерархическая база изображений2009