Масштабируемые диффузионные модели на базе трансформеров
Scalable Diffusion Models with Transformers
2023-10-01
SCID: 54.1/wt8aehuj
Discuss with AI
Diffusion TransformersFID на ImageNet 256×256 и 512×512сложность прямого прохода Gflopsлатентная диффузиятрансформер в качестве бэкбона
Figures from the paper
Abstract (AI)
Мы исследуем новый класс диффузионных моделей, основанных на архитектуре трансформера. Мы обучаем латентные диффузионные модели изображений, заменяя обычно используемый U-Net бэкенд на трансформер, работающий с латентными патчами. Мы анализируем масштабируемость наших Diffusion Transformers (DiT) с точки зрения сложности прямого прохода, измеряемой в GFLOPS. Мы обнаруживаем, что у DiT с более высоким значением GFLOPS — достигнутым за счёт увеличения глубины/ширины трансформера или увеличения числа входных токенов — последовательно ниже FID. Помимо хороших свойств масштабируемости, наши самые крупные модели DiT-XL/2 превосходят все предыдущие диффузионные модели на условных по классам бенчмарках ImageNet 512×512 и 256×256, достигая рекордного FID 2.27 для последнего.
Key Findings
1
Модели DiT-XL/2 превосходят все предыдущие диффузионные модели на класс-условных бенчмарках ImageNet 512×512 и 256×256, демонстрируя хорошую масштабируемость и конкурентоспособные результаты.
2
Сложность прямого прохода DiT, измеряемая в Gflops, коррелирует с качеством изображений: большие Gflops (через увеличение глубины/ширины или числа токенов ввода) последовательно дают более низкий FID.
3
Замена типичной U-Net архитектуры трансформером, работающим на латентных патчах, даёт новый класс диффузионных моделей, названных Diffusion Transformers (DiTs).
4
Крупнейшие модели DiT-XL/2 достигают передового результата на class-conditional ImageNet 256×256, обеспечивая FID 2.27.
Research Object
Модели Diffusion Transformer (DiT) для латентного диффузионного моделирования изображений — трансформерные латентные диффузионные модели, работающие с латентными патчами изображений
Research Subject
Масштабируемость и генеративная эффективность (измеряемые через Gflops при прямом проходе и FID) трансформерных латентных диффузионных моделей в зависимости от глубины/ширины трансформера и числа входных токенов, включая достижения state-of-the-art на class-conditional ImageNet 512×512 и 256×256
Publication Details
Publication Date
2023-10-01
Journal
Publisher
ISSN
Cited by
1941
Access Type
Author Information
Download PDF
Subscribe to digest