Масштабируемые диффузионные модели на базе трансформеров

Scalable Diffusion Models with Transformers
Saining Xie, William Peebles
2023-10-01

Diffusion TransformersFID на ImageNet 256×256 и 512×512сложность прямого прохода Gflopsлатентная диффузиятрансформер в качестве бэкбона
Мы исследуем новый класс диффузионных моделей, основанных на архитектуре трансформера. Мы обучаем латентные диффузионные модели изображений, заменяя обычно используемый U-Net бэкенд на трансформер, работающий с латентными патчами. Мы анализируем масштабируемость наших Diffusion Transformers (DiT) с точки зрения сложности прямого прохода, измеряемой в GFLOPS. Мы обнаруживаем, что у DiT с более высоким значением GFLOPS — достигнутым за счёт увеличения глубины/ширины трансформера или увеличения числа входных токенов — последовательно ниже FID. Помимо хороших свойств масштабируемости, наши самые крупные модели DiT-XL/2 превосходят все предыдущие диффузионные модели на условных по классам бенчмарках ImageNet 512×512 и 256×256, достигая рекордного FID 2.27 для последнего.
1
Модели DiT-XL/2 превосходят все предыдущие диффузионные модели на класс-условных бенчмарках ImageNet 512×512 и 256×256, демонстрируя хорошую масштабируемость и конкурентоспособные результаты.
2
Сложность прямого прохода DiT, измеряемая в Gflops, коррелирует с качеством изображений: большие Gflops (через увеличение глубины/ширины или числа токенов ввода) последовательно дают более низкий FID.
3
Замена типичной U-Net архитектуры трансформером, работающим на латентных патчах, даёт новый класс диффузионных моделей, названных Diffusion Transformers (DiTs).
4
Крупнейшие модели DiT-XL/2 достигают передового результата на class-conditional ImageNet 256×256, обеспечивая FID 2.27.

Модели Diffusion Transformer (DiT) для латентного диффузионного моделирования изображений — трансформерные латентные диффузионные модели, работающие с латентными патчами изображений

Масштабируемость и генеративная эффективность (измеряемые через Gflops при прямом проходе и FID) трансформерных латентных диффузионных моделей в зависимости от глубины/ширины трансформера и числа входных токенов, включая достижения state-of-the-art на class-conditional ImageNet 512×512 и 256×256

Publication Details
Publication Date
2023-10-01
Journal
Publisher
ISSN
Cited by
1941
Access Type
Author Information
Authors
Saining Xie
William Peebles
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%