RenAIssance: Обзор генерации изображений по тексту на основе ИИ в эпоху больших моделей

RenAIssance: A Survey Into AI Text-to-Image Generation in the Era of Large Model
Dacheng Tao, David A. Clifton, Zhewei Yao, Minjia Zhang, Yuxiong He, Yibo Yang, Fengxiang Bie, Zhongzhu Zhou, Adam Ghanem, Xiaoxia Wu, Connor Holmes, Pareesa Ameneh Golnari, Shuaiwen Leon Song
2024-12-27

Generative Adversarial Network (GAN)диффузионные моделиlarge language models (LLMs)масштабирование больших моделейгенерация изображений по тексту
Генерация изображений по текстовому описанию (text-to-image, TTI) относится к использованию моделей, которые обрабатывают текстовый ввод и создают высококачественные изображения на основе текстовых описаний. Истоки генерации изображений по тексту с использованием нейронных сетей прослеживаются с появлением генеративных состязательных сетей (GAN), за которыми последовали авторегрессионные трансформеры. Модели диффузии представляют собой вид генеративных моделей для синтеза изображений, которые формируют изображения путём систематического введения и удаления шума в несколько шагов. Благодаря впечатляющим результатам моделей диффузии в синтезе изображений они закрепились в качестве основного декодера изображений, используемого в текст‑в‑изображение моделях, и вывели эту область в число ключевых направлений исследований в машинном обучении (ML). В эпоху больших моделей увеличение размеров моделей и интеграция с крупными языковыми моделями дополнительно улучшили производительность TTI, что привело к генерации результатов, почти неотличимых от реальных изображений, и трансформации подходов к поиску и созданию изображений. Наше исследование показывает, что существуют дополнительные пути масштабирования моделей TTI при сочетании инновационных архитектур моделей и методов улучшения предсказаний. Мы разделили обзор на пять основных разделов, в которых подробно рассматриваем фреймворки ключевых работ для анализа различных типов методов текст‑в‑изображение. Затем мы приводим детальное сравнение и критику этих методов и предлагаем возможные направления для дальнейшего улучшения. В перспективе мы утверждаем, что развитие TTI может дать значительные приросты производительности в творческом производстве, особенно в эпоху контента, генерируемого ИИ (AIGC), и может быть расширено на более сложные задачи, такие как генерация видео и 3D.
1
Авторы указывают на возможности дальнейшего масштабирования через новые архитектуры моделей и методы улучшения предсказаний для повышения качества TTI.
2
Модели диффузии стали доминирующим декодером изображений в генерации по тексту (TTI) благодаря впечатляющим результатам синтеза изображений.
3
Масштабирование моделей и интеграция с большими языковыми моделями значительно улучшили производительность TTI, давая результаты, почти неотличимые от реальных изображений.
4
Ожидается, что достижения в TTI увеличат творческую продуктивность в эпоху AIGC и будут расширены на более сложные задачи, такие как генерация видео и 3D.
5
Обзор классифицирует литературу по TTI на пять разделов, описывая основные фреймворки, методы и архитектуры для генерации по тексту.

Модели текст→изображение (ИИ-модели, преобразующие текстовые описания в изображения)

Методы, архитектуры, масштабирование и интеграция с крупными языковыми моделями, а также качество и производительность генерируемых изображений в современных системах текст→изображение

Publication Details
Publication Date
2024-12-27
Journal
Publisher
ISSN
Cited by
54
Access Type
Author Information
Authors
Dacheng Tao
David A. Clifton
Zhewei Yao
Minjia Zhang
Yuxiong He
Yibo Yang
Fengxiang Bie
Zhongzhu Zhou
Adam Ghanem
Xiaoxia Wu
Connor Holmes
Pareesa Ameneh Golnari
Shuaiwen Leon Song
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%