RenAIssance: Обзор генерации изображений по тексту на основе ИИ в эпоху больших моделей
RenAIssance: A Survey Into AI Text-to-Image Generation in the Era of Large Model
2024-12-27
SCID: 54.1/t9zre2kq
Discuss with AI
Generative Adversarial Network (GAN)диффузионные моделиlarge language models (LLMs)масштабирование больших моделейгенерация изображений по тексту
Figures from the paper
Abstract (AI)
Генерация изображений по текстовому описанию (text-to-image, TTI) относится к использованию моделей, которые обрабатывают текстовый ввод и создают высококачественные изображения на основе текстовых описаний. Истоки генерации изображений по тексту с использованием нейронных сетей прослеживаются с появлением генеративных состязательных сетей (GAN), за которыми последовали авторегрессионные трансформеры. Модели диффузии представляют собой вид генеративных моделей для синтеза изображений, которые формируют изображения путём систематического введения и удаления шума в несколько шагов. Благодаря впечатляющим результатам моделей диффузии в синтезе изображений они закрепились в качестве основного декодера изображений, используемого в текст‑в‑изображение моделях, и вывели эту область в число ключевых направлений исследований в машинном обучении (ML). В эпоху больших моделей увеличение размеров моделей и интеграция с крупными языковыми моделями дополнительно улучшили производительность TTI, что привело к генерации результатов, почти неотличимых от реальных изображений, и трансформации подходов к поиску и созданию изображений. Наше исследование показывает, что существуют дополнительные пути масштабирования моделей TTI при сочетании инновационных архитектур моделей и методов улучшения предсказаний. Мы разделили обзор на пять основных разделов, в которых подробно рассматриваем фреймворки ключевых работ для анализа различных типов методов текст‑в‑изображение. Затем мы приводим детальное сравнение и критику этих методов и предлагаем возможные направления для дальнейшего улучшения. В перспективе мы утверждаем, что развитие TTI может дать значительные приросты производительности в творческом производстве, особенно в эпоху контента, генерируемого ИИ (AIGC), и может быть расширено на более сложные задачи, такие как генерация видео и 3D.
Key Findings
1
Авторы указывают на возможности дальнейшего масштабирования через новые архитектуры моделей и методы улучшения предсказаний для повышения качества TTI.
2
Модели диффузии стали доминирующим декодером изображений в генерации по тексту (TTI) благодаря впечатляющим результатам синтеза изображений.
3
Масштабирование моделей и интеграция с большими языковыми моделями значительно улучшили производительность TTI, давая результаты, почти неотличимые от реальных изображений.
4
Ожидается, что достижения в TTI увеличат творческую продуктивность в эпоху AIGC и будут расширены на более сложные задачи, такие как генерация видео и 3D.
5
Обзор классифицирует литературу по TTI на пять разделов, описывая основные фреймворки, методы и архитектуры для генерации по тексту.
Research Object
Модели текст→изображение (ИИ-модели, преобразующие текстовые описания в изображения)
Research Subject
Методы, архитектуры, масштабирование и интеграция с крупными языковыми моделями, а также качество и производительность генерируемых изображений в современных системах текст→изображение
Publication Details
Publication Date
2024-12-27
Journal
Publisher
ISSN
Cited by
54
Access Type
Author Information
Download PDF
Subscribe to digest