Рекомендации по проектированию промптов для генеративных моделей преобразования текста в изображение

Design Guidelines for Prompt Engineering Text-to-Image Generative Models
Vivian Liu, Lydia B. Chilton
2022-04-28

гиперпараметры моделиинженерия промптовключевые слова промптаключевые слова объекта и стилятекст-в-изображение генеративные модели
Генеративные модели преобразования текста в изображение представляют собой новый и мощный способ создания визуальных произведений искусства. Однако открытый характер текста как средства взаимодействия имеет двойственную природу: с одной стороны, пользователи могут вводить что угодно и получать доступ к бесконечному множеству вариантов генерации, а с другой — при низком качестве результатов им приходится методом перебора экспериментировать с текстовым промптом. Мы проводим исследование, посвящённое тому, какие ключевые слова в промпте и гиперпараметры модели могут способствовать получению согласованных результатов. В частности, мы изучаем промпты, структурированные с включением ключевых слов, описывающих объект и стиль, и исследуем успешные и неудачные режимы работы таких промптов. Наша оценка 5 493 результатов генерации в ходе пяти экспериментов охватывает 51 абстрактный и конкретный объект, а также 51 абстрактный и образный стиль. На основе этой оценки мы предлагаем рекомендации по проектированию, которые могут помочь пользователям получать более качественные результаты от генеративных моделей преобразования текста в изображение.
1
На основе эмпирической оценки авторы формулируют рекомендации, призванные помочь пользователям получать более качественные результаты от моделей генерации изображений по тексту.
2
Авторы изучают, как ключевые слова, описывающие объекты и стили, вместе с гиперпараметрами модели влияют на связность результатов.
3
Исследование оценивает 5 493 генерации текст-в-изображение в пяти экспериментах, охватывающих 51 абстрактный и конкретный объект, а также 51 абстрактный и фигуративный стиль.
4
Исследование выявляет успешные и неудачные режимы работы промптов, структурированных с использованием ключевых слов объекта и стиля.
5
Работа снижает необходимость перебора промптов методом проб и ошибок, предлагая эмпирически обоснованные рекомендации для взаимодействия с системами генерации изображений по тексту.

Текст-в-изображение генеративные модели

влияние ключевых слов промпта, структуры промптов с указанием объекта и стиля, а также гиперпараметров модели на согласованность результатов и успешность или неудачность генерации

Publication Details
Publication Date
2022-04-28
Journal
Publisher
ISSN
Cited by
582
Access Type
Author Information
Authors
Vivian Liu
Lydia B. Chilton
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%