Visual ChatGPT: общение, рисование и редактирование с использованием визуальных базовых моделей

Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models
Chenfei Wu, Shengming Yin, Weizhen Qi, Xiaodong Wang, Zecheng Tang, Nan Duan
2023-03-08

Stable DiffusionVisual ChatGPTвизуальные трансформерывизуальное редактированиевизуальные базовые модели
ChatGPT привлекает междисциплинарный интерес, поскольку предоставляет языковой интерфейс с выдающимися возможностями ведения диалога и рассуждения в различных областях. Однако, поскольку ChatGPT обучен на языковых данных, в настоящее время он не способен обрабатывать изображения визуального мира или генерировать их. В то же время визуальные базовые модели, такие как Vision Transformer и Stable Diffusion, несмотря на высокие возможности визуального понимания и генерации, являются экспертами лишь в выполнении конкретных задач с фиксированными входными и выходными данными за один раунд. Для решения этой задачи мы создаём систему под названием Visual ChatGPT, объединяющую различные визуальные базовые модели и позволяющую пользователям взаимодействовать с ChatGPT посредством: 1) отправки и получения не только текста, но и изображений; 2) постановки сложных визуальных вопросов или предоставления инструкций по визуальному редактированию, требующих совместной работы нескольких моделей искусственного интеллекта в несколько этапов; и 3) предоставления обратной связи и запроса исправленных результатов. Мы разрабатываем серию промптов для интеграции информации о визуальных моделях в ChatGPT, учитывая модели с несколькими входами и выходами, а также модели, требующие визуальной обратной связи. Эксперименты показывают, что Visual ChatGPT открывает возможности для изучения визуальных функций ChatGPT с помощью визуальных базовых моделей. Наша система находится в открытом доступе по адресу https://github.com/microsoft/visual-chatgpt.
1
Разработан механизм на основе промптов для передачи возможностей визуальных моделей в ChatGPT с поддержкой различных типов входов, выходов и требований к визуальной обратной связи.
2
Система поддерживает сложные визуальные вопросы и инструкции по редактированию изображений за счёт совместной работы нескольких моделей в многоэтапных процессах.
3
Система опубликована в открытом доступе и предоставляет платформу для изучения визуальных возможностей ChatGPT с помощью визуальных фундаментальных моделей.
4
Пользователи могут предоставлять визуальную обратную связь и запрашивать исправленные результаты, выходя за рамки фиксированных одношаговых входов и выходов моделей.
5
Visual ChatGPT интегрирует несколько визуальных фундаментальных моделей с ChatGPT, обеспечивая мультимодальное взаимодействие на естественном языке и с изображениями.

система Visual ChatGPT, интегрирующая несколько визуальных фундаментальных моделей

мультимодальное диалоговое взаимодействие, ответы на визуальные вопросы, генерация и редактирование изображений посредством много-модельного многошагового взаимодействия с обратной связью

Publication Details
Publication Date
2023-03-08
Journal
Publisher
ISSN
Cited by
191
Access Type
Author Information
Authors
Chenfei Wu
Shengming Yin
Weizhen Qi
Xiaodong Wang
Zecheng Tang
Nan Duan
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%