Visual ChatGPT: общение, рисование и редактирование с использованием визуальных базовых моделей
Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models
2023-03-08
SCID: 54.1/eg5hjk3d
Discuss with AI
Stable DiffusionVisual ChatGPTвизуальные трансформерывизуальное редактированиевизуальные базовые модели
Figures from the paper
Abstract (AI)
ChatGPT привлекает междисциплинарный интерес, поскольку предоставляет языковой интерфейс с выдающимися возможностями ведения диалога и рассуждения в различных областях. Однако, поскольку ChatGPT обучен на языковых данных, в настоящее время он не способен обрабатывать изображения визуального мира или генерировать их. В то же время визуальные базовые модели, такие как Vision Transformer и Stable Diffusion, несмотря на высокие возможности визуального понимания и генерации, являются экспертами лишь в выполнении конкретных задач с фиксированными входными и выходными данными за один раунд. Для решения этой задачи мы создаём систему под названием Visual ChatGPT, объединяющую различные визуальные базовые модели и позволяющую пользователям взаимодействовать с ChatGPT посредством: 1) отправки и получения не только текста, но и изображений; 2) постановки сложных визуальных вопросов или предоставления инструкций по визуальному редактированию, требующих совместной работы нескольких моделей искусственного интеллекта в несколько этапов; и 3) предоставления обратной связи и запроса исправленных результатов. Мы разрабатываем серию промптов для интеграции информации о визуальных моделях в ChatGPT, учитывая модели с несколькими входами и выходами, а также модели, требующие визуальной обратной связи. Эксперименты показывают, что Visual ChatGPT открывает возможности для изучения визуальных функций ChatGPT с помощью визуальных базовых моделей. Наша система находится в открытом доступе по адресу https://github.com/microsoft/visual-chatgpt.
Key Findings
1
Разработан механизм на основе промптов для передачи возможностей визуальных моделей в ChatGPT с поддержкой различных типов входов, выходов и требований к визуальной обратной связи.
2
Система поддерживает сложные визуальные вопросы и инструкции по редактированию изображений за счёт совместной работы нескольких моделей в многоэтапных процессах.
3
Система опубликована в открытом доступе и предоставляет платформу для изучения визуальных возможностей ChatGPT с помощью визуальных фундаментальных моделей.
4
Пользователи могут предоставлять визуальную обратную связь и запрашивать исправленные результаты, выходя за рамки фиксированных одношаговых входов и выходов моделей.
5
Visual ChatGPT интегрирует несколько визуальных фундаментальных моделей с ChatGPT, обеспечивая мультимодальное взаимодействие на естественном языке и с изображениями.
Research Object
система Visual ChatGPT, интегрирующая несколько визуальных фундаментальных моделей
Research Subject
мультимодальное диалоговое взаимодействие, ответы на визуальные вопросы, генерация и редактирование изображений посредством много-модельного многошагового взаимодействия с обратной связью
Publication Details
Publication Date
2023-03-08
Journal
Publisher
ISSN
Cited by
191
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest