The Visualization JUDGE: Могут ли мультимодальные фундаментальные модели направлять проектирование визуализаций через визуальное восприятие?
The Visualization JUDGE: Can Multimodal Foundation Models Guide Visualization Design Through Visual Perception?
2024-10-14
SCID: 54.1/vgp54hca
Discuss with AI
мультимодальные большие языковые моделимультимодальные фундаментальные моделигенеративные модели текста-в-изображениевизуальное восприятиедизайн визуализаций
Figures from the paper
Abstract (AI)
Фундаментальные модели для зрения и языка являются основой приложений ИИ в многочисленных секторах общества. Успех этих моделей обусловлен их способностью имитировать человеческие способности, а именно визуальное восприятие в моделях зрения и аналитическое рассуждение в больших языковых моделях. Поскольку визуальное восприятие и анализ фундаментальны для визуализации данных, в этой позиционной статье мы задаём вопрос: как можно использовать фундаментальные модели для продвижения в проектировании визуализаций? В частности, как мультимодальные фундаментальные модели (MFM) могут направлять проектирование визуализаций посредством визуального восприятия? Мы подходим к этим вопросам, исследуя эффективность MFM в восприятии визуализаций и формализуя общее пространство проектирования и оптимизации визуализаций. В частности, мы считаем, что MFM лучше всего рассматривать как судей, обладающих способностью критиковать визуализации и предлагать действия для их улучшения. Мы даём более подробную характеристику генеративных моделей от текста к изображению и мультимодальных больших языковых моделей, структурируя материал по тому, какой выход дают эти модели и как использовать этот выход для руководства проектными решениями. Мы надеемся, что наша позиция вдохновит исследователей в области визуализации на изучение подходов по использованию MFM для проектирования визуализаций.
Key Findings
1
Сильные стороны MFM — имитация человеческого визуального восприятия и аналитического рассуждения, что делает их перспективными инструментами для улучшения дизайна визуализаций.
2
Мультимодальные фундаментальные модели (MFM) можно использовать как судей, которые воспринимают и критикуют визуализации, предлагая практические улучшения дизайна.
3
Текст‑в‑изображение генеративные модели и мультимодальные большие языковые модели имеют разные типы выходов, которые можно охарактеризовать и использовать для принятия дизайнерских решений.
4
В статье формализовано пространство проектирования и оптимизации визуализаций, чтобы прояснить, как MFM могут направлять дизайн через визуальное восприятие.
5
Статья представляет перспективу и рамки, призванные вдохновить исследователей по визуализации на использование MFM для руководства дизайном, а не предоставляет эмпирических оценок.
Research Object
Мультимодальные фундаментальные модели (MFMs) в роли судей для проектирования визуализаций
Research Subject
Способность MFMs воспринимать и критически оценивать визуализации и выдавать практические рекомендации для направления и оптимизации проектирования визуализаций через визуальное восприятие
Publication Details
Publication Date
2024-10-14
Journal
Publisher
ISSN
Cited by
1
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Chat2VIS: создание визуализаций данных на естественном языке с использованием больших языковых моделей ChatGPT, Codex и GPT-32023
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Генеративно-состязательные сети2020
К перцептивной оптимизации визуального оформления диаграмм рассеяния2017