Alpha-CLIP: модель CLIP, фокусирующаяся там, где нужно

Alpha-CLIP: A CLIP Model Focusing on Wherever you Want
Dahua Lin, Pan Zhang, Yuhang Zang, Tong Wu, Yuanjun Xiong, Jiaqi Wang, Shu Kong, Fang Ye, Zeyi Sun
2024-06-16

Alpha-CLIPRGBA пары регион-текстдополнение альфа-каналомконтролируемое выделение содержимого изображенияCLIP, ориентированный на регионы
Contrastive Language–Image Pre-training (CLIP) играет ключевую роль в извлечении содержательной информации из изображений для различных задач. Он выравнивает текстовую и визуальную модальности для понимания всего изображения, включая детали, которые могут быть нерелевантны для конкретных задач. Однако для более точного понимания и контролируемого редактирования изображений важно фокусироваться на конкретных областях интереса, которые могут указывать человек или модели восприятия в виде точек, масок или прямоугольников. Для удовлетворения этой потребности мы представляем Alpha-CLIP — расширенную версию CLIP с дополнительным альфа-каналом, предлагающим области внимания, и дообученную на миллионах сконструированных пар «область RGBA — текст». Alpha-CLIP сохраняет способность CLIP к визуальному распознаванию и одновременно обеспечивает точный контроль над акцентом на содержимом изображения. Модель эффективна в разных задачах, включая, но не ограничиваясь, распознаванием в открытом мире, интеграцией с мультимодальными большими языковыми моделями и условной 2D/3D генерацией. Она обладает высоким потенциалом для использования в разнообразных задачах, связанных с изображениями. Код и модели проекта доступны по адресу https://aleafy.github.io/alpha-clip/.
1
Alpha-CLIP добавляет вспомогательный альфа-канал в CLIP для указания областей внимания (точки, маски или рамки) для фокусированного понимания изображения.
2
Alpha-CLIP улучшает применимость в задачах, требующих фокусировки на регионах, и показал эффективность в открытом распознавании, мультимодальных LLM и условной 2D/3D генерации.
3
Alpha-CLIP дообучен на сконструированных миллионах пар RGBA-область–текст для изучения выравнивания визуально-языковых представлений, зависящих от региона.
4
Alpha-CLIP выпущен с кодом и моделями, что делает его универсальным инструментом для задач, связанных с изображениями.
5
Alpha-CLIP сохраняет исходную способность CLIP к визуальному распознаванию и при этом позволяет точно контролировать выделение содержимого изображения.

Модель Alpha-CLIP (CLIP, дополненный вспомогательным альфа-каналом и дообученный на парах регион–текст в формате RGBA)

Управляемое внимание к заданным регионам изображения (точки, маски или рамки), обеспечивающее точное выделение содержимого изображения при сохранении возможностей визуального распознавания CLIP

Publication Details
Publication Date
2024-06-16
Journal
Publisher
ISSN
Cited by
90
Access Type
Author Information
Authors
Dahua Lin
Pan Zhang
Yuhang Zang
Tong Wu
Yuanjun Xiong
Jiaqi Wang
Shu Kong
Fang Ye
Zeyi Sun
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%