Alpha-CLIP: модель CLIP, фокусирующаяся там, где нужно
Alpha-CLIP: A CLIP Model Focusing on Wherever you Want
2024-06-16
SCID: 54.1/mfuzyq6q
Discuss with AI
Alpha-CLIPRGBA пары регион-текстдополнение альфа-каналомконтролируемое выделение содержимого изображенияCLIP, ориентированный на регионы
Figures from the paper
Abstract (AI)
Contrastive Language–Image Pre-training (CLIP) играет ключевую роль в извлечении содержательной информации из изображений для различных задач. Он выравнивает текстовую и визуальную модальности для понимания всего изображения, включая детали, которые могут быть нерелевантны для конкретных задач. Однако для более точного понимания и контролируемого редактирования изображений важно фокусироваться на конкретных областях интереса, которые могут указывать человек или модели восприятия в виде точек, масок или прямоугольников. Для удовлетворения этой потребности мы представляем Alpha-CLIP — расширенную версию CLIP с дополнительным альфа-каналом, предлагающим области внимания, и дообученную на миллионах сконструированных пар «область RGBA — текст». Alpha-CLIP сохраняет способность CLIP к визуальному распознаванию и одновременно обеспечивает точный контроль над акцентом на содержимом изображения. Модель эффективна в разных задачах, включая, но не ограничиваясь, распознаванием в открытом мире, интеграцией с мультимодальными большими языковыми моделями и условной 2D/3D генерацией. Она обладает высоким потенциалом для использования в разнообразных задачах, связанных с изображениями. Код и модели проекта доступны по адресу https://aleafy.github.io/alpha-clip/.
Key Findings
1
Alpha-CLIP добавляет вспомогательный альфа-канал в CLIP для указания областей внимания (точки, маски или рамки) для фокусированного понимания изображения.
2
Alpha-CLIP улучшает применимость в задачах, требующих фокусировки на регионах, и показал эффективность в открытом распознавании, мультимодальных LLM и условной 2D/3D генерации.
3
Alpha-CLIP дообучен на сконструированных миллионах пар RGBA-область–текст для изучения выравнивания визуально-языковых представлений, зависящих от региона.
4
Alpha-CLIP выпущен с кодом и моделями, что делает его универсальным инструментом для задач, связанных с изображениями.
5
Alpha-CLIP сохраняет исходную способность CLIP к визуальному распознаванию и при этом позволяет точно контролировать выделение содержимого изображения.
Research Object
Модель Alpha-CLIP (CLIP, дополненный вспомогательным альфа-каналом и дообученный на парах регион–текст в формате RGBA)
Research Subject
Управляемое внимание к заданным регионам изображения (точки, маски или рамки), обеспечивающее точное выделение содержимого изображения при сохранении возможностей визуального распознавания CLIP
Publication Details
Publication Date
2024-06-16
Journal
Publisher
ISSN
Cited by
90
Access Type
Author Information
Download PDF
Subscribe to digest