CLIP-ReID: Использование визуально-языковой модели для повторной идентификации изображений без конкретных текстовых меток
CLIP-ReID: Exploiting Vision-Language Model for Image Re-identification without Concrete Text Labels
2023-06-26
SCID: 54.1/9d2wd5af
Discuss with AI
CLIP-ReIDконтрастная функция потерьидентификация изображений (ReID)обучаемые текстовые токены, специфичные для идентификаторамодели зрения-языка
Figures from the paper
Abstract (AI)
Предварительно обученные визуально-языковые модели, такие как CLIP, недавно продемонстрировали высокую эффективность в различных задачах (включая классификацию и сегментацию изображений). Однако в тонко гранулированной задаче повторной идентификации изображений (ReID) метки представлены индексами и не имеют конкретных текстовых описаний, поэтому остается вопрос, как применять такие модели в этих задачах. В первую очередь мы обнаружили, что простая дообучка визуальной модели, инициализированной кодером изображений CLIP, уже обеспечивает сопоставимые результаты на различных ReID задачах. Затем мы предлагаем двухэтапную стратегию для формирования более качественных визуальных представлений. Ключевая идея — полностью использовать кроссмодальную описательную способность CLIP посредством набора обучаемых текстовых токенов для каждого ID и подачи их в текстовый кодер для формирования неоднозначных описаний. На первом этапе обучения иммутабельными остаются кодеры изображений и текста из CLIP, а текстовые токены оптимизируются с нуля с использованием контрастивной потери, вычисляемой внутри батча. На втором этапе ID-специфичные текстовые токены и их кодер фиксируются и служат ограничением при дообучении кодера изображений. С помощью разработанной функции потерь для вспомогательной задачи кодер изображений учится точно представлять данные в виде векторов признакового пространства. Эффективность предложенной стратегии подтверждена на нескольких наборах данных для задач ReID людей и транспортных средств. Код доступен по адресу https://github.com/Syliz517/CLIP-ReID.
Key Findings
1
Двухэтапная стратегия использует кросс-модальную способность CLIP, обучая набор текстовых токенов, специфичных для каждого ID, формирующих неоднозначные текстовые описания.
2
Тонкая настройка только визуального кодера CLIP уже обеспечивает конкурентную производительность на различных задачах детализированного ReID, несмотря на индексные метки без текста.
3
Этап 1: при зафикированных кодерах изображения и текста CLIP текстовые токены для ID оптимизируются с нуля с использованием контрастивной потери в батче.
4
Этап 2: выученные текстовые токены и текстовый кодер фиксируются и служат ограничением для дообучения визуального кодера, повышая точность эмбеддингов с помощью задачно-специфичной потери.
5
Предложенный метод эмпирически показан эффективным на нескольких датасетах для ReID людей и транспортных средств.
Research Object
Задачи/наборы данных по тонкой (fine-grained) переидентификации изображений (ReID) для людей и транспортных средств
Research Subject
Улучшение визуальных представлений для ReID изображений посредством использования кросс-модальных возможностей CLIP через обучаемые текстовые токены, специфичные для ID, и двухэтапную стратегию обучения для задания ограничений и дообучения энкодера изображений
Publication Details
Publication Date
2023-06-26
Journal
Publisher
ISSN
Cited by
293
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest