VGSG: Сеть с визуально-направленными семантическими группами для поиска людей по тексту
VGSG: Vision-Guided Semantic-Group Network for Text-Based Person Search
2023-12-05
SCID: 54.1/qn7jhtts
Discuss with AI
Semantic-Group Textual LearningVision-Guided Semantic-Group NetworkVision-guided Knowledge Transferпоиск людей по текступеренос сходства визуально-языковой (vision-language similarity transfer)
Figures from the paper
Abstract (AI)
Поиска людей по текстовому описанию (Text-based Person Search, TBPS) направлен на извлечение изображений целевых пешеходов, указанных текстовыми описаниями. Для TBPS важно извлекать детализированные локальные признаки и выполнять их выравнивание между модальностями. Существующие методы используют внешние инструменты или тяжёлое кросс-модальное взаимодействие для явного выравнивания кросс-модальных тонких признаков, что неэффективно и трудоёмко. В данной работе предлагается Vision-Guided Semantic-Group Network (VGSG) для поиска людей по тексту с целью извлечения хорошо выровненных детализированных визуальных и текстовых признаков. В предложенном VGSG мы разрабатываем модуль Semantic-Group Textual Learning (SGTL) и модуль Vision-Guided Knowledge Transfer (VGKT) для извлечения локальных текстовых признаков под руководством визуальных локальных подсказок. В SGTL, чтобы получить локальное текстовое представление, мы группируем текстовые признаки по измерению каналов на основе семантических подсказок языкового выражения, что поощряет неявное группирование схожих семантических паттернов без внешних инструментов. В VGKT применяется визуально-направленное внимание для извлечения визуально-связанных текстовых признаков, которые по сути выровнены с визуальными подсказками и называются визуально-направленными текстовыми признаками. Кроме того, мы разрабатываем реляционный перенос знаний, включающий перенос сходства между визуальной и языковой модальностями и перенос вероятностей классов, чтобы адаптивно передавать информацию от визуально-направленных текстовых признаков к семантическим групповым текстовым признакам. С помощью реляционного переноса знаний VGKT способен выравнивать семантические групповые текстовые признаки с соответствующими визуальными признаками без внешних инструментов и сложного попарного взаимодействия. Экспериментальные результаты на двух сложных бенчмарках демонстрируют его превосходство над современными методами.
Key Findings
1
Предложена VGSG (Vision-Guided Semantic-Group Network) для извлечения хорошо выровненных детальных визуальных и текстовых признаков для поиска людей по тексту.
2
Реляционная передача знаний (перенос сходства визу-язык и передача вероятности класса) адаптивно передаёт информацию от визуально-управляемых текстовых признаков к семантически сгруппированным текстовым признакам, обеспечивая выравнивание без сложных попарных взаимодействий или внешних инструментов.
3
Semantic-Group Textual Learning (SGTL) группирует текстовые признаки по канальному измерению по семантическим подсказкам для получения локальных текстовых представлений без внешних инструментов.
4
VGSG превосходит современные методы на двух сложных бенчмарках, демонстрируя превосходство в поиске людей по текстовым описаниям.
5
Vision-guided Knowledge Transfer (VGKT) использует внимание, управляемое визуальными признаками, для получения визуально-связанных текстовых признаков, непосредственно выровненных с визуальными подсказками.
Research Object
Система поиска человека по тексту (Vision-Guided Semantic-Group Network, применённая к перекрёстному поиску пешеходов по описаниям)
Research Subject
Выделение и выравнивание тонко-гранулярных локальных визуальных и текстовых признаков для межмодального поиска, в частности обучение семантических групп текстовых признаков под руководством визуальной информации и реляционная передача знаний для согласования текстовых признаков с соответствующими визуальными сигналами
Publication Details
Publication Date
2023-12-05
Journal
Publisher
ISSN
Cited by
107
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
HowTo100M: обучение текстово-видеового представления посредством просмотра ста миллионов озвученных видеоклипов2019
Глубокое остаточное обучение для распознавания изображений2016
Дистилляция знаний в нейронной сети2015
Обучение представлений фраз с использованием RNN энкодер–декодера для статистического машинного перевода2014