VGSG: Сеть с визуально-направленными семантическими группами для поиска людей по тексту

VGSG: Vision-Guided Semantic-Group Network for Text-Based Person Search
Xudong Jiang, Henghui Ding, Hao Luo, Wei Jiang, Shuting He
2023-12-05

Semantic-Group Textual LearningVision-Guided Semantic-Group NetworkVision-guided Knowledge Transferпоиск людей по текступеренос сходства визуально-языковой (vision-language similarity transfer)
Поиска людей по текстовому описанию (Text-based Person Search, TBPS) направлен на извлечение изображений целевых пешеходов, указанных текстовыми описаниями. Для TBPS важно извлекать детализированные локальные признаки и выполнять их выравнивание между модальностями. Существующие методы используют внешние инструменты или тяжёлое кросс-модальное взаимодействие для явного выравнивания кросс-модальных тонких признаков, что неэффективно и трудоёмко. В данной работе предлагается Vision-Guided Semantic-Group Network (VGSG) для поиска людей по тексту с целью извлечения хорошо выровненных детализированных визуальных и текстовых признаков. В предложенном VGSG мы разрабатываем модуль Semantic-Group Textual Learning (SGTL) и модуль Vision-Guided Knowledge Transfer (VGKT) для извлечения локальных текстовых признаков под руководством визуальных локальных подсказок. В SGTL, чтобы получить локальное текстовое представление, мы группируем текстовые признаки по измерению каналов на основе семантических подсказок языкового выражения, что поощряет неявное группирование схожих семантических паттернов без внешних инструментов. В VGKT применяется визуально-направленное внимание для извлечения визуально-связанных текстовых признаков, которые по сути выровнены с визуальными подсказками и называются визуально-направленными текстовыми признаками. Кроме того, мы разрабатываем реляционный перенос знаний, включающий перенос сходства между визуальной и языковой модальностями и перенос вероятностей классов, чтобы адаптивно передавать информацию от визуально-направленных текстовых признаков к семантическим групповым текстовым признакам. С помощью реляционного переноса знаний VGKT способен выравнивать семантические групповые текстовые признаки с соответствующими визуальными признаками без внешних инструментов и сложного попарного взаимодействия. Экспериментальные результаты на двух сложных бенчмарках демонстрируют его превосходство над современными методами.
1
Предложена VGSG (Vision-Guided Semantic-Group Network) для извлечения хорошо выровненных детальных визуальных и текстовых признаков для поиска людей по тексту.
2
Реляционная передача знаний (перенос сходства визу-язык и передача вероятности класса) адаптивно передаёт информацию от визуально-управляемых текстовых признаков к семантически сгруппированным текстовым признакам, обеспечивая выравнивание без сложных попарных взаимодействий или внешних инструментов.
3
Semantic-Group Textual Learning (SGTL) группирует текстовые признаки по канальному измерению по семантическим подсказкам для получения локальных текстовых представлений без внешних инструментов.
4
VGSG превосходит современные методы на двух сложных бенчмарках, демонстрируя превосходство в поиске людей по текстовым описаниям.
5
Vision-guided Knowledge Transfer (VGKT) использует внимание, управляемое визуальными признаками, для получения визуально-связанных текстовых признаков, непосредственно выровненных с визуальными подсказками.

Система поиска человека по тексту (Vision-Guided Semantic-Group Network, применённая к перекрёстному поиску пешеходов по описаниям)

Выделение и выравнивание тонко-гранулярных локальных визуальных и текстовых признаков для межмодального поиска, в частности обучение семантических групп текстовых признаков под руководством визуальной информации и реляционная передача знаний для согласования текстовых признаков с соответствующими визуальными сигналами

Publication Details
Publication Date
2023-12-05
Journal
Publisher
ISSN
Cited by
107
Access Type
Author Information
Authors
Xudong Jiang
Henghui Ding
Hao Luo
Wei Jiang
Shuting He
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%