COCOдатасет COCOCharadesдатасет CharadesKineticsдатасет Kineticsдлиннодействующие зависимостине локальные средниенелокальные нейронные сетинелокальная операциянелокальные операцииобнаружение объектовоценка позысегментациявидео-классификация
Figures from the paper
Abstract (AI)
Как сверточные, так и рекуррентные операции являются строительными блоками, которые обрабатывают по одному локальному окну за раз. В этой работе мы представляем нелокальные операции как общий класс строительных блоков для захвата дальнодействующих зависимостей. Вдохновлённая классическим методом non-local means в компьютерном зрении, наша нелокальная операция вычисляет отклик в заданной позиции как взвешенную сумму признаков по всем позициям. Этот строительный блок можно интегрировать во многие архитектуры компьютерного зрения. В задаче классификации видео даже без каких-либо ухищрений наши нелокальные модели могут соперничать с текущими победителями соревнований или превосходить их на наборах данных Kinetics и Charades. В задаче распознавания статичных изображений наши нелокальные модели улучшают обнаружение объектов, сегментацию и оценку поз на наборе задач COCO. Код доступен по адресу https://github.com/facebookresearch/video-nonlocal-net.
Key Findings
1
Для статических изображений нелокальные модели улучшают детекцию объектов и сегментацию на бенчмарке COCO.
2
Для статических изображений нелокальные модели улучшают оценку поз на бенчмарке COCO.
3
Введены нелокальные операции как универсальный строительный блок для захвата дальнодействующих зависимостей, вычисляющий отклик в позиции как взвешенную сумму по всем позициям.
4
В задачах статического распознавания изображений нелокальные модели улучшают детекцию объектов, сегментацию и оценку поз на наборе задач COCO.
5
Для задачи классификации видео нелокальные модели могут конкурировать с победителями соревнований или превосходить их на датасете Charades без дополнительных ухищрений.
6
В задаче классификации видео нелокальные модели могут соперничать с победителями соревнований или превосходить их на наборах данных Kinetics и Charades даже без дополнительных уловок.
7
Для задачи классификации видео нелокальные модели могут конкурировать с победителями соревнований или превосходить их на датасете Kinetics без дополнительных ухищрений.
8
Авторы публикуют реализацию кода в открытом доступе в указанном репозитории GitHub.
9
Авторы предоставляют код реализации нелокальных нейронных сетей в указанном репозитории GitHub.
10
Нелокальный блок вдохновлен методом non-local means в компьютерном зрении и может быть встроен во многие архитектуры компьютерного зрения.
11
Нелокальный блок вдохновлен классическим методом non-local means и может быть внедрен в многие архитектуры компьютерного зрения.
Research Object
Нелокальные операции (блок построения нелокальной нейронной сети), применяемые в архитектурах компьютерного зрения для задач видео- и изображений
Research Subject
Способность нелокальной операции захватывать дальнодействующие зависимости и повышать качество (классификация видео, детекция/сегментация объектов, оценка позы) при интеграции в стандартные свёрточные/рекуррентные архитектуры
Publication Details
Publication Date
2018-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai7
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Агрегированные остаточные преобразования для глубоких нейронных сетей2017
Взаимодействующие сети для обучения представлениям об объектах, отношениях и физике2016
Глубокое остаточное обучение для распознавания изображений2016
Очень глубокие сверточные сети для масштабного распознавания изображений2014
Улучшение нейронных сетей путем предотвращения соадаптации детекторов признаков2012
Модель графовой нейронной сети2008
Работы, цитирующие эту статью20
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Restormer: эффективный Transformer для восстановления изображений высокого разрешения2022
TransUNet: трансформеры как мощные энкодеры для сегментации медицинских изображений2021
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров2021
UNETR: Трансформеры для 3D сегментации медицинских изображений2022
Механизмы внимания в компьютерном зрении: обзор2022
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Uformer: Общая U-образная трансформерная архитектура для восстановления изображений2022
Предобученный трансформер для обработки изображений2021
Video Swin Transformer2022
CrossViT: мультишкальный визуальный трансформер с перекрёстным вниманием для классификации изображений2021
Эмпирическое исследование обучения самоконтролируемых Vision Transformer2021
Обнаружение изменений на дистанционно зондируемых изображениях с использованием трансформеров2021
Мультимодальное обучение с трансформерами: обзор2023
CMT: сверточные нейронные сети встречаются с визуальными трансформерами2022
Метод многомасштабного слияния признаков, ориентированный на обнаружение объектов малого размера, с применением для обнаружения дефектов2022
Спектрально-пространственная трансформерная сеть для классификации гиперспектральных изображений: факторизованная схема поиска архитектуры2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020