TPH-YOLOv5: Улучшенный YOLOv5 с трансформерной головой предсказания для обнаружения объектов на снимках с дронов

TPH-YOLOv5: Improved YOLOv5 Based on Transformer Prediction Head for Object Detection on Drone-captured Scenarios
Xu Wang, Qi Zhao, Xingkui Zhu, Shuchang Lyu
2021-10-01

CBAM (Convolutional блок внимания)TPH-YOLOv5Голова предсказания на основе трансформераНабор данных VisDrone2021YOLOv5
Обнаружение объектов на снимках с дронов — недавно ставшая популярной задача. Поскольку дроны летают на различных высотах, масштаб объектов сильно меняется, что затрудняет оптимизацию сетей. Кроме того, высокоскоростный полет на низкой высоте вызывает смазывание движением на плотно расположенных объектах, что усложняет их различение. Для решения обеих проблем мы предлагаем TPH-YOLOv5. На базе YOLOv5 мы добавляем дополнительную голову предсказания для детекции объектов разных масштабов. Затем мы заменяем исходные головы предсказания на Transformer Prediction Heads (TPH), чтобы использовать потенциал предсказания с помощью механизма самовнимания. Мы также интегрируем модуль внимания в сверточных блоках (CBAM) для выделения областей внимания в сценариях с плотными объектами. Для дальнейшего улучшения TPH-YOLOv5 мы применяем набор полезных стратегий, таких как аугментация данных, тестирование в нескольких масштабах, интеграция нескольких моделей и использование дополнительного классификатора. Широкие эксперименты на датасете VisDrone2021 показывают, что TPH-YOLOv5 демонстрирует хорошую производительность с впечатляющей интерпретируемостью в сценариях, снятых с дронов. На наборе DET-test-challenge AP TPH-YOLOv5 составляет 39.18%, что на 1.81% лучше по сравнению с предыдущим методом SOTA (DPNetV3). На конкурсе VisDrone 2021 TPH-YOLOv5 занял 5-е место и показывает результаты, сопоставимые с моделью, занявшей 1-е место (AP 39.43%). По сравнению с базовой моделью (YOLOv5) TPH-YOLOv5 улучшает результат примерно на 7%, что является обнадёживающим и конкурентоспособным.
1
Добавлена дополнительная голова предсказания к YOLOv5 для лучшего обнаружения объектов при резких изменениях масштаба на съёмках с дронов.
2
Применены стратегии обучения и вывода (аугментация данных, тестирование в нескольких масштабах, интеграция нескольких моделей, дополнительный классификатор) для дальнейшего повышения качества.
3
Интегрирован CBAM (сверточный блок внимания) для более точного определения областей внимания в плотных и смазанных движением сценах с дрона.
4
На VisDrone2021 DET-test-challenge TPH-YOLOv5 достиг AP 39.18%, превзойдя предыдущий SOTA DPNetV3 на 1.81% и улучшив примерно на 7% по сравнению с базовым YOLOv5; занял 5-е место в VisDrone Challenge 2021 и показал результаты, сопоставимые с моделью, занявшей 1-е место (AP 39.43%).
5
Оригинальные головы предсказания заменены на Transformer Prediction Heads (TPH) с механизмом самовнимания для улучшения предсказательной способности.

Модель детекции объектов на основе YOLOv5 (TPH-YOLOv5), применяемая к изображениям, снятым дроном

Улучшение детекции объектов различных масштабов, в плотных скоплениях и с размытием от движения в сценариях съёмки дроном посредством добавления головы предсказания, Transformer Prediction Heads (механизм самовнимания), CBAM и связанных стратегий обучения/тестирования для повышения AP

Publication Details
Publication Date
2021-10-01
Journal
Publisher
ISSN
Cited by
2171
Access Type
Author Information
Authors
Xu Wang
Qi Zhao
Xingkui Zhu
Shuchang Lyu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%