Визуальные трансформеры для классификации изображений дистанционного зондирования

Vision Transformers for Remote Sensing Image Classification
Yakoub Bazi, Laila Bashmal, Mohamad Mahmoud Al Rahhal, Reham Al-Dayil, Naif Al Ajlan
2021-02-01

Vision Transformers (визуальные трансформеры)аугментация данныхмногоэкспертное вниманиепрунинг нейронной сетиклассификация изображений дистанционного зондирования
В данной статье предлагается метод классификации сцен дистанционного зондирования на основе визуальных трансформеров. Эти типы сетей, которые в настоящее время признаны моделями передового уровня в обработке естественного языка, не используют сверточные слои, как стандартные сверточные нейронные сети (CNN). Вместо этого в качестве основного структурного элемента они применяют механизмы многоголового внимания для выявления дальних контекстных взаимосвязей между пикселями изображений. На первом этапе анализируемые изображения разделяются на фрагменты, которые затем преобразуются в последовательность путем их выравнивания и встраивания. Для сохранения информации о положении к этим фрагментам добавляются позиционные встраивания. Полученная последовательность подается на несколько слоев многоголового внимания для формирования итогового представления. На этапе классификации первый токен последовательности подается на классификационный слой softmax. Для повышения эффективности классификации исследуются несколько стратегий аугментации данных с целью генерации дополнительных данных для обучения. Кроме того, экспериментально показано, что сеть можно сжать путем удаления половины слоев, сохранив сопоставимую точность классификации. Результаты экспериментов, проведенных на различных наборах данных изображений дистанционного зондирования, демонстрируют перспективность модели по сравнению с методами передового уровня. В частности, Vision Transformer обеспечивает среднюю точность классификации 98,49%, 95,86%, 95,56% и 93,83% на наборах данных Merced, AID, Optimal31 и NWPU соответственно. Сжатая версия, полученная путем удаления половины слоев многоголового внимания, обеспечивает показатели 97,90%, 94,27%, 95,30% и 93,05% соответственно.
1
Метод Vision Transformer классифицирует сцены дистанционного зондирования с использованием встраивания патчей, позиционных кодировок и многоголового внимания вместо сверточных слоев.
2
Для повышения качества классификации применяются стратегии аугментации данных, генерирующие дополнительные обучающие примеры.
3
Удаление половины слоев многоголового внимания сохраняет конкурентоспособную производительность: точность составляет соответственно 97,90%, 94,27%, 95,30% и 93,05%.
4
Полная модель Vision Transformer достигает средней точности 98,49% на Merced, 95,86% на AID, 95,56% на Optimal31 и 93,83% на NWPU.
5
Модель выявляет дальние контекстные взаимосвязи между пикселями изображений с помощью последовательности слоев многоголового внимания.

изображения дистанционного зондирования и соответствующие наборы данных для классификации сцен

эффективность классификации сцен на основе vision transformer, включая влияние многоголового механизма внимания, аугментации данных и прореживания слоёв

Publication Details
Publication Date
2021-02-01
Journal
Publisher
ISSN
Cited by
637
Access Type
Author Information
Authors
Yakoub Bazi
Laila Bashmal
Mohamad Mahmoud Al Rahhal
Reham Al-Dayil
Naif Al Ajlan
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%