Визуальные трансформеры для классификации изображений дистанционного зондирования
Vision Transformers for Remote Sensing Image Classification
2021-02-01
SCID: 54.1/9ajj5hfw
Discuss with AI
Vision Transformers (визуальные трансформеры)аугментация данныхмногоэкспертное вниманиепрунинг нейронной сетиклассификация изображений дистанционного зондирования
Figures from the paper
Abstract (AI)
В данной статье предлагается метод классификации сцен дистанционного зондирования на основе визуальных трансформеров. Эти типы сетей, которые в настоящее время признаны моделями передового уровня в обработке естественного языка, не используют сверточные слои, как стандартные сверточные нейронные сети (CNN). Вместо этого в качестве основного структурного элемента они применяют механизмы многоголового внимания для выявления дальних контекстных взаимосвязей между пикселями изображений. На первом этапе анализируемые изображения разделяются на фрагменты, которые затем преобразуются в последовательность путем их выравнивания и встраивания. Для сохранения информации о положении к этим фрагментам добавляются позиционные встраивания. Полученная последовательность подается на несколько слоев многоголового внимания для формирования итогового представления. На этапе классификации первый токен последовательности подается на классификационный слой softmax. Для повышения эффективности классификации исследуются несколько стратегий аугментации данных с целью генерации дополнительных данных для обучения. Кроме того, экспериментально показано, что сеть можно сжать путем удаления половины слоев, сохранив сопоставимую точность классификации. Результаты экспериментов, проведенных на различных наборах данных изображений дистанционного зондирования, демонстрируют перспективность модели по сравнению с методами передового уровня. В частности, Vision Transformer обеспечивает среднюю точность классификации 98,49%, 95,86%, 95,56% и 93,83% на наборах данных Merced, AID, Optimal31 и NWPU соответственно. Сжатая версия, полученная путем удаления половины слоев многоголового внимания, обеспечивает показатели 97,90%, 94,27%, 95,30% и 93,05% соответственно.
Key Findings
1
Метод Vision Transformer классифицирует сцены дистанционного зондирования с использованием встраивания патчей, позиционных кодировок и многоголового внимания вместо сверточных слоев.
2
Для повышения качества классификации применяются стратегии аугментации данных, генерирующие дополнительные обучающие примеры.
3
Удаление половины слоев многоголового внимания сохраняет конкурентоспособную производительность: точность составляет соответственно 97,90%, 94,27%, 95,30% и 93,05%.
4
Полная модель Vision Transformer достигает средней точности 98,49% на Merced, 95,86% на AID, 95,56% на Optimal31 и 93,83% на NWPU.
5
Модель выявляет дальние контекстные взаимосвязи между пикселями изображений с помощью последовательности слоев многоголового внимания.
Research Object
изображения дистанционного зондирования и соответствующие наборы данных для классификации сцен
Research Subject
эффективность классификации сцен на основе vision transformer, включая влияние многоголового механизма внимания, аугментации данных и прореживания слоёв
Publication Details
Publication Date
2021-02-01
Journal
Publisher
ISSN
Cited by
637
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest