Uformer: Общая U-образная трансформерная архитектура для восстановления изображений
Uformer: A General U-Shaped Transformer for Image Restoration
2022-06-01
SCID: 54.1/u4ebpsrx
Discuss with AI
U-образный трансформерUformerустранение дефокусного размытияудаление дождя (deraining)шумоподавление изображенийвосстановление изображенийобучаемый многошкальный модулятор восстановлениялокально-усиленный оконный блок трансформера (LeWin)устранение размытия движениямультиуровневый пространственный сдвигскользящее оконное self-attention без перекрытия
Figures from the paper
Abstract (AI)
В этой работе мы представляем Uformer — эффективную и быструю трансформерную архитектуру для восстановления изображений, в которой мы строим иерархическую сеть кодер–декодер с использованием трансформерного блока. В Uformer предусмотрены два ключевых решения. Во-первых, мы вводим новый локально-усиленный оконный (LeWin) трансформерный блок, который выполняет неблокирующееся (non-overlapping) оконное самовнимание вместо глобального самовнимания. Это существенно снижает вычислительную сложность на картах признаков высокого разрешения при одновременном захвате локального контекста. Во-вторых, мы предлагаем обучаемый многомасштабный модулятор восстановления в виде многомасштабного пространственного смещения для корректировки признаков в нескольких слоях декодера Uformer. Наш модулятор демонстрирует превосходную способность восстанавливать детали в различных задачах восстановления изображений при введении незначительного дополнительного числа параметров и вычислительной нагрузки. Благодаря этим двум решениям Uformer обладает высокой способностью захватывать как локальные, так и глобальные зависимости для восстановления изображений. Для оценки нашего подхода были проведены обширные эксперименты на нескольких задачах восстановления изображений, включая шумоподавление изображений, устранение смазывания при движении (motion deblurring), устранение дефокусного размытия (defocus deblurring) и удаление дождя (deraining). Без дополнительных ухищрений наш Uformer достигает превосходных или сопоставимых результатов по сравнению с современными алгоритмами. Код и модели доступны по адресу https://github.com/ZhendongWang6/Uformer.
Key Findings
1
Обучаемый многомасштабный модулятор восстановления, реализованный как многомасштабный пространственный байас в декодере, улучшает восстановление деталей на нескольких слоях при незначительном увеличении числа параметров и вычислений.
2
Комбинация блоков LeWin и многомасштабного модулятора позволяет Uformer эффективно улавливать как локальные, так и глобальные зависимости для восстановления изображений.
3
Широкие эксперименты по шумоподавлению, снятию размытия от движения, снятию дефокусного размытия и удалению дождя показывают, что Uformer достигает превосходных или сопоставимых результатов с современными методами без дополнительных ухищрений.
4
Блок LeWin (locally-enhanced window) использует самовнимание в неперекрывающихся окнах для захвата локального контекста при значительном снижении вычислительной сложности на картах признаков высокого разрешения.
5
Uformer — иерархичная архитектура кодер-декодер на базе Transformer, специально разработанная для задач восстановления изображений.
Research Object
Архитектура Uformer — иерархическая кодер-декодерная сеть на базе Transformer для восстановления изображений
Research Subject
Проектирование и оценка блоков LeWin (локально-усиленный оконный Transformer) и обучаемого многошкального модуля-ресторатора в виде пространственного смещения для захвата локальных и глобальных зависимостей и улучшения качества восстановления изображений (шумоподавление, деблюринг, удаление дождя)
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
2218
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai8
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
SwinIR: восстановление изображений с использованием Swin Transformer2021
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Нелокальные нейронные сети2018
За пределами гауссовского шумоподавителя: республивая (Residual) обучаемая глубокая сверточная нейронная сеть для удаления шума с изображений2017