Беги, не иди: в поисках более высокой FLOPS для более быстрых нейронных сетей
Run, Don't Walk: Chasing Higher FLOPS for Faster Neural Networks
2023-06-01
SCID: 54.1/yjp3329h
Discuss with AI
FLOPs vs FLOPS (операции с плавающей запятой в секунду)FasterNetглубинная свёрткапропускная способность / задержка при выводе на GPU, CPU, ARMчастичная свёртка (PConv)
Figures from the paper
Abstract (AI)
Для создания быстрых нейронных сетей многие работы сосредоточены на сокращении числа операций с плавающей запятой (FLOPs). Мы отмечаем, что такое снижение FLOPs не обязательно приводит к аналогичному снижению задержки. Это в основном связано с неэффективно низкой скоростью выполнения операций с плавающей запятой в секунду (FLOPS). Чтобы добиться более быстрых сетей, мы пересматриваем популярные операторы и демонстрируем, что низкие FLOPS обусловлены частым доступом к памяти операторов, особенно глубинной свёртки (depthwise convolution). Мы предлагаем новый частичный свёрточный оператор (PConv), который извлекает пространственные признаки более эффективно, одновременно сокращая избыточные вычисления и обращения к памяти. На основе PConv мы далее предлагаем FasterNet — новое семейство нейронных сетей, которое достигает существенно большей скорости работы по широкому кругу устройств, не уступая в точности для различных задач компьютерного зрения. Например, на ImageNet-1k наш миниатюрный FasterNet-T0 в 2.8×, 3.3× и 2.4× быстрее MobileViT-XXS на GPU, CPU и ARM-процессорах соответственно, при этом на 2.9% точнее. Наш большой FasterNet-L демонстрирует впечатляющие 83.5% top-1 точности, сопоставимые с развивающейся Swin-B, при этом обеспечивая на 36% большую пропускную способность при инференсе на GPU и экономя 37% времени вычислений на CPU. Код доступен по адресу https://github.com/JierunChen/FasterNet.
Key Findings
1
FasterNet, построенная на PConv, обеспечивает существенно более высокую скорость работы на разных устройствах без компромисса по точности в задачах компьютерного зрения.
2
FasterNet-L (большая) достигает 83.5% точности top-1 (сопоставимо с Swin-B), обеспечивая при этом на 36% большую пропускную способность при выводе на GPU и экономя 37% времени вычислений на CPU.
3
FasterNet-TO (маленькая) в 2.8×, 3.3× и 2.4× быстрее MobileViT-XXS на GPU, CPU и ARM соответственно и при этом на 2.9% точнее на ImageNet-1k.
4
Сокращение FLOPs не обязательно уменьшает задержку, поскольку многие сети имеют неэффективно низкий показатель FLOPS из-за частого доступа к памяти, особенно в depthwise-свертках.
5
Авторы предлагают частичную свертку (PConv), которая сокращает избыточные вычисления и доступ к памяти для более эффективного извлечения пространственных признаков.
Research Object
Семейство архитектур нейронных сетей FasterNet (включая предложенную частичную свёртку PConv и варианты FasterNet-TO/L)
Research Subject
Улучшение реальной скорости инференса (пропускной способности/задержки) за счёт повышения эффективных FLOPS и сокращения обращений к памяти посредством оператора частичной свёртки, чтобы обеспечить более высокую скорость работы без потери точности для задач компьютерного зрения
Publication Details
Publication Date
2023-06-01
Journal
Publisher
ISSN
Cited by
2252
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Дистилляция знаний в нейронной сети2015