Беги, не иди: в поисках более высокой FLOPS для более быстрых нейронных сетей

Run, Don't Walk: Chasing Higher FLOPS for Faster Neural Networks
Chul‐Ho Lee, S.-H. Gary Chan, Jierun Chen, Shiu-hong Kao, Hao He, Weipeng Zhuo, Wen Song
2023-06-01

FLOPs vs FLOPS (операции с плавающей запятой в секунду)FasterNetглубинная свёрткапропускная способность / задержка при выводе на GPU, CPU, ARMчастичная свёртка (PConv)
Для создания быстрых нейронных сетей многие работы сосредоточены на сокращении числа операций с плавающей запятой (FLOPs). Мы отмечаем, что такое снижение FLOPs не обязательно приводит к аналогичному снижению задержки. Это в основном связано с неэффективно низкой скоростью выполнения операций с плавающей запятой в секунду (FLOPS). Чтобы добиться более быстрых сетей, мы пересматриваем популярные операторы и демонстрируем, что низкие FLOPS обусловлены частым доступом к памяти операторов, особенно глубинной свёртки (depthwise convolution). Мы предлагаем новый частичный свёрточный оператор (PConv), который извлекает пространственные признаки более эффективно, одновременно сокращая избыточные вычисления и обращения к памяти. На основе PConv мы далее предлагаем FasterNet — новое семейство нейронных сетей, которое достигает существенно большей скорости работы по широкому кругу устройств, не уступая в точности для различных задач компьютерного зрения. Например, на ImageNet-1k наш миниатюрный FasterNet-T0 в 2.8×, 3.3× и 2.4× быстрее MobileViT-XXS на GPU, CPU и ARM-процессорах соответственно, при этом на 2.9% точнее. Наш большой FasterNet-L демонстрирует впечатляющие 83.5% top-1 точности, сопоставимые с развивающейся Swin-B, при этом обеспечивая на 36% большую пропускную способность при инференсе на GPU и экономя 37% времени вычислений на CPU. Код доступен по адресу https://github.com/JierunChen/FasterNet.
1
FasterNet, построенная на PConv, обеспечивает существенно более высокую скорость работы на разных устройствах без компромисса по точности в задачах компьютерного зрения.
2
FasterNet-L (большая) достигает 83.5% точности top-1 (сопоставимо с Swin-B), обеспечивая при этом на 36% большую пропускную способность при выводе на GPU и экономя 37% времени вычислений на CPU.
3
FasterNet-TO (маленькая) в 2.8×, 3.3× и 2.4× быстрее MobileViT-XXS на GPU, CPU и ARM соответственно и при этом на 2.9% точнее на ImageNet-1k.
4
Сокращение FLOPs не обязательно уменьшает задержку, поскольку многие сети имеют неэффективно низкий показатель FLOPS из-за частого доступа к памяти, особенно в depthwise-свертках.
5
Авторы предлагают частичную свертку (PConv), которая сокращает избыточные вычисления и доступ к памяти для более эффективного извлечения пространственных признаков.

Семейство архитектур нейронных сетей FasterNet (включая предложенную частичную свёртку PConv и варианты FasterNet-TO/L)

Улучшение реальной скорости инференса (пропускной способности/задержки) за счёт повышения эффективных FLOPS и сокращения обращений к памяти посредством оператора частичной свёртки, чтобы обеспечить более высокую скорость работы без потери точности для задач компьютерного зрения

Publication Details
Publication Date
2023-06-01
Journal
Publisher
ISSN
Cited by
2252
Access Type
Author Information
Authors
Chul‐Ho Lee
S.-H. Gary Chan
Jierun Chen
Shiu-hong Kao
Hao He
Weipeng Zhuo
Wen Song
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%