Informer: эффективный трансформер для прогнозирования временных рядов большой длины и дальнейшее развитие этого подхода

Informer: Beyond Efficient Transformer for Long Sequence Time-Series Forecasting
Hui Xiong, Shuai Zhang, Haoyi Zhou, Shanghang Zhang, Jieqi Peng, Jianxin Li, Wancai Zhang, Jieqi Peng
2021-05-18

Декодер генеративного типаInformerДолгосрочное прогнозирование временных рядовProbSparse-самовниманиеДистилляция самовнимания
Во многих практических приложениях требуется прогнозирование временных рядов большой длины, например при планировании потребления электроэнергии. Прогнозирование временных рядов большой длины (Long Sequence Time-Series Forecasting, LSTF) предъявляет к модели высокие требования в отношении прогностической способности, то есть способности эффективно выявлять точные дальние зависимости между выходными и входными данными. Недавние исследования продемонстрировали потенциал трансформеров для повышения прогностической способности. Однако трансформеры имеют несколько серьезных ограничений, препятствующих их непосредственному применению к задаче LSTF, включая квадратичную временную сложность, высокое потребление памяти и inherentное ограничение архитектуры кодировщик–декодировщик. Для решения этих проблем мы разработали эффективную модель на основе трансформера для LSTF, названную Informer, обладающую тремя отличительными характеристиками: (i) механизмом самовнимания ProbSparse, обеспечивающим временную сложность и использование памяти O(L log L) при сопоставимой эффективности выравнивания зависимостей в последовательности; (ii) дистилляцией самовнимания, выделяющей доминирующие зависимости за счет уменьшения вдвое входных данных последующих слоев и эффективно обрабатывающей чрезвычайно длинные входные последовательности; и (iii) декодером генеративного типа, который, несмотря на концептуальную простоту, прогнозирует длинные временные последовательности за одну прямую операцию вместо пошагового режима, что значительно повышает скорость вывода при прогнозировании последовательностей большой длины. Масштабные эксперименты на четырех крупномасштабных наборах данных показывают, что Informer значительно превосходит существующие методы и предлагает новое решение задачи LSTF.
1
Декодер в генеративном стиле предсказывает всю длинную последовательность за один прямой проход вместо пошагового прогнозирования, существенно ускоряя вывод.
2
Эксперименты на четырёх крупномасштабных наборах данных показывают, что Informer значительно превосходит существующие методы прогнозирования длинных временных рядов.
3
Представлена Informer — эффективная модель на основе Transformer, специально разработанная для прогнозирования длинных временных рядов.
4
Механизм ProbSparse self-attention снижает временную и пространственную сложность до O(L log L), сохраняя сопоставимое качество выравнивания зависимостей.
5
Дистилляция self-attention последовательно уменьшает входы каскадных слоёв вдвое, выделяет доминирующее внимание и эффективно обрабатывает чрезвычайно длинные входные последовательности.

Задача прогнозирования длинных временных рядов (предсказание временных рядов с длинной последовательностью)

эффективное моделирование дальних зависимостей и качество прогнозирования при ограничениях вычислительных ресурсов и памяти

Publication Details
Publication Date
2021-05-18
Journal
Publisher
ISSN
Cited by
6934
Access Type
Author Information
Authors
Hui Xiong
Shuai Zhang
Haoyi Zhou
Shanghang Zhang
Jieqi Peng
Jianxin Li
Wancai Zhang
Jieqi Peng
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%