Informer: эффективный трансформер для прогнозирования временных рядов большой длины и дальнейшее развитие этого подхода
Informer: Beyond Efficient Transformer for Long Sequence Time-Series Forecasting
2021-05-18
SCID: 54.1/6p49mjhk
Discuss with AI
Декодер генеративного типаInformerДолгосрочное прогнозирование временных рядовProbSparse-самовниманиеДистилляция самовнимания
Figures from the paper
Abstract (AI)
Во многих практических приложениях требуется прогнозирование временных рядов большой длины, например при планировании потребления электроэнергии. Прогнозирование временных рядов большой длины (Long Sequence Time-Series Forecasting, LSTF) предъявляет к модели высокие требования в отношении прогностической способности, то есть способности эффективно выявлять точные дальние зависимости между выходными и входными данными. Недавние исследования продемонстрировали потенциал трансформеров для повышения прогностической способности. Однако трансформеры имеют несколько серьезных ограничений, препятствующих их непосредственному применению к задаче LSTF, включая квадратичную временную сложность, высокое потребление памяти и inherentное ограничение архитектуры кодировщик–декодировщик. Для решения этих проблем мы разработали эффективную модель на основе трансформера для LSTF, названную Informer, обладающую тремя отличительными характеристиками: (i) механизмом самовнимания ProbSparse, обеспечивающим временную сложность и использование памяти O(L log L) при сопоставимой эффективности выравнивания зависимостей в последовательности; (ii) дистилляцией самовнимания, выделяющей доминирующие зависимости за счет уменьшения вдвое входных данных последующих слоев и эффективно обрабатывающей чрезвычайно длинные входные последовательности; и (iii) декодером генеративного типа, который, несмотря на концептуальную простоту, прогнозирует длинные временные последовательности за одну прямую операцию вместо пошагового режима, что значительно повышает скорость вывода при прогнозировании последовательностей большой длины. Масштабные эксперименты на четырех крупномасштабных наборах данных показывают, что Informer значительно превосходит существующие методы и предлагает новое решение задачи LSTF.
Key Findings
1
Декодер в генеративном стиле предсказывает всю длинную последовательность за один прямой проход вместо пошагового прогнозирования, существенно ускоряя вывод.
2
Эксперименты на четырёх крупномасштабных наборах данных показывают, что Informer значительно превосходит существующие методы прогнозирования длинных временных рядов.
3
Представлена Informer — эффективная модель на основе Transformer, специально разработанная для прогнозирования длинных временных рядов.
4
Механизм ProbSparse self-attention снижает временную и пространственную сложность до O(L log L), сохраняя сопоставимое качество выравнивания зависимостей.
5
Дистилляция self-attention последовательно уменьшает входы каскадных слоёв вдвое, выделяет доминирующее внимание и эффективно обрабатывает чрезвычайно длинные входные последовательности.
Research Object
Задача прогнозирования длинных временных рядов (предсказание временных рядов с длинной последовательностью)
Research Subject
эффективное моделирование дальних зависимостей и качество прогнозирования при ограничениях вычислительных ресурсов и памяти
Publication Details
Publication Date
2021-05-18
Journal
Publisher
ISSN
Cited by
6934
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai10
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Фреймворк Aion: размерное возникновение сознания ИИ, коллапс под воздействием наблюдателя и динамика космологических порталов2023
Longformer: трансформер для длинных документов2020
Transformer-XL: внимательные языковые модели за пределами контекста фиксированной длины2019
Пайплайн с поддержкой ИИ для динамической генерации достоверного контента о биологически активных добавках в масштабе2018
Обучение «последовательность-в-последовательность» с помощью нейронных сетей2014
О свойствах нейронного машинного перевода: подходы энкодер–декодер2014
Нейронный машинный перевод посредством совместного обучения выравниванию и переводу2014
Прогнозирование цены акций с использованием модели ARIMA2014
О свойствах нейронного машинного перевода: подходы энкодер–декодер2014
Работы, цитирующие эту статью7
Эффективны ли трансформеры для прогнозирования временных рядов?2023
Трансформеры во временных рядах: обзор2023
Комплексный обзор глубокого обучения для прогнозирования временных рядов: архитектурное разнообразие и нерешённые проблемы2025
Когда физика встречает машинное обучение: обзор physics-informed machine learning2025
TimesURL: самоконтролируемое контрастивное обучение для универсального представления временных рядов2024
Физически информированное машинное обучение в геотехнической инженерии: обзор перспективных направлений2025
Временная сеть на основе характеристики и извлечения временных рядов в медеплавильном процессе для прогнозирования степени матового концентрата2024