Обзор алгоритмов с экономным использованием данных в эпоху больших данных
A survey on data‐efficient algorithms in big data era
2021-01-26
SCID: 54.1/m3c9s6rp
Discuss with AI
увеличение данныхалгоритмы, эффективные по даннымобучение на малых выборкахперенос обученияобучение без учителя
Figures from the paper
Abstract (AI)
Ведущие подходы в машинном обучении печально известны своей «прожорливостью» к данным. К сожалению, во многих областях применения нет доступа к большим объёмам данных, поскольку их получение связано с дорогостоящими или времязатратными процедурами. Это вызвало серьёзные дискуссии в промышленной и академической среде, призывающие к созданию более экономичных по данным моделей, которые используют потенциал искусственных обучающих систем и при этом достигают хороших результатов с меньшим объёмом обучающих данных и, в частности, с меньшим объёмом ручной разметки. В свете этой дискуссии в работе исследуется проблема «прожорливости» алгоритмов к данным. Во-первых, рассматривается проблема с различных точек зрения. Затем приводится всесторонний обзор существующих методов, экономных по данным, и систематизация их в четыре категории. Конкретно, обзор охватывает стратегии решений, направленные на повышение эффективности использования данных: (i) применение неконтролируемых алгоритмов, которые по природе своей более экономны в отношении данных, (ii) искусственное увеличение объёма данных, (iii) перенос знаний из доменов с богатой выборкой в домены с ограниченными данными, и (iv) модификация «прожорливых» к данным алгоритмов с целью уменьшения их зависимости от объёма образцов так, чтобы они могли хорошо работать в условиях малых выборок. Каждая стратегия детально рассматривается и обсуждается. Дополнительно делается упор на то, как четыре стратегии взаимодействуют между собой для стимулирования разработки более надёжных и экономичных по данным алгоритмов. Наконец, обзор выделяет существующие ограничения, обсуждает исследовательские задачи и предлагает перспективы для дальнейшего развития исследований по эффективности использования данных в машинном обучении.
Key Findings
1
Модификация требовательных к данным алгоритмов позволяет снизить их зависимость от числа образцов и добиться хорошей работы в режимах с малыми выборками.
2
Создание искусственных данных (аугментация) — отдельная стратегия для увеличения эффективного числа обучающих примеров и улучшения качества при ограниченных реальных данных.
3
Методы машинного обучения в целом требовательны к данным, а во многих прикладных областях отсутствуют большие размеченные наборы из‑за дорогого или длительного сбора данных.
4
Статья выделяет ограничения, исследовательские вызовы и будущие возможности для развития эффективности использования данных в машинном обучении.
5
Обзор акцентирует внимание на взаимодействии четырёх стратегий, предлагая их комбинацию для создания более устойчивых и эффективных по данным алгоритмов.
6
Обзор систематизирует подходы к повышению эффективности данных в четыре стратегии: несупервизированные алгоритмы, генерация искусственных данных, перенос обучения и модификация алгоритмов для малых выборок.
7
Перенос знаний из доменов с большими данными в домены с малыми данными является ключевым подходом для использования существующих размеченных ресурсов.
8
Несупервизированные алгоритмы характеризуются как по сути более эффективные по данным и служат основным способом уменьшить зависимость от размеченных данных.
Research Object
алгоритмы машинного обучения, эффективные по использованию данных
Research Subject
методы и стратегии уменьшения «прожорливости» алгоритмов по данным, обеспечивающие хорошую производительность при ограниченных тренировочных данных и сниженной аннотации (включая не‑контролируемые методы, увеличение данных, перенос знаний и адаптацию алгоритмов)
Publication Details
Publication Date
2021-01-26
Journal
Publisher
ISSN
Cited by
332
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest