Обзор алгоритмов с экономным использованием данных в эпоху больших данных

A survey on data‐efficient algorithms in big data era
Amina Adadi
2021-01-26

увеличение данныхалгоритмы, эффективные по даннымобучение на малых выборкахперенос обученияобучение без учителя
Ведущие подходы в машинном обучении печально известны своей «прожорливостью» к данным. К сожалению, во многих областях применения нет доступа к большим объёмам данных, поскольку их получение связано с дорогостоящими или времязатратными процедурами. Это вызвало серьёзные дискуссии в промышленной и академической среде, призывающие к созданию более экономичных по данным моделей, которые используют потенциал искусственных обучающих систем и при этом достигают хороших результатов с меньшим объёмом обучающих данных и, в частности, с меньшим объёмом ручной разметки. В свете этой дискуссии в работе исследуется проблема «прожорливости» алгоритмов к данным. Во-первых, рассматривается проблема с различных точек зрения. Затем приводится всесторонний обзор существующих методов, экономных по данным, и систематизация их в четыре категории. Конкретно, обзор охватывает стратегии решений, направленные на повышение эффективности использования данных: (i) применение не­контролируемых алгоритмов, которые по природе своей более экономны в отношении данных, (ii) искусственное увеличение объёма данных, (iii) перенос знаний из доменов с богатой выборкой в домены с ограниченными данными, и (iv) модификация «прожорливых» к данным алгоритмов с целью уменьшения их зависимости от объёма образцов так, чтобы они могли хорошо работать в условиях малых выборок. Каждая стратегия детально рассматривается и обсуждается. Дополнительно делается упор на то, как четыре стратегии взаимодействуют между собой для стимулирования разработки более надёжных и экономичных по данным алгоритмов. Наконец, обзор выделяет существующие ограничения, обсуждает исследовательские задачи и предлагает перспективы для дальнейшего развития исследований по эффективности использования данных в машинном обучении.
1
Модификация требовательных к данным алгоритмов позволяет снизить их зависимость от числа образцов и добиться хорошей работы в режимах с малыми выборками.
2
Создание искусственных данных (аугментация) — отдельная стратегия для увеличения эффективного числа обучающих примеров и улучшения качества при ограниченных реальных данных.
3
Методы машинного обучения в целом требовательны к данным, а во многих прикладных областях отсутствуют большие размеченные наборы из‑за дорогого или длительного сбора данных.
4
Статья выделяет ограничения, исследовательские вызовы и будущие возможности для развития эффективности использования данных в машинном обучении.
5
Обзор акцентирует внимание на взаимодействии четырёх стратегий, предлагая их комбинацию для создания более устойчивых и эффективных по данным алгоритмов.
6
Обзор систематизирует подходы к повышению эффективности данных в четыре стратегии: несупервизированные алгоритмы, генерация искусственных данных, перенос обучения и модификация алгоритмов для малых выборок.
7
Перенос знаний из доменов с большими данными в домены с малыми данными является ключевым подходом для использования существующих размеченных ресурсов.
8
Несупервизированные алгоритмы характеризуются как по сути более эффективные по данным и служат основным способом уменьшить зависимость от размеченных данных.

алгоритмы машинного обучения, эффективные по использованию данных

методы и стратегии уменьшения «прожорливости» алгоритмов по данным, обеспечивающие хорошую производительность при ограниченных тренировочных данных и сниженной аннотации (включая не‑контролируемые методы, увеличение данных, перенос знаний и адаптацию алгоритмов)

Publication Details
Publication Date
2021-01-26
Journal
Publisher
ISSN
Cited by
332
Access Type
Author Information
Authors
Amina Adadi
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%