Чрезвычайно большие нейронные сети: слой разреженно управляемой смеси экспертов
Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
2017-01-23
SCID: 54.1/ttrgmtdv
Discuss with AI
Mixture-of-Experts (MoE)Sparsely-Gated Mixture-of-Expertsусловные вычисленияязыковое моделирование и машинный перевод в крупном масштаберазреженная сеть гейтеров
Figures from the paper
Abstract (AI)
Емкость нейронной сети по поглощению информации ограничена числом её параметров. Условные вычисления, при которых части сети активируются для каждого примера индивидуально, теоретически были предложены как способ существенного увеличения ёмкости модели без пропорционального увеличения вычислительных затрат. На практике, однако, возникают значительные алгоритмические и производительные проблемы. В этой работе мы решаем эти проблемы и в конечном счёте реализуем обещание условных вычислений, добившись более чем 1000× увеличения ёмкости модели при лишь незначительных потерях вычислительной эффективности на современных кластерах GPU. Мы вводим слой разреженно управляемой смеси экспертов (Mixture-of-Experts, MoE), состоящий из до тысяч полносвязных подсетей. Обучаемая сеть-«гейт» определяет разреженную комбинацию этих экспертов для использования в каждом примере. Мы применяем MoE к задачам языкового моделирования и машинного перевода, где ёмкость модели критична для усвоения огромного объёма знаний, содержащихся в обучающих корпусах. Мы представляем архитектуры моделей, в которых MoE с до 137 миллиардов параметров применяется сверточно между сложенными слоями LSTM. На больших бенчмарках по языковому моделированию и машинному переводу эти модели достигают существенно лучших результатов по сравнению с передовым уровнем при более низкой вычислительной стоимости.
Key Findings
1
MoE применен к моделированию языка и машинному переводу, достигая существенно лучших результатов, чем современное состояние дел, при меньших вычислительных затратах.
2
Построены архитектуры, в которых MoE (до 137 миллиардов параметров) применяется сверткообразно между уровнями стековых LSTM.
3
Введен слой Sparsely-Gated Mixture-of-Experts (MoE) с до тысячами прямых подсетей и обучаемой разреженной сетью выбора экспертов.
4
Реализована условная вычислительная схема, обеспечивающая более чем 1000-кратное увеличение емкости модели при лишь незначительных потерях вычислительной эффективности на современных GPU-кластерах.
Research Object
Сло́й Sparsely-Gated Mixture-of-Experts (MoE), состоящий из до тысяч feed-forward подсетей, используемый в архитектурах нейронных сетей для моделирования языка и машинного перевода
Research Subject
Масштабирование ёмкости модели и условная вычислительная схема через разреженную селекцию экспертов: покомпонентный выбор экспертов, позволяющий достигать огромного числа параметров (до 137 млрд) при незначительном дополнительном вычислительном расходе и улучшенной производительности на больших бенчмарках по моделированию языка и машинному переводу
Publication Details
Publication Date
2017-01-23
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest