Чрезвычайно большие нейронные сети: слой разреженно управляемой смеси экспертов

Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
Noam Shazeer, Quoc V. Le, Geoffrey E. Hinton, Jeff Dean, Andy Davis, Azalia Mirhoseini, Krzysztof Maziarz
2017-01-23

Mixture-of-Experts (MoE)Sparsely-Gated Mixture-of-Expertsусловные вычисленияязыковое моделирование и машинный перевод в крупном масштаберазреженная сеть гейтеров
Емкость нейронной сети по поглощению информации ограничена числом её параметров. Условные вычисления, при которых части сети активируются для каждого примера индивидуально, теоретически были предложены как способ существенного увеличения ёмкости модели без пропорционального увеличения вычислительных затрат. На практике, однако, возникают значительные алгоритмические и производительные проблемы. В этой работе мы решаем эти проблемы и в конечном счёте реализуем обещание условных вычислений, добившись более чем 1000× увеличения ёмкости модели при лишь незначительных потерях вычислительной эффективности на современных кластерах GPU. Мы вводим слой разреженно управляемой смеси экспертов (Mixture-of-Experts, MoE), состоящий из до тысяч полносвязных подсетей. Обучаемая сеть-«гейт» определяет разреженную комбинацию этих экспертов для использования в каждом примере. Мы применяем MoE к задачам языкового моделирования и машинного перевода, где ёмкость модели критична для усвоения огромного объёма знаний, содержащихся в обучающих корпусах. Мы представляем архитектуры моделей, в которых MoE с до 137 миллиардов параметров применяется сверточно между сложенными слоями LSTM. На больших бенчмарках по языковому моделированию и машинному переводу эти модели достигают существенно лучших результатов по сравнению с передовым уровнем при более низкой вычислительной стоимости.
1
MoE применен к моделированию языка и машинному переводу, достигая существенно лучших результатов, чем современное состояние дел, при меньших вычислительных затратах.
2
Построены архитектуры, в которых MoE (до 137 миллиардов параметров) применяется сверткообразно между уровнями стековых LSTM.
3
Введен слой Sparsely-Gated Mixture-of-Experts (MoE) с до тысячами прямых подсетей и обучаемой разреженной сетью выбора экспертов.
4
Реализована условная вычислительная схема, обеспечивающая более чем 1000-кратное увеличение емкости модели при лишь незначительных потерях вычислительной эффективности на современных GPU-кластерах.

Сло́й Sparsely-Gated Mixture-of-Experts (MoE), состоящий из до тысяч feed-forward подсетей, используемый в архитектурах нейронных сетей для моделирования языка и машинного перевода

Масштабирование ёмкости модели и условная вычислительная схема через разреженную селекцию экспертов: покомпонентный выбор экспертов, позволяющий достигать огромного числа параметров (до 137 млрд) при незначительном дополнительном вычислительном расходе и улучшенной производительности на больших бенчмарках по моделированию языка и машинному переводу

Publication Details
Publication Date
2017-01-23
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Noam Shazeer
Quoc V. Le
Geoffrey E. Hinton
Jeff Dean
Andy Davis
Azalia Mirhoseini
Krzysztof Maziarz
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%