Pre-gated MoE: совместный дизайн алгоритма и системы для быстрого и масштабируемого вывода в архитектуре Mixture-of-Experts

Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
Ranggi Hwang, Jianyu Wei, Shijie Cao, Chang Ho Hwang, Xiaohu Tang, Ting Cao, Mao Yang
2024-06-29

оптимизация инференса больших языковых моделейMixture-of-ExpertsPre-gated MoEфункция предварительной маршрутизацииразреженная активация экспертов
Трансформерные большие языковые модели (LLM) достигли значительного прогресса в последние годы, что обусловлено увеличением их размера. Несмотря на высокую алгоритмическую эффективность, вычислительные и памятьные требования LLM создают беспрецедентные трудности. Для снижения вычислительной нагрузки LLM была предложена архитектура Mixture-of-Experts (MoE), позволяющая масштабировать размер модели без пропорционального роста вычислительных затрат. Однако высокие требования MoE к памяти и динамическая активация разреженных экспертов ограничивают её применимость в реальных задачах. Предыдущие решения, выносящие «тяжёлые» параметры экспертов в память CPU, оказываются неэффективными из‑за задержек при переносе активируемых экспертов с CPU на GPU, что приводит к серьёзным накладным расходам по времени. Наше предлагаемое решение Pre-gated MoE эффективно справляется с вычислительными и памятьными проблемами традиционных MoE за счёт совместного дизайна алгоритма и системы. Pre-gated MoE использует новую функцию предварительного гейтинга (pre-gating), которая смягчает динамическую природу активации разреженных экспертов, позволяя системе уменьшить объём занимаемой памяти при сохранении высокой производительности. Мы показываем, что Pre-gated MoE улучшает производительность и снижает потребление GPU-памяти при сохранении уровня качества модели. Эти свойства позволяют системе Pre-gated MoE экономично разворачивать масштабные LLM, используя всего один GPU с высокой производительностью.
1
Предложен Pre-gated MoE — совместная алгоритмическо-системная разработка с новой функцией предварительного гейтинга для уменьшения динамической активации разреженных экспертов.
2
Pre-gated MoE снижает большой объём памяти MoE, позволяя управлять параметрами экспертов без частых миграций с CPU на GPU.
3
Pre-gated MoE обеспечивает экономичное развертывание крупных LLM на одном GPU с высокой производительностью.
4
Система улучшает производительность и уменьшает потребление GPU-памяти по сравнению с традиционными MoE при сохранении эквивалентного качества модели.

Система Pre-gated Mixture-of-Experts (MoE) для вывода в больших языковых моделях

Ко-дизайн алгоритма и системы с новой функцией предварительного гейтинга, устраняющей динамическую активацию разреженных экспертов, уменьшающей потребление GPU-памяти и повышающей производительность и масштабируемость вывода при сохранении качества модели

Publication Details
Publication Date
2024-06-29
Journal
Publisher
ISSN
Cited by
48
Access Type
Author Information
Authors
Ranggi Hwang
Jianyu Wei
Shijie Cao
Chang Ho Hwang
Xiaohu Tang
Ting Cao
Mao Yang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%