Pre-gated MoE: совместный дизайн алгоритма и системы для быстрого и масштабируемого вывода в архитектуре Mixture-of-Experts
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
2024-06-29
SCID: 54.1/v2mqtu3e
Discuss with AI
оптимизация инференса больших языковых моделейMixture-of-ExpertsPre-gated MoEфункция предварительной маршрутизацииразреженная активация экспертов
Figures from the paper
Abstract (AI)
Трансформерные большие языковые модели (LLM) достигли значительного прогресса в последние годы, что обусловлено увеличением их размера. Несмотря на высокую алгоритмическую эффективность, вычислительные и памятьные требования LLM создают беспрецедентные трудности. Для снижения вычислительной нагрузки LLM была предложена архитектура Mixture-of-Experts (MoE), позволяющая масштабировать размер модели без пропорционального роста вычислительных затрат. Однако высокие требования MoE к памяти и динамическая активация разреженных экспертов ограничивают её применимость в реальных задачах. Предыдущие решения, выносящие «тяжёлые» параметры экспертов в память CPU, оказываются неэффективными из‑за задержек при переносе активируемых экспертов с CPU на GPU, что приводит к серьёзным накладным расходам по времени. Наше предлагаемое решение Pre-gated MoE эффективно справляется с вычислительными и памятьными проблемами традиционных MoE за счёт совместного дизайна алгоритма и системы. Pre-gated MoE использует новую функцию предварительного гейтинга (pre-gating), которая смягчает динамическую природу активации разреженных экспертов, позволяя системе уменьшить объём занимаемой памяти при сохранении высокой производительности. Мы показываем, что Pre-gated MoE улучшает производительность и снижает потребление GPU-памяти при сохранении уровня качества модели. Эти свойства позволяют системе Pre-gated MoE экономично разворачивать масштабные LLM, используя всего один GPU с высокой производительностью.
Key Findings
1
Предложен Pre-gated MoE — совместная алгоритмическо-системная разработка с новой функцией предварительного гейтинга для уменьшения динамической активации разреженных экспертов.
2
Pre-gated MoE снижает большой объём памяти MoE, позволяя управлять параметрами экспертов без частых миграций с CPU на GPU.
3
Pre-gated MoE обеспечивает экономичное развертывание крупных LLM на одном GPU с высокой производительностью.
4
Система улучшает производительность и уменьшает потребление GPU-памяти по сравнению с традиционными MoE при сохранении эквивалентного качества модели.
Research Object
Система Pre-gated Mixture-of-Experts (MoE) для вывода в больших языковых моделях
Research Subject
Ко-дизайн алгоритма и системы с новой функцией предварительного гейтинга, устраняющей динамическую активацию разреженных экспертов, уменьшающей потребление GPU-памяти и повышающей производительность и масштабируемость вывода при сохранении качества модели
Publication Details
Publication Date
2024-06-29
Journal
Publisher
ISSN
Cited by
48
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
PaLM: Масштабирование языкового моделирования с помощью Pathways2022
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019
Transformers от HuggingFace: современные методы обработки естественного языка2019
Пайплайн с поддержкой ИИ для динамической генерации достоверного контента о биологически активных добавках в масштабе2018