GQA: обучение обобщённых трансформерных моделей с grouped-query attention на основе чекпоинтов с многоголовым вниманием

GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints
Joshua Ainslie, James Lee-Thorp, Michiel de Jong, Yury Zemlyanskiy, Federico Lebrón, Sumit Sanghai
2023-01-01

ускорение вывода декодерагруппированное-внимание запросовмного-запросное вниманиеэкономия вычислений при предобучениидоподготовка из контрольных точек с многоголовой вниманием
Multi-query attention (MQA), использующее одну пару ключ–значение, существенно ускоряет вывод декодера. Однако MQA может приводить к снижению качества, и может быть нежелательно обучать отдельную модель исключительно для более быстрого вывода. Мы (1) предлагаем процедуру дообучения (uptraining) существующих чекпоинтов языковых моделей с многоголовым вниманием в модели с MQA, используя 5% от изначальных вычислительных ресурсов предобучения, и (2) вводим grouped-query attention (GQA) — обобщение multi-query attention, которое использует промежуточное число пар ключ–значение (больше одной, но меньше числа голов запросов). Мы показываем, что дообученная GQA достигает качества, близкого к многоголовому вниманию, при скорости, сопоставимой с MQA.
1
Предложен рецепт доподготовки существующих чекпойнтов моделей с несколькими головами в модели с мульти-запросным вниманием (MQA) с использованием всего 5% от исходной вычислительной стоимости предобучения.
2
Введено группированное запросное внимание (GQA) как обобщение MQA, использующее промежуточное число голов ключ-значение (более одной, но меньше числа голов запросов).
3
Подход доподготовки позволяет преобразовывать модели в форматы для более быстрого вывода (MQA/GQA) без обучения отдельных моделей с нуля.
4
Доподготовленные модели GQA достигают качества, близкого к вниманию с несколькими головами, при скорости вывода, сопоставимой с MQA.

Декодерные языковые модели на базе трансформера (варианты с многоголовым, мульти‑запросным и группированным‑запросным вниманием), полученные из контрольных точек с многоголовым вниманием

Методы дообучения (uptraining) контрольных точек с многоголовым вниманием в модели с мульти‑запросным и группированным‑запросным вниманием с минимальными дополнительными вычислительными затратами предобучения и оценка возникающего компромисса между скоростью вывода и качеством по сравнению с многоголовым вниманием

Publication Details
Publication Date
2023-01-01
Journal
Publisher
ISSN
Cited by
388
Access Type
Author Information
Authors
Joshua Ainslie
James Lee-Thorp
Michiel de Jong
Yury Zemlyanskiy
Federico Lebrón
Sumit Sanghai
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%