Ускорение обработки данных на GPU с использованием сжатия FastLanes

Accelerating GPU Data Processing using FastLanes Compression
Peter Boncz, Azim Afroozeh, Lotte Felius
2024-05-30

сжатие FastLanesобработка данных на GPUдекомпрессия на GPUзапросы SSBсжатое столбцовое хранение
Мы показываем, что сжатие может обеспечить двойной выигрыш при обработке данных на GPU: оно не только позволяет хранить больше данных в глобальной памяти GPU, но и может ускорить обработку данных. Мы показываем, что полный пересмотр сжатого столбцового хранения в FastLanes, использующего полностью распараллеленные по данным методы битовой упаковки и кодирования, также обеспечивает преимущества для аппаратных средств GPU. Мы проводим микроbenchmarking производительности FastLanes на двух архитектурах GPU (NVIDIA T4 и V100) и интегрируем FastLanes в прототип обработки запросов на GPU Crystal. Результаты экспериментов показывают, что декомпрессия FastLanes значительно превосходит предыдущие методы декомпрессии в микроbenchmarking-тестах и может ускорить сквозное выполнение запросов SSB до двух раз по сравнению с обработкой запросов без сжатия — в отличие от предыдущих работ, в которых декомпрессия на GPU приводила к замедлению выполнения. Кроме того, мы обнаружили, что гранулярность доступа при декодировании векторов из 1024 значений слишком велика для одного GPU-варпа из-за нагрузки на регистры. Для устранения этой проблемы мы используем мини-векторы; вопрос о дальнейшем снижении этой гранулярности при минимальном влиянии на эффективность остается задачей будущих исследований.
1
Декодирование векторов по 1024 значения создает чрезмерное давление на регистры одного GPU-варпа; мини-векторы смягчают это ограничение, однако дальнейшее уменьшение гранулярности остается задачей будущих исследований.
2
Декомпрессия FastLanes значительно превосходит предыдущие методы декомпрессии в микро-бенчмарках на Nvidia T4 и V100.
3
FastLanes перерабатывает сжатое колоночное хранение, используя полностью распараллеленные по данным битовую упаковку и кодирование, подходящие для GPU.
4
Интеграция FastLanes в GPU-систему обработки запросов Crystal ускоряет сквозное выполнение запросов SSB до двух раз по сравнению с обработкой несжатых данных.
5
В отличие от предыдущих работ, декомпрессия на GPU с FastLanes ускоряет выполнение запросов, а не замедляет его.

Сжатое столбцовое хранилище FastLanes и распаковка данных для обработки на GPU

Производительность обработки на GPU, эффективность хранения и гранулярность декодирования при использовании сжатия FastLanes по сравнению с обработкой несжатых данных и предыдущими методами распаковки

Publication Details
Publication Date
2024-05-30
Journal
Publisher
ISSN
Cited by
21
Access Type
Author Information
Authors
Peter Boncz
Azim Afroozeh
Lotte Felius
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%