Ускорение обработки данных на GPU с использованием сжатия FastLanes
Accelerating GPU Data Processing using FastLanes Compression
2024-05-30
SCID: 54.1/nedtn4af
Discuss with AI
сжатие FastLanesобработка данных на GPUдекомпрессия на GPUзапросы SSBсжатое столбцовое хранение
Figures from the paper
Abstract (AI)
Мы показываем, что сжатие может обеспечить двойной выигрыш при обработке данных на GPU: оно не только позволяет хранить больше данных в глобальной памяти GPU, но и может ускорить обработку данных. Мы показываем, что полный пересмотр сжатого столбцового хранения в FastLanes, использующего полностью распараллеленные по данным методы битовой упаковки и кодирования, также обеспечивает преимущества для аппаратных средств GPU. Мы проводим микроbenchmarking производительности FastLanes на двух архитектурах GPU (NVIDIA T4 и V100) и интегрируем FastLanes в прототип обработки запросов на GPU Crystal. Результаты экспериментов показывают, что декомпрессия FastLanes значительно превосходит предыдущие методы декомпрессии в микроbenchmarking-тестах и может ускорить сквозное выполнение запросов SSB до двух раз по сравнению с обработкой запросов без сжатия — в отличие от предыдущих работ, в которых декомпрессия на GPU приводила к замедлению выполнения. Кроме того, мы обнаружили, что гранулярность доступа при декодировании векторов из 1024 значений слишком велика для одного GPU-варпа из-за нагрузки на регистры. Для устранения этой проблемы мы используем мини-векторы; вопрос о дальнейшем снижении этой гранулярности при минимальном влиянии на эффективность остается задачей будущих исследований.
Key Findings
1
Декодирование векторов по 1024 значения создает чрезмерное давление на регистры одного GPU-варпа; мини-векторы смягчают это ограничение, однако дальнейшее уменьшение гранулярности остается задачей будущих исследований.
2
Декомпрессия FastLanes значительно превосходит предыдущие методы декомпрессии в микро-бенчмарках на Nvidia T4 и V100.
3
FastLanes перерабатывает сжатое колоночное хранение, используя полностью распараллеленные по данным битовую упаковку и кодирование, подходящие для GPU.
4
Интеграция FastLanes в GPU-систему обработки запросов Crystal ускоряет сквозное выполнение запросов SSB до двух раз по сравнению с обработкой несжатых данных.
5
В отличие от предыдущих работ, декомпрессия на GPU с FastLanes ускоряет выполнение запросов, а не замедляет его.
Research Object
Сжатое столбцовое хранилище FastLanes и распаковка данных для обработки на GPU
Research Subject
Производительность обработки на GPU, эффективность хранения и гранулярность декодирования при использовании сжатия FastLanes по сравнению с обработкой несжатых данных и предыдущими методами распаковки
Publication Details
Publication Date
2024-05-30
Journal
Publisher
ISSN
Cited by
21
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest