Эмпирическая оценка колоночных форматов хранения данных
An Empirical Evaluation of Columnar Storage Formats
2023-10-01
SCID: 54.1/g6fa5nf8
Discuss with AI
Apache ORCApache Parquetоценка на основе бенчмаркаколоночные форматы хранениясловарное кодирование
Figures from the paper
Abstract (AI)
Колоночное хранение является ключевым компонентом современной системы аналитики данных. Хотя многие системы управления базами данных (СУБД) используют проприетарные форматы хранения, большинство из них обеспечивает широкую поддержку открытых форматов хранения, таких как Parquet и ORC, для упрощения кроссплатформенного обмена данными. Однако эти форматы были разработаны более десяти лет назад, в начале 2010-х годов, для экосистемы Hadoop. С тех пор существенно изменились как аппаратное обеспечение, так и характер рабочих нагрузок. В этой статье мы повторно исследуем наиболее широко используемые открытые колоночные форматы хранения данных (Parquet и ORC), подробно анализируя их внутреннее устройство. Мы разработали бенчмарк для стресс-тестирования производительности и эффективности использования пространства этими форматами при различных конфигурациях рабочих нагрузок. На основе всесторонней оценки Parquet и ORC мы выявили проектные решения, эффективные для современного аппаратного обеспечения и реальных распределений данных. К ним относятся использование словарного кодирования по умолчанию, предпочтение скорости декодирования степени сжатия в алгоритмах кодирования целых чисел, возможность отключения блочного сжатия и встраивание вспомогательных структур данных с более высокой степенью детализации. Мы также выявили неэффективность проектных решений форматов при обработке распространённых рабочих нагрузок машинного обучения и использовании графических процессоров (GPU) для декодирования. Наш анализ позволил определить важные аспекты, которые могут направить разработку будущих форматов на лучшее соответствие современным технологическим тенденциям.
Key Findings
1
Отказ от обязательного блочного сжатия и встраивание более детализированных вспомогательных структур данных названы полезными решениями для современных рабочих нагрузок.
2
Parquet и ORC имеют недостатки при обработке распространённых рабочих нагрузок машинного обучения и декодировании на GPU.
3
Для современного оборудования преимуществами являются кодирование словарём по умолчанию и целочисленные алгоритмы, приоритизирующие скорость декодирования над коэффициентом сжатия.
4
Результаты формулируют рекомендации для будущих колоночных форматов с учётом современного оборудования, распределений данных и тенденций рабочих нагрузок.
5
В исследовании эмпирически оцениваются широко используемые открытые колоночные форматы хранения Parquet и ORC при различных конфигурациях рабочих нагрузок.
Research Object
Открытые колоночные форматы хранения Parquet и ORC
Research Subject
Производительность и эффективность использования пространства форматов Parquet и ORC на современном оборудовании, при реальных распределениях данных, нагрузках машинного обучения и декодировании на GPU, включая влияние их внутренних проектных решений
Publication Details
Publication Date
2023-10-01
Journal
Publisher
ISSN
Cited by
47
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
До последнего бита: кодирование данных на основе данных с помощью CodecDB2021
BtrBlocks: эффективное столбцовое сжатие для озёр данных2023
Компоновка сжатия FastLanes: декодирование более 100 миллиардов целых чисел в секунду с использованием скалярного кода2023
Влияние столбцовых форматов файлов на производительность SQL-on-Hadoop-систем: исследование ORC и Parquet2019