Эмпирическая оценка колоночных форматов хранения данных

An Empirical Evaluation of Columnar Storage Formats
Jiahong Shen, Yulong Hui, Huanchen Zhang, Andrew Pavlo, Xinyu Zeng, Wes McKinney
2023-10-01

Apache ORCApache Parquetоценка на основе бенчмаркаколоночные форматы хранениясловарное кодирование
Колоночное хранение является ключевым компонентом современной системы аналитики данных. Хотя многие системы управления базами данных (СУБД) используют проприетарные форматы хранения, большинство из них обеспечивает широкую поддержку открытых форматов хранения, таких как Parquet и ORC, для упрощения кроссплатформенного обмена данными. Однако эти форматы были разработаны более десяти лет назад, в начале 2010-х годов, для экосистемы Hadoop. С тех пор существенно изменились как аппаратное обеспечение, так и характер рабочих нагрузок. В этой статье мы повторно исследуем наиболее широко используемые открытые колоночные форматы хранения данных (Parquet и ORC), подробно анализируя их внутреннее устройство. Мы разработали бенчмарк для стресс-тестирования производительности и эффективности использования пространства этими форматами при различных конфигурациях рабочих нагрузок. На основе всесторонней оценки Parquet и ORC мы выявили проектные решения, эффективные для современного аппаратного обеспечения и реальных распределений данных. К ним относятся использование словарного кодирования по умолчанию, предпочтение скорости декодирования степени сжатия в алгоритмах кодирования целых чисел, возможность отключения блочного сжатия и встраивание вспомогательных структур данных с более высокой степенью детализации. Мы также выявили неэффективность проектных решений форматов при обработке распространённых рабочих нагрузок машинного обучения и использовании графических процессоров (GPU) для декодирования. Наш анализ позволил определить важные аспекты, которые могут направить разработку будущих форматов на лучшее соответствие современным технологическим тенденциям.
1
Отказ от обязательного блочного сжатия и встраивание более детализированных вспомогательных структур данных названы полезными решениями для современных рабочих нагрузок.
2
Parquet и ORC имеют недостатки при обработке распространённых рабочих нагрузок машинного обучения и декодировании на GPU.
3
Для современного оборудования преимуществами являются кодирование словарём по умолчанию и целочисленные алгоритмы, приоритизирующие скорость декодирования над коэффициентом сжатия.
4
Результаты формулируют рекомендации для будущих колоночных форматов с учётом современного оборудования, распределений данных и тенденций рабочих нагрузок.
5
В исследовании эмпирически оцениваются широко используемые открытые колоночные форматы хранения Parquet и ORC при различных конфигурациях рабочих нагрузок.

Открытые колоночные форматы хранения Parquet и ORC

Производительность и эффективность использования пространства форматов Parquet и ORC на современном оборудовании, при реальных распределениях данных, нагрузках машинного обучения и декодировании на GPU, включая влияние их внутренних проектных решений

Publication Details
Publication Date
2023-10-01
Journal
Publisher
ISSN
Cited by
47
Access Type
Author Information
Authors
Jiahong Shen
Yulong Hui
Huanchen Zhang
Andrew Pavlo
Xinyu Zeng
Wes McKinney
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%