Влияние столбцовых форматов файлов на производительность SQL-on-Hadoop-систем: исследование ORC и Parquet

The impact of columnar file formats on SQL‐on‐hadoop engine performance: A study on ORC and Parquet
Todor Ivanov, Matteo Pergolesi
2019-09-09

BigBench (TPCx-BB)ORCParquetSQL-движки Hadoopколоночные форматы файлов
Столбцовые форматы файлов обеспечивают эффективный способ хранения данных для выполнения запросов с использованием SQL-on-Hadoop-систем. В предыдущих исследованиях производительность вычислительного механизма и формата файла рассматривалась совместно, что не позволяло оценить их индивидуальное влияние. В данной работе предлагается альтернативный подход: за счёт выполнения каждого формата файла на одном и том же вычислительном механизме мы сравниваем различные форматы файлов и настройки их параметров. Предложенная стратегия применяется к двум вычислительным механизмам — Hive и SparkSQL, а также оценивается производительность двух столбцовых форматов файлов — ORC и Parquet. Для этого используется BigBench (TPCx-BB) — стандартизированный прикладной тест производительности для сценариев обработки больших данных. Результаты экспериментов подтверждают, что выбор формата файла и его конфигурации существенно влияют на общую производительность. Показано, что ORC в целом обеспечивает более высокую производительность при использовании Hive, тогда как Parquet достигает наилучших результатов с SparkSQL. Использование сжатия ZLIB обеспечивает улучшение производительности до 60,2% для ORC, тогда как Parquet демонстрирует улучшение до 7% при использовании Snappy. Исключение составляют запросы, связанные с обработкой текста, для которых использование любого сжатия не даёт преимуществ.
1
Эксперименты с Hive, SparkSQL и стандартизированным бенчмарком BigBench (TPCx-BB) показывают, что выбор и конфигурация формата существенно влияют на общую производительность.
2
ORC обычно работает лучше с Hive, тогда как Parquet обеспечивает наилучшую производительность с SparkSQL.
3
Запросы, включающие обработку текста, не получают преимуществ от сжатия ни в одном из columnar-форматов.
4
В исследовании влияние формата файлов отделяется от влияния движка за счёт выполнения ORC и Parquet на одинаковых SQL-on-Hadoop движках с различными настройками форматов.
5
Сжатие ZLIB повышает производительность ORC до 60,2%, а Snappy повышает производительность Parquet до 7%.

Колоночные форматы файлов ORC и Parquet, используемые с SQL-on-Hadoop-движками Hive и SparkSQL

Влияние выбора и настройки формата файлов, включая параметры сжатия, на производительность обработки запросов SQL-on-Hadoop

Publication Details
Publication Date
2019-09-09
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Todor Ivanov
Matteo Pergolesi
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%