ForestZip: эффективный параллельный парсер для сжатия журналов
ForestZip: An Effective Parallel Parser for Log Compression
2023-09-22
SCID: 54.1/rwrpgrbk
Discuss with AI
Prefix-Forestкоэффициент сжатиясжатие журналовпараллельный анализ журналовсопоставление шаблонов
Figures from the paper
Abstract (AI)
В настоящее время облачные сервисы генерируют значительные объемы потоков журналов. Хранение этих потоков журналов требует большого объема дискового пространства и приводит к высоким затратам. Традиционные инструменты и алгоритмы сжатия хорошо работают при обработке небольших объемов текста, но неприменимы к крупномасштабным данным журналов, генерируемым производственными системами. Существующие алгоритмы сжатия, ориентированные на журналы, сжимают данные путем извлечения инвариантных структур журналов и использования шаблонов журналов, полученных в результате их разбора. Однако существующие методы разбора журналов недостаточно адаптивны и универсальны, чтобы обеспечивать высокую точность на всех типах наборов данных. Для достижения оптимальной производительности требуется ручная разработка регулярных выражений или тонкая настройка гиперпараметров. Мы предлагаем метод разбора и сжатия журналов, применимый к разнообразным потокам журналов, в котором каждая запись журнала может независимо извлекаться и затем сжиматься без использования предметных знаний или настройки параметров. В частности, мы создаем Prefix-Forest для представления структуры сообщений журналов и минимизации влияния шума в файлах журналов. Prefix-Forest разделяет журналы на несколько сегментов, независимо разбирает каждый сегмент и строит для каждого сегмента префиксное дерево. Полученные шаблоны могут использоваться в ForestZip. ForestZip разделяет журналы на шаблоны и параметры с помощью префиксного леса на основе сопоставления шаблонов, обеспечивая более эффективное сжатие. Мы реализовали Prefix-Forest и ForestZip на репрезентативных и широко используемых наборах данных журналов, а также на наборах данных, ранее не исследовавшихся в других публикациях. Коэффициент сжатия ForestZip в 1,23–2,14 раза выше, чем у Logzip, и в 1,89–8,58 раза выше, чем у gzip. Скорость сжатия в 1,51–8,4 раза выше, чем у Logzip. Кроме того, Prefix-Forest и ForestZip спроектированы с учетом высокой степени параллелизма и создают лишь пренебрежимо малые накладные расходы.
Key Findings
1
На исследованных наборах данных коэффициент сжатия ForestZip в 1,23–2,14 раза выше, чем у Logzip, и в 1,89–8,58 раза выше, чем у gzip.
2
ForestZip сжимает логи в 1,51–8,4 раза быстрее Logzip, а Prefix-Forest и ForestZip поддерживают высокую степень параллелизма при незначительных накладных расходах.
3
ForestZip обеспечивает независимый от предметной области разбор и сжатие логов без ручного задания регулярных выражений или настройки гиперпараметров.
4
ForestZip разделяет записи логов на шаблоны и параметры с помощью сопоставления с префиксным лесом, обеспечивая эффективное сжатие.
5
Prefix-Forest разбивает потоки логов на разделы, обрабатывает их независимо и использует префиксные деревья для снижения влияния шума и параллельной обработки.
Research Object
крупномасштабные потоки журналов, генерируемые производственными системами облачных сервисов
Research Subject
эффективность адаптивного разбора и параллельного сжатия журналов, включая коэффициент сжатия, скорость, масштабируемость и устойчивость к шуму в журналах без предметных знаний и настройки параметров
Publication Details
Publication Date
2023-09-22
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest