Раскрывая силу чисел: сжатие журналов посредством разбора числовых токенов

Unlocking the Power of Numbers: Log Compression via Numeric Token Parsing
Siyu Yu, Yifan Wu, Ying Li, Pinjia He
2024-08-11

Denumкоэффициент сжатияинкрементные числасжатие логовсинтаксический анализ числовых токенов
В последние годы широко исследуются компрессоры журналов на основе синтаксического разбора, поскольку стремительный рост объёма журналов сделал недостаточной эффективность сжатия универсальных компрессоров. Такие компрессоры предварительно обрабатывают журналы, группируя их в соответствии с результатами разбора, а затем передают предварительно обработанные файлы универсальному компрессору. Однако компрессоры на основе разбора имеют ряд ограничений. Во-первых, цели разбора и сжатия не согласованы, поэтому внутренние характеристики журналов используются не в полной мере. Кроме того, эффективность таких компрессоров зависит от образцов журналов и вследствие этого является весьма нестабильной. Более того, компрессоры на основе разбора часто требуют значительного времени обработки. Для устранения этих ограничений мы предлагаем Denum — простой универсальный компрессор журналов с высоким коэффициентом и высокой скоростью сжатия. Основная идея заключается в том, что большинство токенов в журналах являются числовыми токенами (то есть числами, токенами, состоящими только из чисел и специальных символов, а также числовыми переменными), и их эффективное сжатие имеет решающее значение для сжатия журналов. В частности, Denum включает модуль разбора числовых токенов, который извлекает все числовые токены и применяет к ним специализированные методы обработки (например, сохраняет разности между последовательными значениями изменяющихся чисел, таких как временные метки), а также модуль обработки строк, который обрабатывает оставшееся содержимое журналов без чисел. Обработанные файлы, сформированные двумя модулями, затем подаются на вход универсальному компрессору, который формирует окончательный сжатый результат. Denum был оценён на 16 наборах данных журналов и продемонстрировал на 8,7–434,7% более высокий средний коэффициент сжатия и в 2,6–37,7 раза более высокую среднюю скорость сжатия (то есть 26,2 МБ/с) по сравнению с базовыми методами. Кроме того, интеграция модуля разбора числовых токенов Denum в существующие компрессоры журналов повысила их средний коэффициент сжатия на 11,8% и увеличила среднюю скорость сжатия на 37%.
1
На 16 наборах логов Denum повышает средний коэффициент сжатия на 8,7–434,7% по сравнению с базовыми методами и достигает средней скорости 26,2 МБ/с.
2
Интеграция разбора числовых токенов Denum в существующие компрессоры повышает средний коэффициент сжатия на 11,8% и ускоряет сжатие на 37%.
3
Denum вводит разбор числовых токенов, отдельно обрабатывая числовое и нечисловое содержимое логов перед сжатием универсальным компрессором.
4
В среднем Denum работает в 2,6–37,7 раза быстрее базовых компрессоров, устраняя ограничение parser-based методов по времени обработки.
5
Числовой модуль применяет специализированные преобразования, включая сохранение разностей между последовательными значениями, например временными метками.

данные журналов и содержащиеся в них числовые токены

эффективность сжатия, в частности коэффициент сжатия и скорость, обеспечиваемая разбором числовых токенов и специализированной обработкой

Publication Details
Publication Date
2024-08-11
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Siyu Yu
Yifan Wu
Ying Li
Pinjia He
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%