Больше никаких размеченных примеров? Неразмеченный парсер логов на основе больших языковых моделей

No More Labelled Examples? An Unsupervised Log Parser with LLMs
Junjie Huang, Zhihan Jiang, Zhuangbin Chen, Michael R. Lyu
2025-06-19

контрастивные единицы журналовгибридное ранжированиебольшие языковые моделиизвлечение структуры журналовнеподконтрольный разбор журналов
Разбор логов является необходимой предпосылкой для решения различных задач анализа логов. Недавние достижения в этой области повысили точность разбора за счет использования семантики логов посредством дообучения больших языковых моделей (LLM) или обучения на контекстных демонстрациях. Однако для достижения оптимальной производительности эти методы в значительной степени зависят от высококачественных размеченных примеров. На практике непрерывный сбор высококачественных размеченных данных затруднен, поскольку объем логов огромен, а их содержание часто изменяется, что после развертывания приводит к снижению производительности существующих парсеров логов или требует значительных усилий по их сопровождению. Для решения этой проблемы мы предлагаем LUNAR — метод эффективного готового к применению разбора логов без обучения на размеченных данных, основанный на больших языковых моделях. Наша ключевая идея заключается в том, что, хотя большие языковые модели могут испытывать трудности при непосредственном разборе логов, их производительность можно существенно повысить с помощью сравнительного анализа нескольких логов, различающихся только параметрическими частями. Такие группы логов мы называем контрастивными единицами логов (Log Contrastive Units, LCUs). Из-за огромного объема логов получение LCUs представляет собой сложную задачу. Поэтому LUNAR вводит гибридную схему ранжирования для эффективного поиска LCUs, совместно учитывая общность и вариативность логов. Кроме того, LUNAR формирует новый промпт для разбора, позволяющий большим языковым моделям выявлять контрастивные закономерности и извлекать содержательные структуры логов из LCUs. Эксперименты на крупномасштабных общедоступных и промышленных наборах данных логов показывают, что LUNAR значительно превосходит современные парсеры логов по точности и эффективности, обеспечивая эффективное и практичное решение для развертывания в реальных условиях.
1
Специальный контрастивный промпт позволяет LLM выявлять различия параметров и извлекать содержательные структуры логов из найденных групп.
2
Эксперименты на крупных публичных и промышленных наборах данных показывают, что LUNAR значительно превосходит современные парсеры по точности и эффективности.
3
LUNAR — это неконтролируемый готовый к применению парсер логов на основе LLM, не требующий размеченных примеров для развертывания.
4
LUNAR применяет гибридную схему ранжирования, учитывающую общность и вариативность логов, для эффективного поиска контрастивных единиц в больших коллекциях.
5
Метод повышает качество разбора логов LLM за счёт сравнительного анализа логов с общими шаблонами, но различающимися значениями параметров; такие группы называются контрастивными единицами логов.

логи и системы разбора логов в крупномасштабных общедоступных и промышленных средах

неконтролируемое извлечение содержательных структур логов посредством контрастивного анализа логов, различающихся параметрическими частями, с акцентом на точность и эффективность разбора

Publication Details
Publication Date
2025-06-19
Journal
Publisher
ISSN
Cited by
19
Access Type
Author Information
Authors
Junjie Huang
Zhihan Jiang
Zhuangbin Chen
Michael R. Lyu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%