Больше никаких размеченных примеров? Неразмеченный парсер логов на основе больших языковых моделей
No More Labelled Examples? An Unsupervised Log Parser with LLMs
2025-06-19
SCID: 54.1/bfgx29em
Discuss with AI
контрастивные единицы журналовгибридное ранжированиебольшие языковые моделиизвлечение структуры журналовнеподконтрольный разбор журналов
Figures from the paper
Abstract (AI)
Разбор логов является необходимой предпосылкой для решения различных задач анализа логов. Недавние достижения в этой области повысили точность разбора за счет использования семантики логов посредством дообучения больших языковых моделей (LLM) или обучения на контекстных демонстрациях. Однако для достижения оптимальной производительности эти методы в значительной степени зависят от высококачественных размеченных примеров. На практике непрерывный сбор высококачественных размеченных данных затруднен, поскольку объем логов огромен, а их содержание часто изменяется, что после развертывания приводит к снижению производительности существующих парсеров логов или требует значительных усилий по их сопровождению. Для решения этой проблемы мы предлагаем LUNAR — метод эффективного готового к применению разбора логов без обучения на размеченных данных, основанный на больших языковых моделях. Наша ключевая идея заключается в том, что, хотя большие языковые модели могут испытывать трудности при непосредственном разборе логов, их производительность можно существенно повысить с помощью сравнительного анализа нескольких логов, различающихся только параметрическими частями. Такие группы логов мы называем контрастивными единицами логов (Log Contrastive Units, LCUs). Из-за огромного объема логов получение LCUs представляет собой сложную задачу. Поэтому LUNAR вводит гибридную схему ранжирования для эффективного поиска LCUs, совместно учитывая общность и вариативность логов. Кроме того, LUNAR формирует новый промпт для разбора, позволяющий большим языковым моделям выявлять контрастивные закономерности и извлекать содержательные структуры логов из LCUs. Эксперименты на крупномасштабных общедоступных и промышленных наборах данных логов показывают, что LUNAR значительно превосходит современные парсеры логов по точности и эффективности, обеспечивая эффективное и практичное решение для развертывания в реальных условиях.
Key Findings
1
Специальный контрастивный промпт позволяет LLM выявлять различия параметров и извлекать содержательные структуры логов из найденных групп.
2
Эксперименты на крупных публичных и промышленных наборах данных показывают, что LUNAR значительно превосходит современные парсеры по точности и эффективности.
3
LUNAR — это неконтролируемый готовый к применению парсер логов на основе LLM, не требующий размеченных примеров для развертывания.
4
LUNAR применяет гибридную схему ранжирования, учитывающую общность и вариативность логов, для эффективного поиска контрастивных единиц в больших коллекциях.
5
Метод повышает качество разбора логов LLM за счёт сравнительного анализа логов с общими шаблонами, но различающимися значениями параметров; такие группы называются контрастивными единицами логов.
Research Object
логи и системы разбора логов в крупномасштабных общедоступных и промышленных средах
Research Subject
неконтролируемое извлечение содержательных структур логов посредством контрастивного анализа логов, различающихся параметрическими частями, с акцентом на точность и эффективность разбора
Publication Details
Publication Date
2025-06-19
Journal
Publisher
ISSN
Cited by
19
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest