DivLog: разбор журналов с использованием контекстного обучения, усиленного промптами
DivLog: Log Parsing with Prompt Enhanced In-Context Learning
2024-04-12
SCID: 54.1/wbxkf8c4
Discuss with AI
обучение в контекстебольшие языковые моделипарсинг логовпромпт-инжинирингизвлечение шаблонов
Figures from the paper
Abstract (AI)
Разбор журналов, включающий извлечение шаблонов журналов из полуструктурированных журналов для формирования структурированных журналов, является первым и наиболее критически важным этапом автоматизированного анализа журналов. Однако существующие средства разбора журналов обладают ограниченной эффективностью по двум причинам. Во-первых, традиционные средства разбора журналов на основе данных используют исключительно эвристики или созданные экспертами предметной области признаки, которые не всегда обеспечивают стабильную работу на журналах различных систем. Во-вторых, существующие средства разбора журналов с учителем требуют настройки модели, которая часто выполняется только на фиксированных обучающих выборках, что приводит к неоптимальной производительности на всем источнике журналов. Для устранения этого ограничения мы предлагаем DivLog — эффективную платформу разбора журналов, основанную на способности больших языковых моделей (LLM) к контекстному обучению (ICL). В частности, перед разбором журналов DivLog отбирает небольшое количество офлайн-журналов в качестве кандидатов, максимизируя их разнообразие. Затем в процессе разбора DivLog выбирает для каждого целевого журнала пять подходящих размеченных кандидатов в качестве примеров и формирует из них промпт. Используя семантику примеров в промпте, DivLog генерирует шаблон целевого журнала без обучения модели. Кроме того, мы разработали простой, но эффективный формат промпта для извлечения результата и повышения качества сгенерированных шаблонов журналов. Мы провели эксперименты на 16 широко используемых общедоступных наборах данных. Результаты показывают, что DivLog в среднем достигает следующих показателей: (1) 98,1% точности разбора, (2) 92,1% точности шаблонов по прецизионности и (3) 92,9% точности шаблонов по полноте, демонстрируя результаты уровня современных методов.
Key Findings
1
Специальный формат промпта улучшает извлечение сгенерированного результата и качество получаемых шаблонов журналов.
2
На 16 общедоступных наборах данных DivLog достигает в среднем 98,1% точности разбора, 92,1% точности шаблонов по Precision и 92,9% по Recall.
3
DivLog применяет контекстное обучение больших языковых моделей для разбора журналов, генерируя шаблоны без обучения или дообучения модели.
4
При отборе офлайн-кандидатов DivLog максимизирует их разнообразие, а затем выбирает пять подходящих размеченных примеров для каждого целевого сообщения.
5
Согласно представленным результатам, DivLog демонстрирует передовые показатели по сравнению с существующими методами разбора журналов.
Research Object
полуструктурированные системные журналы и извлечённые из них шаблоны журналов
Research Subject
эффективность и точность обучения без учителя при извлечении шаблонов журналов из различных источников журналов с использованием разнообразных контекстных примеров и улучшения промпта
Publication Details
Publication Date
2024-04-12
Journal
Publisher
ISSN
Cited by
70
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest