Сопоставление схем с использованием федеративного обучения на гибридном наборе признаков
Schema Matching Using Federated Learning on a Hybrid Feature Set
2025-06-01
SCID: 54.1/ktd3nbs5
Discuss with AI
LSTM с механизмом внимания и MLPфедеративное обучение (federated learning)гибридный набор признаковметрики сходства именсопоставление схем (schema matching)
Figures from the paper
Abstract (AI)
Для повышения репрезентативности в анализе данных необходимо извлекать и интегрировать данные из различных источников. В статье исследуется применение машинного обучения к одному из основных этапов интеграции данных — сопоставлению схем (schema matching). Схема представляет собой структуру конкретной базы данных, включая определение отношений, их атрибутов, типов данных и определение первичных и внешних ключей. Результатом этого этапа является сопоставление элементов исходных схем с элементами целевой схемы. Предложена нейронная модель, основанная на комбинации сетей долгой краткосрочной памяти (LSTM), механизмов внимания и многослойного персептрона. Модель обучается на гибридном наборе признаков, включающем метрики сходства имен, типы данных, теги, описательную статистику и коэффициенты корреляции для числовых данных. Проведённые эксперименты показали, что предложенная модель превосходит базовую нейронную модель и классические методы сопоставления схем. Также показано, что федеративное обучение, сохраняющее приватность данных, обеспечивает качество модели практически на том же уровне по сравнению с централизованным обучением.
Key Findings
1
Предложена нейронная сеть, сочетающая LSTM, механизмы внимания и многослойный перцептрон для сопоставления схем.
2
Эксперименты показывают, что предложенная модель превосходит базовую нейронную модель и классические методы сопоставления схем.
3
Федеративное обучение сохраняет конфиденциальность данных и обеспечивает качество модели практически на уровне централизованного обучения.
4
Модель обучается на гибридном наборе признаков: метрики сходства имён, типы данных, теги, описательная статистика и коэффициенты корреляции для числовых данных.
Research Object
Сопоставление схем баз данных (соответствие элементов исходных и целевых схем)
Research Subject
Эффективность подхода к сопоставлению схем на базе нейронной сети, обученной на гибридном наборе признаков (метрики сходства имён, типы данных, теги, описательная статистика, коэффициенты корреляции) и его поведение при федеративном обучении по сравнению с централизованным обучением в отношении качества сопоставления
Publication Details
Publication Date
2025-06-01
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Download PDF
Subscribe to digest