Сопоставление товаров на цифровых торговых площадках: мультимодальная модель на основе трансформерной архитектуры
Product matching in digital marketplaces: Multimodal model based on the transformer architecture
2025-06-30
SCID: 54.1/hdd8f4e6
Discuss with AI
Sentence-BERTVision Transformerразрешение сущностеймультимодальный трансформерсопоставление товаров
Figures from the paper
Abstract (AI)
В статье анализируется проблема интеллектуального сопоставления товаров на цифровых торговых площадках, для решения которой требуется оценивать сходство различных записей, описывающих товары, но различающихся по формату, содержанию или объёму мультимодальных данных. Предметная область данного исследования находится на пересечении методов решения задачи разрешения неоднозначности сущностей (entity resolution, ER), включая сопоставление записей и анализ мультимодальных данных. Эта проблема особенно актуальна в условиях быстро развивающейся платформенной экономики и экспоненциального роста рынка электронной коммерции. Основная цель исследования заключается в разработке и тестировании интеллектуальной мультимодальной модели на основе трансформерной архитектуры для повышения точности и устойчивости сопоставления товаров на цифровых торговых площадках. Авторы разработали модель, объединяющую текстовые, визуальные и табличные атрибуты, что позволяет выявлять сходные товары, находить конкурентные предложения, обнаруживать дубликаты, а также более эффективно выполнять кластеризацию и сегментацию товаров. Предлагаемый подход основан на механизме самовнимания, обеспечивающем моделирование контекстно-семантических связей между данными различной природы. Для извлечения векторных представлений текстовых описаний применяются языковые модели, в частности архитектура Sentence-BERT; для визуальной составляющей используется Vision Transformer; табличные данные обрабатываются с помощью специализированных механизмов обучения на основе архитектуры TabTransformer для структурированных данных. Проведённый эксперимент показал, что разработанная мультимодальная модель эффективно решает задачу сопоставления товаров на цифровых торговых площадках в условиях значительной вариативности товарных позиций и неоднородности данных. Кроме того, результаты свидетельствуют о возможности успешной адаптации модели для применения к другим категориям товаров. Полученные результаты подтверждают эффективность и целесообразность применения мультимодального подхода к реализации сопоставления товаров на цифровых торговых площадках. Это позволяет участникам рынка электронной коммерции существенно повысить качество управления запасами, увеличить эффективность ценообразования и укрепить свои конкурентные преимущества.
Key Findings
1
Мультимодальная модель на основе трансформеров объединяет текстовые, визуальные и табличные атрибуты товаров для сопоставления товаров на цифровых маркетплейсах.
2
Эксперименты показывают эффективность сопоставления товаров при значительной вариативности товарных позиций и неоднородности данных.
3
Механизм self-attention моделирует контекстно-семантические связи между разнородными модальностями и записями товаров различного формата.
4
Для текста используется Sentence-BERT, для изображений — Vision Transformer, а для структурированных табличных данных — механизмы на основе TabTransformer.
5
Модель поддерживает поиск похожих товаров и конкурентных предложений, выявление дубликатов, кластеризацию и сегментацию, а также может адаптироваться к другим товарным категориям.
Research Object
Записи о товарах и товарные предложения на цифровых торговых площадках
Research Subject
Точность и устойчивость мультимодального сопоставления товаров на основе контекстно-семантического сходства текстовых, визуальных и табличных атрибутов
Publication Details
Publication Date
2025-06-30
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest