Обогащение векторных представлений слов информацией о подсловах
Enriching Word Vectors with Subword Information
2017-12-01
SCID: 54.1/8zkhyr6t
Discuss with AI
символьные n-граммынепрерывные векторные представления словвекторы слов для неизвестных слов (OOV)модель skipgramинформация о подсловах
Figures from the paper
Abstract (AI)
Непрерывные векторные представления слов, обученные на больших неразмеченных корпусах, полезны для многих задач обработки естественного языка. Популярные модели, которые обучают такие представления, игнорируют морфологию слов, назначая каждому слову отдельный вектор, что является ограничением для языков с большими словарями и множеством редких слов. Мы предлагаем новый подход, основанный на модели skip-gram, в котором каждое слово представляется как мультимножество символьных n-грамм. Каждой символьной n-грамме соответствует векторное представление, а слово представляется как сумма этих представлений. Наш метод быстр; он позволяет эффективно обучать модели на больших корпусах и вычислять векторные представления для слов, не встречавшихся в тренировочных данных. Мы оцениваем наши представления слов на девяти языках по задачам сходства слов и аналогий. В сравнении с недавно предложенными морфологическими векторными представлениями мы показываем, что наши векторы достигают передовых результатов в этих задачах.
Key Findings
1
Достигает передовых результатов по сравнению с недавно предложенными морфологическими представлениями слов.
2
Каждой символьной n-грамме соответствует вектор, что позволяет вычислять векторы для слов, не встречавшихся в обучении.
3
Оценка на девяти языках по заданиям схожести слов и аналогий показывает улучшенную производительность.
4
Метод вычислительно быстрый, что позволяет быстро обучать модели на больших корпусах.
5
Предложен метод на основе skip-gram, представляющий слово как набор символьных n-грамм и суммирующий векторы n-грамм для получения вектора слова.
Research Object
Непрерывные векторные представления слов, дополненные компонентами в виде символных n-грамм (субсловная информация)
Research Subject
Влияние представления слов как суммы векторов символных n-грамм на качество встраиваний слов, включая обработку редких/не встречавшихся слов и показатели на задачах семантического сходства и аналогий в нескольких языках
Publication Details
Publication Date
2017-12-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai1
Работы, цитирующие эту статью8
Унифицирующий обзор глубоких и поверхностных методов обнаружения аномалий2021
Язык белков: обработка естественного языка, машинное обучение и белковые последовательности2021
Большие языковые модели (LLM): обзор, технические основы и будущие проблемы2024
Обзор анализа сентимента в платформах социальных сетей2023
Обзор современных тенденций, методов и проблем больших языковых моделей (LLM)2024
Модель «зрение‑язык» для генерации медицинских отчётов и визуального ответа на вопросы: обзор2024
Моделирование аспектов языка жизни посредством трансферного обучения на белковых последовательностях2019
Распределённая семантика и лингвистическая теория2019