Нейронный машинный перевод посредством совместного обучения выравниванию и переводу
Neural Machine Translation by Jointly Learning to Align and Translate
2014-09-01
SCID: 54.1/pr2u9bet
Discuss with AI
англо-французский переводкодер-декодерузкое место фиксированного векторного представлениянейронный машинный переводмягкое выравнивание
Figures from the paper
Abstract (AI)
Нейронный машинный перевод — недавно предложенный подход к машинному переводу. В отличие от традиционного статистического машинного перевода, нейронный машинный перевод нацелен на построение одной нейронной сети, которую можно совместно настраивать для максимизации качества перевода. Недавно предложенные модели нейронного машинного перевода часто относятся к семейству кодировщик–декодировщик и состоят из кодировщика, который кодирует исходное предложение в вектор фиксированной длины, по которому декодировщик генерирует перевод. В этой работе мы выдвигаем предположение, что использование вектора фиксированной длины является узким местом для улучшения производительности этой базовой архитектуры кодировщик–декодировщик, и предлагаем расширение, позволяющее модели автоматически (мягко) искать части исходного предложения, которые имеют отношение к предсказанию целевого слова, без явного формирования этих частей в жесткие сегменты. С помощью этого нового подхода мы достигаем качества перевода, сопоставимого с существующей передовой системой на основе фраз, в задаче перевода с английского на французский язык. Кроме того, качественный анализ показывает, что найденные моделью (мягкие) выравнивания хорошо согласуются с нашей интуицией.
Key Findings
1
Кодирование входного предложения в фиксированном векторе в архитектуре энкодер-декодер НМТ является узким местом, ограничивающим качество перевода.
2
Предложенное расширение позволяет модели выполнять мягкий поиск частей исходного предложения, релевантных для каждого целевого слова (мягкое выравнивание).
3
Качественный анализ показывает, что изученные мягкие выравнивания хорошо согласуются с интуицией человека.
4
Подход достигает качества перевода, сопоставимого с современным фразовым статистическим методом на задаче английский→французский.
5
Модель совместно обучается выравнивать и переводить без явной жёсткой сегментации частей источника.
Research Object
Модель нейронного машинного перевода архитектуры «энкодер–декодер» с механизмом внимания, совместно обучающая выравниванию и переводу
Research Subject
Обучение мягких (неявных) выравниваний между частями исходного и целевого предложений и их использование для повышения качества перевода по сравнению с моделями энкодер–декодер с вектором фиксированной длины
Publication Details
Publication Date
2014-09-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai3
Работы, цитирующие эту статью20
Informer: эффективный трансформер для прогнозирования временных рядов большой длины и дальнейшее развитие этого подхода2021
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Эффективны ли трансформеры для прогнозирования временных рядов?2023
Системы семантической связи на основе глубокого обучения2021
Обзор интерпретируемости обучения с учителем2021
Глубокое обучение для искусственного интеллекта2021
Глубокое обучение для обнаружения аномалий во временных рядах данных: обзор, анализ и рекомендации2021
Обзор объяснимого искусственного интеллекта (XAI): на пути к медицинскому XAI2020
Механизм внимания в обработке естественного языка2020
Дополнение графа знаний: обзор2020
Нейросинтез речи с использованием трансформерной сети2019
Transformer-XL: внимательные языковые модели за пределами контекста фиксированной длины2019
Обучение глубоких моделей Transformer для машинного перевода2019
Обзор современного состояния исследований в области генерации естественного языка: основные задачи, приложения и оценивание2018
Tacotron: к энд-ту-энд синтезу речи2017
Глубокое обучение в биоинформатике2016
Иерархические сети внимания для классификации документов2016
Дистилляция знаний на уровне последовательностей2016
Моделирование покрытия для нейронного машинного перевода2016
Эффективные подходы к нейронному машинному переводу на основе механизма внимания2015