Обучение «последовательность-в-последовательность» с помощью нейронных сетей
Sequence to Sequence Learning with Neural Networks
2014-09-10
SCID: 54.1/ewdnrcpp
Discuss with AI
метрика BLEULSTMдолгая кратковременная памятьWMT'14 английский-французский переводпереранжирование гипотез SMTинвертирование порядка слов в исходном предложениикодирование-декодирование последовательностейобучение последовательность-в-последовательность
Figures from the paper
Abstract (AI)
Глубокие нейронные сети (DNN) представляют собой мощные модели, достигшие отличных результатов в сложных задачах обучения. Хотя DNN хорошо работают при наличии больших размеченных обучающих наборов, они не предназначены для прямого отображения последовательностей в последовательности. В этой статье мы представляем общий сквозной подход к обучению последовательностей, делающий минимальные допущения относительно структуры последовательности. Наш метод использует многослойную сеть с длительной короткосрочной памятью (Long Short-Term Memory, LSTM) для отображения входной последовательности в вектор фиксированной размерности, а затем другую глубокую LSTM для декодирования целевой последовательности из этого вектора. Основной результат заключается в том, что в задаче перевода с английского на французский на датасете WMT'14 переводы, сгенерированные LSTM, достигают значения BLEU 34.8 на всем тестовом наборе при том, что BLEU LSTM штрафовался за слова, отсутствующие в словаре. Кроме того, LSTM не испытывала трудностей с длинными предложениями. Для сравнения, система статистического машинного перевода на основе фраз (phrase-based SMT) достигает BLEU 33.3 на том же наборе данных. Когда мы использовали LSTM для повторной ранжировки 1000 гипотез, сгенерированных упомянутой SMT-системой, ее BLEU повысился до 36.5, что близко к предыдущему лучшему результату по этой задаче. LSTM также выучила содержательные представления фраз и предложений, чувствительные к порядку слов и сравнительно инвариантные к активному и пассивному залогу. Наконец, мы обнаружили, что обращение порядка слов во всех исходных предложениях (но не в целевых) заметно улучшало производительность LSTM, поскольку это вводило множество краткосрочных зависимостей между исходным и целевым предложением, что облегчало задачу оптимизации.
Key Findings
1
На задаче WMT'14 английский→французский LSTM достиг BLEU 34.8 на всем тестовом наборе (с штрафом за неизвестные слова), опередив фразовую SMT-систему с BLEU 33.3.
2
Предложен сквозной (end-to-end) подход sequence-to-sequence с энкодером LSTM, кодирующим входную последовательность в вектор фиксированного размера, и декодером LSTM для генерации целевой последовательности.
3
Реранжирование 1000 гипотез от фразовой SMT с помощью LSTM увеличило BLEU до 36.5, близко к предыдущему лучшему результату на этой задаче.
4
Обращение порядка слов во всех исходных предложениях (но не в целевых) значительно улучшило производительность LSTM, введя краткосрочные зависимости и упростив оптимизацию.
5
LSTM успешно работал с длинными предложениями и научился представлениям фраз/предложений, чувствительным к порядку слов и относительно инвариантным к активному/пассивному залогу.
Research Object
Нейросетевая модель «последовательность-в-последовательность» с многослойными LSTM для преобразования входных последовательностей в выходные последовательности
Research Subject
Способность seq2seq-модели на базе LSTM обучать энд-то-энд преобразования последовательностей для машинного перевода (англ.→фр.): качество перевода (BLEU), работа с длинными предложениями и представления фраз/предложений, а также влияние обратного порядка слов в исходных предложениях
Publication Details
Publication Date
2014-09-10
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Работы, цитирующие эту статью20
Informer: эффективный трансформер для прогнозирования временных рядов большой длины и дальнейшее развитие этого подхода2021
Генеративный искусственный интеллект2023
Обзор анализа тональности на основе аспектов: задачи, методы и проблемы2022
Искусственный интеллект в разработке лекарственных средств: последние достижения и перспективы2021
CatBoost для больших данных: междисциплинарный обзор2020
CodeBERT: предобученная модель для языков программирования и естественных языков2020
Нейросинтез речи с использованием трансформерной сети2019
Автоматизированное машинное обучение2019
Обучение глубоких моделей Transformer для машинного перевода2019
Пространственно-временные графовые сверточные сети: платформа глубокого обучения для прогнозирования трафика2018
Обзор современного состояния исследований в области генерации естественного языка: основные задачи, приложения и оценивание2018
Персонализация диалоговых агентов: У меня есть собака, а у вас есть питомцы?2018
Многоязычная система нейронного машинного перевода Google: обеспечение zero-shot перевода2017
Tacotron: к энд-ту-энд синтезу речи2017
Сиамские рекуррентные архитектуры для обучения семантической схожести предложений2016
Дистилляция знаний на уровне последовательностей2016
Трансферное обучение для нейронного машинного перевода при ограниченных ресурсах2016
Моделирование покрытия для нейронного машинного перевода2016
Эффективные подходы к нейронному машинному переводу на основе механизма внимания2015
О свойствах нейронного машинного перевода: подходы энкодер–декодер2014