Обучение «последовательность-в-последовательность» с помощью нейронных сетей

Sequence to Sequence Learning with Neural Networks
Oriol Vinyals, Quoc V. Le, Ilya Sutskever
2014-09-10

метрика BLEULSTMдолгая кратковременная памятьWMT'14 английский-французский переводпереранжирование гипотез SMTинвертирование порядка слов в исходном предложениикодирование-декодирование последовательностейобучение последовательность-в-последовательность
Глубокие нейронные сети (DNN) представляют собой мощные модели, достигшие отличных результатов в сложных задачах обучения. Хотя DNN хорошо работают при наличии больших размеченных обучающих наборов, они не предназначены для прямого отображения последовательностей в последовательности. В этой статье мы представляем общий сквозной подход к обучению последовательностей, делающий минимальные допущения относительно структуры последовательности. Наш метод использует многослойную сеть с длительной короткосрочной памятью (Long Short-Term Memory, LSTM) для отображения входной последовательности в вектор фиксированной размерности, а затем другую глубокую LSTM для декодирования целевой последовательности из этого вектора. Основной результат заключается в том, что в задаче перевода с английского на французский на датасете WMT'14 переводы, сгенерированные LSTM, достигают значения BLEU 34.8 на всем тестовом наборе при том, что BLEU LSTM штрафовался за слова, отсутствующие в словаре. Кроме того, LSTM не испытывала трудностей с длинными предложениями. Для сравнения, система статистического машинного перевода на основе фраз (phrase-based SMT) достигает BLEU 33.3 на том же наборе данных. Когда мы использовали LSTM для повторной ранжировки 1000 гипотез, сгенерированных упомянутой SMT-системой, ее BLEU повысился до 36.5, что близко к предыдущему лучшему результату по этой задаче. LSTM также выучила содержательные представления фраз и предложений, чувствительные к порядку слов и сравнительно инвариантные к активному и пассивному залогу. Наконец, мы обнаружили, что обращение порядка слов во всех исходных предложениях (но не в целевых) заметно улучшало производительность LSTM, поскольку это вводило множество краткосрочных зависимостей между исходным и целевым предложением, что облегчало задачу оптимизации.
1
На задаче WMT'14 английский→французский LSTM достиг BLEU 34.8 на всем тестовом наборе (с штрафом за неизвестные слова), опередив фразовую SMT-систему с BLEU 33.3.
2
Предложен сквозной (end-to-end) подход sequence-to-sequence с энкодером LSTM, кодирующим входную последовательность в вектор фиксированного размера, и декодером LSTM для генерации целевой последовательности.
3
Реранжирование 1000 гипотез от фразовой SMT с помощью LSTM увеличило BLEU до 36.5, близко к предыдущему лучшему результату на этой задаче.
4
Обращение порядка слов во всех исходных предложениях (но не в целевых) значительно улучшило производительность LSTM, введя краткосрочные зависимости и упростив оптимизацию.
5
LSTM успешно работал с длинными предложениями и научился представлениям фраз/предложений, чувствительным к порядку слов и относительно инвариантным к активному/пассивному залогу.

Нейросетевая модель «последовательность-в-последовательность» с многослойными LSTM для преобразования входных последовательностей в выходные последовательности

Способность seq2seq-модели на базе LSTM обучать энд-то-энд преобразования последовательностей для машинного перевода (англ.→фр.): качество перевода (BLEU), работа с длинными предложениями и представления фраз/предложений, а также влияние обратного порядка слов в исходных предложениях

Publication Details
Publication Date
2014-09-10
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Oriol Vinyals
Quoc V. Le
Ilya Sutskever
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%