TinyBERT: дистилляция BERT для задач понимания естественного языка
TinyBERT: Distilling BERT for Natural Language Understanding
2020-01-01
SCID: 54.1/trsj9tc5
Discuss with AI
TinyBERTдистилляция трансформерадистилляция знанийдистилляция на этапе предобучениядистилляция на этапе адаптации к задаче
Figures from the paper
Abstract (AI)
Предобучение языковых моделей, таких как BERT, существенно повысило качество многих задач обработки естественного языка. Однако предобученные языковые модели обычно вычислительно затратны, что затрудняет их эффективное выполнение на устройствах с ограниченными ресурсами. Для ускорения вывода и уменьшения размера модели при сохранении точности мы сначала предлагаем новый метод дистилляции Transformer, специально разработанный для knowledge distillation (KD) моделей на основе Transformer. Используя этот метод KD, обширные знания, закодированные в большой «учительской» модели BERT, могут быть эффективно переданы небольшой «студентской» модели TinyBERT. Далее мы вводим новую двухэтапную обучающую схему для TinyBERT, которая выполняет дистилляцию Transformer как на этапе предобучения, так и на этапе обучения, специфичного для задачи. Эта схема обеспечивает захват TinyBERT как знаний общего домена, так и знаний, специфичных для конкретной задачи, присутствующих в BERT.
Key Findings
1
Предложен новый метод дистилляции Transformer, специально разработанный для знания дистилляции моделей на базе Transformer.
2
Введена двухэтапная схема обучения, применяющая дистилляцию Transformer на этапах предобучения и обучения для конкретной задачи.
3
Предложенный метод дистилляции эффективно переносит знания от большого учителя BERT к маленькому студенту TinyBERT.
4
Двухэтапная схема позволяет TinyBERT захватывать как общедоменные, так и специфичные для задач знания из BERT.
5
TinyBERT обеспечивает уменьшенный размер модели и ускорённый вывод при сохранении точности в задачах понимания естественного языка.
Research Object
Tiny-BERT (дистиллированная, уменьшенная трансформерная модель-студент, полученная из BERT)
Research Subject
Дистилляция знаний трансформерных моделей для ускорения вывода и уменьшения размера модели при сохранении общей и задачно-специфической точности (трансформерная дистилляция на этапах предподготовки и дообучения под задачу)
Publication Details
Publication Date
2020-01-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest