TinyBERT: дистилляция BERT для задач понимания естественного языка

TinyBERT: Distilling BERT for Natural Language Understanding
Xiao Dong Chen, Xin Jiang, Qun Liu, Lifeng Shang, Xiaoqi Jiao, Yichun Yin, Linlin Li, Fang Wang, Qun Liu
2020-01-01

TinyBERTдистилляция трансформерадистилляция знанийдистилляция на этапе предобучениядистилляция на этапе адаптации к задаче
Предобучение языковых моделей, таких как BERT, существенно повысило качество многих задач обработки естественного языка. Однако предобученные языковые модели обычно вычислительно затратны, что затрудняет их эффективное выполнение на устройствах с ограниченными ресурсами. Для ускорения вывода и уменьшения размера модели при сохранении точности мы сначала предлагаем новый метод дистилляции Transformer, специально разработанный для knowledge distillation (KD) моделей на основе Transformer. Используя этот метод KD, обширные знания, закодированные в большой «учительской» модели BERT, могут быть эффективно переданы небольшой «студентской» модели TinyBERT. Далее мы вводим новую двухэтапную обучающую схему для TinyBERT, которая выполняет дистилляцию Transformer как на этапе предобучения, так и на этапе обучения, специфичного для задачи. Эта схема обеспечивает захват TinyBERT как знаний общего домена, так и знаний, специфичных для конкретной задачи, присутствующих в BERT.
1
Предложен новый метод дистилляции Transformer, специально разработанный для знания дистилляции моделей на базе Transformer.
2
Введена двухэтапная схема обучения, применяющая дистилляцию Transformer на этапах предобучения и обучения для конкретной задачи.
3
Предложенный метод дистилляции эффективно переносит знания от большого учителя BERT к маленькому студенту TinyBERT.
4
Двухэтапная схема позволяет TinyBERT захватывать как общедоменные, так и специфичные для задач знания из BERT.
5
TinyBERT обеспечивает уменьшенный размер модели и ускорённый вывод при сохранении точности в задачах понимания естественного языка.

Tiny-BERT (дистиллированная, уменьшенная трансформерная модель-студент, полученная из BERT)

Дистилляция знаний трансформерных моделей для ускорения вывода и уменьшения размера модели при сохранении общей и задачно-специфической точности (трансформерная дистилляция на этапах предподготовки и дообучения под задачу)

Publication Details
Publication Date
2020-01-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Xiao Dong Chen
Xin Jiang
Qun Liu
Lifeng Shang
Xiaoqi Jiao
Yichun Yin
Linlin Li
Fang Wang
Qun Liu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%