时代Java

详解TextBrewer

工程师 (已认证)

发表于教程文章

691

TextBrewer是一个基于PyTorch的、为实现NLP中的知识蒸馏任务而设计的工具包，
融合并改进了NLP和CV中的多种知识蒸馏技术，提供便捷快速的知识蒸馏框架，用于以较低的性能损失压缩神经网络模型的大小，提升模型的推理速度，减少内存占用。

1.简介

TextBrewer 为NLP中的知识蒸馏任务设计，融合了多种知识蒸馏技术，提供方便快捷的知识蒸馏框架。

主要特点：

TextBrewer目前支持的知识蒸馏技术有：

软标签与硬标签混合训练
动态损失权重调整与蒸馏温度调整
多种蒸馏损失函数: hidden states MSE, attention-based loss, neuron selectivity transfer, …
任意构建中间层特征匹配方案
多教师知识蒸馏
…

TextBrewer的主要功能与模块分为3块：

Distillers：进行蒸馏的核心部件，不同的distiller提供不同的蒸馏模式。目前包含GeneralDistiller, MultiTeacherDistiller, MultiTaskDistiller等
Configurations and Presets：训练与蒸馏方法的配置，并提供预定义的蒸馏策略以及多种知识蒸馏损失函数
Utilities：模型参数分析显示等辅助工具

用户需要准备：

在多个典型NLP任务上，TextBrewer都能取得较好的压缩效果。相关实验见蒸馏效果。

pip install textbrewer

git clone https://github.com/airaria/TextBrewer.git
pip install ./textbrewer

本文系作者在时代Java发表，未经许可，不得转载。

如有侵权，请联系nowjava@qq.com删除。

编辑于 2023-08-09 09:55:262023-08-09 09:55:26

文章订阅