Meta FAIR与华盛顿大学提出字节级模型蒸馏新方法,将教师模型的概率分布映射到基础字节级别。实验表明,该方案突破了传统Token蒸馏的性能天花板,下游任务预测准确率上限提升4个百分点,显著削减了存储开销。
在大语言模型领域,Token(词元)一直被视作不可或缺的基本建模单元。但这一惯例正在受到挑战。
来自 Meta FAIR 与华盛顿大学的研究团队在最新论文《突破 Token 天花板:蒸馏出更小、更强的字节模型》中提出了一种新思路:将模型蒸馏的学习单位从词元切换为字节(Byte),让学生模型直接从字节级的概率分布开始学习。

以 Llama 3-8B 为教师模型的实验表明,随着训练计算量的增加,字节级蒸馏能够反超传统的 Token 蒸馏,下游任务平均准确率上限高出 4 个百分点。

模型蒸馏通常让小模型(学生)学习大模型(教师)在庞大词表上的输出概率分布。然而,现代开源大模型的词表规模极其庞大。以 Llama 3-8B 为例,其词表包含 128,256 个 Token,这意味着每个生成位置都对应十多万个候选概率。
在离线蒸馏场景下,完整保存这一概率分布的存储成本高得惊人,工程实践中往往只能采用 top-k 截断保存部分概率。相比之下,一个字节由 8 个比特组成,基础取值仅有 256 种,其候选空间被压缩了数个数量级,使得完整保留输出概率分布成为可能。

不过,教师模型预测的是整词元,而学生模型预测的是逐个字节。为了让知识对齐,团队提出了两种将 Token 级概率分布转换为字节级分布的方案:Marginalize-It 与 End-Of-Token。

两者的核心逻辑都是将教师模型对不同候选 Token 的概率,逐步分解至对应的前缀字节位置。
研究团队以 Llama 3-8B 为教师模型,构建了参数量约 12.8 亿的 Transformer 骨干网络,对比了 Token 监督、字节监督、Token 蒸馏以及两种字节蒸馏共六组方案,并在选择题问答、语言生成及机器翻译等八项基准上展开了评测。
训练过程揭示出有趣的动力学规律:


不过,该方案并非毫无代价。End-Of-Token 为每个词元增加了额外符号,序列长度有所增加,处理等量文本时的训练计算量高出约 30.94%,其在推理端的吞吐权衡仍有待进一步工程优化。
该研究由华盛顿大学与 Meta FAIR 联合完成。论文第一作者为华盛顿大学博士生 Kalyani Marathe(师从 Luke Zettlemoyer);主要贡献者还包括 QLoRA 与 Byte Latent Transformer(BLT)核心作者 Artidoro Pagnoni、Meta FAIR 研究科学家兼 Llama 3 预训练负责人之一 Mike Lewis,以及 NLP 领域知名学者 Luke Zettlemoyer 教授。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断