QLabs 发布 Dust,称这是首个在预训练 Transformer 语言模型上能与反向传播竞争的零阶方法:不碰权重,只在每个 token 的激活上独立扰动,一次前向传播并行评估整个种群。
深度学习的整套工程体系——架构、优化器、硬件——都是围绕反向传播长出来的。QLabs 的一组研究者(Samip Dahal、Bishwas Mandal、Serdar Gülbahar、Akshay Vegesna)提出一个问题:如果算力足够便宜,是否可以用更"暴力"的搜索取代梯度。
他们给出的答案是 Dust,一篇题为《Dust: Pretraining Transformers Without Backpropagation》的研究。按论文自述,这是首个在预训练 Transformer 语言模型上能与反向传播竞争的零阶(zeroth-order)方法。
传统进化策略(ES)扰动的是权重,比如论文提到的 EGGROLL(Sarkar 等,2025)。这类方法的开销随种群规模线性增长,因为每个种群成员都要被真实地生成、再评估一次。
Dust 绕开了权重空间:它直接扰动激活值(即节点扰动,node perturbation),而且是在每个 token 上独立扰动。这样一来,每个 token 就相当于一个"虚拟种群成员",一次前向传播就能并行评估整个种群。论文把这套做法称为 virtual population。
论文也解释了为什么值得在激活空间而不是权重空间搜索:机制可解释性研究显示,推理过程——无论是否可以说出来——都存在于激活里。此外作者引用了 Sutton 的"苦涩的教训"和 AlphaGo Zero 的对比来说明立场:可微性和反向传播在低算力区间是高效的归纳偏置,但在高算力区间会限制能用的架构范围,甚至在同一架构内也会错过损失曲面的更优点。
论文自述的主要结论有四点。第一,Dust 在大种群(也就是显著更多算力)下能接近反向传播的效果,在若干设置下甚至更好,作者据此推测在算力充裕的区间有可能超过反向传播。第二,相比权重空间的 ES,Dust 效率高出数个数量级:论文的推算显示,从 100 万 token 起,它比 EGGROLL 的 Transformer 实现高效约 10³ 到 10⁴ 倍。第三,与"零阶方法无法扩展到大型网络"的普遍看法相反,论文发现模型越大反而越省种群——一个 2.43 亿参数的模型在大多数种群规模下都优于比自己小 120 倍的模型。第四,随着种群变大,Dust 的梯度估计与反向传播的对齐程度提升,并且在论文测试的各个规模(最高到 10 亿 token)上都能保持对齐。
论文给出的效率优势是"基于外推"的推算,而非同等算力下的直接对拍;作者自己也强调大型种群意味着"显著更多算力"。换句话说,这更像是给算力充裕的未来场景提供了一个候选算法,而不是今天就比训练框架更划算的方案。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断