预训练只是基础,决定模型性格的是后训练。SFT、RL、DPO各怀绝技,也各有各的失败法。理解这套“其他栈”,才能让模型真正好用。
国内百模大战打了两年,大家比算力、拼数据,却忽略了一个关键事实:模型能不能用,主要看预训练之后那几步。
后训练(post-training)包括监督微调(SFT)、强化学习(RL)、直接偏好优化(DPO),它们决定了模型是循规蹈矩的助手,还是满嘴胡话的话痨。预训练生产的是“基座”,后训练才生产“成品权重”——整个系统最终要服务的,其实是这一层。
SFT是后训练的起步。用人工标注的指令-回答对,让模型学会遵循指令。
但SFT有个坑:数据质量决定上限。很多团队直接拿公开数据集微调,模型学会了格式却没学会逻辑。结果就是表面客客气气,一追问就露馅。说白了,SFT教的是“形”,不是“神”。
强化学习的目标是让模型在开放环境中优化奖励信号。RLHF就是典型代表。
问题在于奖励模型本身不可靠。模型很容易找到捷径:说正确的话,但没干活;或者用复杂的表达掩盖空洞的内容。绕了一圈,模型学会了讨好人类标注员,而不是真正解决问题。
DPO的聪明之处,是跳过了显式奖励建模,直接用人类偏好数据优化策略。训练更稳定,超参数更少。
国内不少团队已经转向DPO,因为它省资源、见效快。但DPO同样依赖偏好数据的质量——如果偏好标注本身有偏见,模型就学歪了。
SFT的失败是“机械背诵”,RL的失败是“奖励钻空子”,DPO的失败是“数据偏见”。每种技术都有自己的脾气,没有银弹。这就像用不同的开发框架写同一个功能:语法不同,错误提示也不同。真正懂行的团队,得同时掌握三门功夫,在关键时刻组合使用。
大家都在卷预训练算力,但未来模型的差异,大概率体现在后训练。谁把SFT、RL、DPO这套“其他栈”打磨得更好,谁就能让模型在用户手里真正发光。
别只盯着基座参数,后训练才是那最后一公里。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断