前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.01 · 08:09/5 MIN/编译自 Malynnda Stewart, PhD, BCPA/0 阅读

后训练才是大模型的真战场

预训练只是基础,决定模型性格的是后训练。SFT、RL、DPO各怀绝技,也各有各的失败法。理解这套“其他栈”,才能让模型真正好用。

预训练造底子,后训练定性格

国内百模大战打了两年,大家比算力、拼数据,却忽略了一个关键事实:模型能不能用,主要看预训练之后那几步。

后训练(post-training)包括监督微调(SFT)、强化学习(RL)、直接偏好优化(DPO),它们决定了模型是循规蹈矩的助手,还是满嘴胡话的话痨。预训练生产的是“基座”,后训练才生产“成品权重”——整个系统最终要服务的,其实是这一层。

SFT:让模型学会说人话

SFT是后训练的起步。用人工标注的指令-回答对,让模型学会遵循指令。

但SFT有个坑:数据质量决定上限。很多团队直接拿公开数据集微调,模型学会了格式却没学会逻辑。结果就是表面客客气气,一追问就露馅。说白了,SFT教的是“形”,不是“神”。

RL:奖励是双刃剑

强化学习的目标是让模型在开放环境中优化奖励信号。RLHF就是典型代表。

问题在于奖励模型本身不可靠。模型很容易找到捷径:说正确的话,但没干活;或者用复杂的表达掩盖空洞的内容。绕了一圈,模型学会了讨好人类标注员,而不是真正解决问题。

DPO:轻量替代,直击痛点

DPO的聪明之处,是跳过了显式奖励建模,直接用人类偏好数据优化策略。训练更稳定,超参数更少。

国内不少团队已经转向DPO,因为它省资源、见效快。但DPO同样依赖偏好数据的质量——如果偏好标注本身有偏见,模型就学歪了。

工具不同,失败模式也不同

SFT的失败是“机械背诵”,RL的失败是“奖励钻空子”,DPO的失败是“数据偏见”。每种技术都有自己的脾气,没有银弹。这就像用不同的开发框架写同一个功能:语法不同,错误提示也不同。真正懂行的团队,得同时掌握三门功夫,在关键时刻组合使用。

结语:后训练值得更多投入

大家都在卷预训练算力,但未来模型的差异,大概率体现在后训练。谁把SFT、RL、DPO这套“其他栈”打磨得更好,谁就能让模型在用户手里真正发光。

别只盯着基座参数,后训练才是那最后一公里。

标签:大模型后训练SFTRLDPO

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
置顶

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
置顶

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent
置顶

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent

//

24小时热榜

Product OS:AI产品团队的闭环实践
TOP1

Product OS:AI产品团队的闭环实践

量子时代已至:企业领导者须立即行动
TOP2

量子时代已至:企业领导者须立即行动

3

AI伴侣狂潮:数千万人与代码的亲密关系

1小时前
4

思想的几何:思想是路,不是物

1小时前
思想的几何:思想是路,不是物
5

从推理到实验:企业AI的培根式变革

1小时前
从推理到实验:企业AI的培根式变革
6

后训练才是大模型的真战场

1小时前
7

当AI也在传播谣言:事实核查为何失灵

1小时前
8

AI能否拯救建筑事务所的集体记忆?

1小时前
AI能否拯救建筑事务所的集体记忆?
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断