前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.01 · 08:09/5 MIN/编译自 Malynnda Stewart, PhD, BCPA/25 阅读

后训练才是大模型的真战场

预训练只是基础,决定模型性格的是后训练。SFT、RL、DPO各怀绝技,也各有各的失败法。理解这套“其他栈”,才能让模型真正好用。

预训练造底子,后训练定性格

国内百模大战打了两年,大家比算力、拼数据,却忽略了一个关键事实:模型能不能用,主要看预训练之后那几步。

后训练(post-training)包括监督微调(SFT)、强化学习(RL)、直接偏好优化(DPO),它们决定了模型是循规蹈矩的助手,还是满嘴胡话的话痨。预训练生产的是“基座”,后训练才生产“成品权重”——整个系统最终要服务的,其实是这一层。

SFT:让模型学会说人话

SFT是后训练的起步。用人工标注的指令-回答对,让模型学会遵循指令。

但SFT有个坑:数据质量决定上限。很多团队直接拿公开数据集微调,模型学会了格式却没学会逻辑。结果就是表面客客气气,一追问就露馅。说白了,SFT教的是“形”,不是“神”。

RL:奖励是双刃剑

强化学习的目标是让模型在开放环境中优化奖励信号。RLHF就是典型代表。

问题在于奖励模型本身不可靠。模型很容易找到捷径:说正确的话,但没干活;或者用复杂的表达掩盖空洞的内容。绕了一圈,模型学会了讨好人类标注员,而不是真正解决问题。

DPO:轻量替代,直击痛点

DPO的聪明之处,是跳过了显式奖励建模,直接用人类偏好数据优化策略。训练更稳定,超参数更少。

国内不少团队已经转向DPO,因为它省资源、见效快。但DPO同样依赖偏好数据的质量——如果偏好标注本身有偏见,模型就学歪了。

工具不同,失败模式也不同

SFT的失败是“机械背诵”,RL的失败是“奖励钻空子”,DPO的失败是“数据偏见”。每种技术都有自己的脾气,没有银弹。这就像用不同的开发框架写同一个功能:语法不同,错误提示也不同。真正懂行的团队,得同时掌握三门功夫,在关键时刻组合使用。

结语:后训练值得更多投入

大家都在卷预训练算力,但未来模型的差异,大概率体现在后训练。谁把SFT、RL、DPO这套“其他栈”打磨得更好,谁就能让模型在用户手里真正发光。

别只盯着基座参数,后训练才是那最后一公里。

标签:大模型后训练SFTRLDPO

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
置顶

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

//

24小时热榜

OpenAI 发布 Agents API 公测版:一键构建生产级智能体
TOP1

OpenAI 发布 Agents API 公测版:一键构建生产级智能体

OpenAI 推出金融专属 ChatGPT,搭载 GPT-6 Astra 强化投行业务
TOP2

OpenAI 推出金融专属 ChatGPT,搭载 GPT-6 Astra 强化投行业务

3

OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型

18小时前
OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型
4

ChatGPT与Codex加持:AI将抗生素筛选缩至数小时

18小时前
ChatGPT与Codex加持:AI将抗生素筛选缩至数小时
5

RLHF先驱Paul Christiano加入OpenAI基金会董事会

1天前
RLHF先驱Paul Christiano加入OpenAI基金会董事会
6

OpenAI发布Data agent:自然语言直连数仓与BI系统

1天前
OpenAI发布Data agent:自然语言直连数仓与BI系统
7

十维标尺深度测评四大前沿大模型能力边界

1天前
十维标尺深度测评四大前沿大模型能力边界
8

DeepSeek发布V4.1 Flash,苹果折叠屏引热议

1天前
DeepSeek发布V4.1 Flash,苹果折叠屏引热议
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断