小米大模型团队开启了一场前所未有的现场直播,完全公开新模型 MiMo-V2.6 的强化学习训练全过程。训练仅 36 小时便烧掉超 108 万美元,平均每小时花费 3 万美元。小米借此探索大模型强化学习的三维扩展法则。
见过开源模型权重、训练代码乃至训练数据的,但把大模型的强化学习(RL)训练过程全透明实时直播的,业界尚属首次。
小米大模型负责人罗福莉近日公开了 MiMo-V2.6 的强化学习训练现场。点进监控面板,训练消耗的资金、执行的步数、奖励曲线变化,甚至具体哪个节点的 GPU 发生故障,全部实时呈现在公众面前。
这是一场名副其实的“硬核烧钱”:从 Pro 模型起步算起,36 小时内两款模型已消耗超过 108 万美元,平均每小时耗资约 3 万美元(约合人民币 21.6 万元)。


虽然 MiMo-V2.6 的 Flash 和 Pro 两款模型刚开训一天多,但强化学习带来的能力增益已清晰可见:

自此前开源 MiMo-v2.5 后,小米大模型团队低调研发了近半年。罗福莉对此解释称,团队这半年来核心攻坚的问题只有一个:强化学习(RL)究竟能扩展(Scale)到多远?
传统的预训练 Scaling Law 逻辑清晰:更多数据 × 更大参数 × 更多算力 = 更强模型。而小米此次尝试验证的,是强化学习能否建立起类似的扩展范式。

小米将强化学习的 Scaling 归纳为三个关键维度:训练计算量、环境与执行框架、评分计算量。
这是最直观的算力堆叠。MiMo-V2.6 系列每个训练 Step 需要吞吐大约 20 亿 Token,对应配置为 1568 个 Prompt × 16 条 Rollout。
面对一道复杂任务,模型不再是一问一答,而是主动探索 16 条不同的推理和执行路径。特别是在涉及多轮思考、工具调用与环境交互的 AI 智能体任务中,一个 Step 便会演变出数十亿级 Token。
为支撑庞大的并发交互,MiMo 构建了完全异步(Fully Async)流水线。传统训练需等待“生成-评分-更新”严格排队,而在此架构中,生成、执行、判分、奖励计算并行交错,形成持续运转的高吞吐引擎。
模型面对的任务不再局限于单一模式。MiMo-V2.6 推行多任务智能体强化学习(Multi-task Agentic RL),将代码、通用交互、视觉与对话混编至同一训练周期。
不同任务运行在各自的专用 Harness(执行框架)中:编程智能体调用终端排错、执行测试,视觉智能体则面对图像反馈与交互动作。小米扩展的不仅是题量,更是模型应对复杂数字环境的广度。
评估智能体优劣的算力成本(Grader Compute)往往被行业低估。数学与选择题有标准化正误判断,但长链路智能体通常需要连续几十步操作,最终仅返回“成功”或“失败”对学习极不充分。
为了解决动作与结果之间的信用分配(Credit Assignment)难题,MiMo 提出了 Agentic In-group Credit Assignment 机制。通过对比单 Prompt 下派生的 16 条不同轨迹,分析究竟是哪一步决策扭转了局势,为长程多步操作赋予更细颗粒度的奖励反馈。
从更大的算力吞吐、更丰富的真实环境,到更细粒度的奖励反馈,小米试图证明:预训练之后的强化学习闭环,同样可以成为一台遵循规律、持续扩展的大模型工业机器。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断