小米完成史无前例的大模型强化学习直播训练,历时6天、耗资350万美元推出MiMo-V2.6系列。旗舰模型Pro登顶开源评测第一,逼近闭源前沿,并开源权重、完整技术报告与训练框架。
历时6天、耗资约350万美元(约合2344万元人民币),小米完成了一场公开透明的大模型强化学习(RL)「炼丹直播」。伴随实时美元计价器的跳动,MiMo-V2.6 的 Pro 和 Flash 版本双双跑完 30 个训练 Step,正式收官。
钱烧完了,模型性能也大幅跃升。拥有 1.02 万亿参数、420 亿激活参数的 MiMo-V2.6-Pro 在 Artificial Analysis 智能指数上斩获 46 分,位列全球开源模型第一。Hugging Face CEO 对此公开称赞「太棒了」。在多项 AI 智能体(Agent)评测中,Pro 的成绩已逼近 Claude Opus 5 与 GPT-5.6 Sol。
曾参与 DeepSeek-R1 研发的小米 MiMo 负责人罗福莉直言,这是迄今开源模型团队进行的最大规模单次强化学习训练之一,其背后的研究创新和工程挑战甚至超过了 DeepSeek-R1。

回顾训练全过程:
经过 30 个 Step 的强化学习,Flash 的平均任务通过率提升 25%,Pro 提升 12%。在考核真实代码库能力的 DeepSWE v1.1 样本外测试中,Pro 从 58.4 分跃升至 72.57 分,Flash 也从 48.7 分升至 65.68 分,证明模型没有在训练集上死记硬背,而是获得了可泛化的工程解决能力。
在基准测试中,MiMo-V2.6-Pro 在 AutomationBench 拿到 53.1 分,超越了 Claude Opus 5(50.3 分)和 GPT-5.6 Sol(45.8 分)。

性能拉满的同时,小米保持了亲民定价:Pro 版本输入/输出每百万 Token 为 3 元/6 元,Flash 仅为 1 元/2 元。Artificial Analysis 测算显示,MiMo-V2.6-Pro 完成单个基准任务的平均成本仅需 0.13 美元,是同分闭源模型 Grok 4.7(3.74 美元)的近三十分之一。
与此同时,小米将 Pro 和 Flash 模型权重、完整技术报告、7000 多个强化学习环境、端到端训练框架以及基于 Qwen3.5-9B 的蒸馏模型全量开源,甚至提供了最高可达 900 TPS 的 UltraSpeed 推理模式。
训练完成后,小米将 MiMo-V2.6-Pro 投入了此前从未专项训练过的材料科学场景——设计捕获 PFAS(全氟类永久污染物)的金属有机框架(MOF)材料。MiMo 自主检索文献、搭建模拟环境并调用计算工具,设计出的两种锆基框架候选材料吸附性能比对照组提升了一百万到一千万倍,将内部研发周期从一个月缩短到两三天。

除了科研,MiMo-V2.6 展现出全模态通用能力。团队搭建的纯 MiMo 生成虚拟展馆中,3D 建模、动画、背景音乐、可交互虚拟机与终端操作全部由模型一体化生成;在具身仿真环境中,它还能通过视觉闭环控制机械臂完成分拣。
配合发布的 MiMo Desktop 客户端,主 Agent 与多个并行子 Agent 能够分工协作,快速构建出具备完整交互逻辑的 3D 体素大世界。
如此庞大规模的后训练系统,其稳定运行依赖三项核心机制:

在大规模强化学习中,小米还解决了两个深层工程难题:
通过 Hack Agent 对抗作弊、冻结 Router 解决失衡、高规格判卷引导泛化,小米证明了大规模强化学习在多模态 Agent 上的工程可行性,也为开源社区探索自我演进(RSI)迈出了扎实的一步。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断