NVIDIA 团队近日公布技术突破,其 Nemotron 模型家族通过专项微调与后训练强化,在国际信息学奥赛(IOI)和国际数学奥赛(IMO)中均达到金牌水平,验证了单一模型架构在极致复杂推理任务上的泛化潜力。
在顶尖 AI 推理能力的角逐中,数学与算法竞赛一直是衡量大语言模型极限能力的试金石。NVIDIA 团队近期在 Hugging Face 社区及技术博客公开了最新成果:基于其开源的 Nemotron 模型家族,通过系统化的后训练与微调策略,在国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)两项世界顶级智力赛事中,双双取得达到金牌级评分的解题表现。
这是业内首次由同一模型家族在代码算法与高难度理论数学两大极具挑战性的领域同时实现金牌级突破。
IOI 与 IMO 代表了人类中学生阶段计算机科学与数学竞赛的最高水准。IOI 题目不仅要求极高的算法设计能力,还对代码的时间复杂度、空间复杂度以及边界条件处理有着严苛要求;而 IMO 则侧重于复杂多步骤的逻辑证明与数学洞察,传统的通用模型在面对此类任务时极易出现逻辑断层或幻觉。
NVIDIA 团队并未针对两项竞赛分别构建完全割裂的模型架构,而是以 Nemotron 系列大模型为统一基座,针对两项赛事的特质设计了差异化的高效后训练管道。
在面向 IOI 的优化中,团队的核心聚焦于代码生成的精确度与环境交互反馈:
针对 IMO 的复杂数学问题,Nemotron 采用了高阶推理与验证机制相结合的微调方案:
NVIDIA 团队的这一成果不仅刷新了开源基座在顶级学科竞赛中的表现天花板,更进一步证明了后训练(Post-training)在激发基座模型高级推理潜力中的核心作用。通过将高质量合成数据、环境执行反馈与强化学习相结合,开源大模型正在迅速缩小与闭源顶尖前沿模型在复杂逻辑与科学计算领域的差距。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断