NVIDIA 发布开源 MoE 模型 Nemotron 3.5 Lightning,并推出模型路由库 NeMo Switchyard。前者专为高频智能体任务设计,可定制后训练;后者能智能分配请求到最合适的模型,帮助企业降低成本、提升效率,同时保留对部署方式和运行位置的控制。
随着 AI 从聊天机器人走向自主智能体,开放模型正在满足市场对部署位置、部署方式和演进方式的全面掌控需求。
NVIDIA 日前宣布扩展 Nemotron 3 模型家族,推出 Nemotron 3.5 Lightning——针对长时间运行智能体工作负载效率最高的模型。紧随 Nemotron 3 Nano 之后,此次发布体现了 NVIDIA 持续改进开放模型、提升准确性和速度的承诺。
Nemotron 3.5 Lightning 是一个 300 亿参数的混合专家(MoE)模型,专为大型多智能体系统中的专项任务设计,可帮助开发者打造更聪明、更高效的智能体应用。
与模型一同发布的还有 NeMo Switchyard,一个用于智能路由的开源库。企业可以基于自身需求构建路由器,将每个请求智能分配到最合适的模型上——无论是开放模型、专有模型还是 NVIDIA 自有模型,且无需重写应用。
二者结合,让开发者可以在 PC、工作站、数据中心和云端等环境中,对 AI 部署方式、运行位置和运行效率获得更强的控制力。

现代智能体系统越来越多地以模型系统方式运行,让不同模型各司其职。例如,前沿推理模型(如 Nemotron 3 Ultra 或 GPT-5.6)负责规划和编排工作流,而像 Nemotron 3.5 Lightning 这样更小、更专业的模型则执行代码审查、工具调用、安全告警监控、账单问答等具体任务。
Nemotron 3.5 Lightning 是一个完全可定制的开放模型,专为持续在线的智能体高频任务打造。其开发过程得到 Nemotron Coalition 成员的支持,他们贡献了评估方法、推理软件和数据集。
与同类模型相比,Nemotron 3.5 Lightning 的生成速度最高提升 4 倍,智能体任务完成速度提升 30%。由于模型开放且可定制,组织可以使用 NVIDIA NeMo 在自有领域数据、工具和工作流上轻松进行后训练,提升专项任务的准确性。

PinchBench 基准测试显示,Nemotron 3.5 Lightning 在同类模型中能以更快的智能体任务完成速度,达到前沿级别的准确性。
多家 AI 领军企业正在针对自身工作负载定制 Nemotron 3.5 Lightning:CrowdStrike 用于网络安全,Harvey 与 Trajectory 用于法律服务,CodeRabbit 与 Baseten 用于代码审查;Lila Sciences 正在提升物理和生命科学领域的智能体推理能力;Fastino Labs 定制模型后,在软件开发、金融和医疗健康工作负载上取得了领先的准确率。

企业已通过定制 Nemotron 3.5 Lightning,在各自的智能体工作流中实现了领先的专项任务准确率。
Nemotron 3.5 Lightning 还让组织掌握隐私和部署的主动权。它可以运行在 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson 等本地 AI 系统上,最大化利用现有基础设施投资;也可以扩展到边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云端环境。对需要快速响应的高频专项任务,可以选择本地或私有化部署。
与以往 Nemotron 发布一样,NVIDIA 在许可允许范围内公开了尽可能多的训练数据和训练技术,以实现可追溯性、可审计性,并支持其他模型的训练。此次还发布了 Nemotron-RL-Agentic-Terminal-Pivot 数据集,用于对编码智能体进行强化学习后训练。
不同的模型各有擅长:有的适合编码,有的适合推理,有的适合轻量任务,有的优化了本地运行的隐私和效率。如果统一使用一个默认模型,可能会多花钱或牺牲质量;如果手动管理路由,又可能拖慢部署。
NeMo Switchyard 正是为此而生。它是一个面向 AI 智能体的开源模型路由库,能够根据具体需求,自动将提示词路由到每个步骤最合适、最高效的模型。开发者可以调整或更换不同的路由算法,以匹配质量、延迟和成本等优先目标。在模型系统的架构下,企业可以打造更强大、更经济的 AI 智能体。
NVIDIA 内部基准测试显示,NeMo Switchyard 能保持前沿级准确率,同时将任务完成成本降至仅使用 Opus 4.8 时的近三分之一。

NVIDIA 正与生态伙伴合作,将智能模型路由引入开发者已在使用的工具和平台中:
Nemotron 3.5 Lightning 已上线 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com,支持 NVIDIA NIM 微服务,并可通过 NVIDIA 云合作伙伴、后训练平台、推理平台和云服务商的广泛生态获取。NeMo Switchyard 已在 GitHub 发布,并将陆续登陆合作伙伴平台。
原文链接:NVIDIA AI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断