8月,NVIDIA 联合开源社区发布 Cosmos 3 Edge、Nemotron 3.5 Lightning 等多款开源模型,更新 DGX Spark 集群工具与 Unsloth Desktop 应用,推动本地 AI 智能体的构建与部署,降低开发门槛与推理成本。
整个8月,NVIDIA 联合开源社区与合作伙伴,集中展示本地 AI 的最新进展——包括新发布的开放模型、软件工具和开发者资源,让爱好者与开发者能更轻松地在本地构建、定制和运行越来越强大的 AI 智能体。以下为本轮更新的核心亮点。
世界模型与视频生成
代码与推理模型
Unsloth 发布了完全开源的桌面应用 Unsloth Desktop,将本地模型推理、图像与视频扩散、微调、智能体集成、网络研究和代码执行整合到一个应用中。官方称这是首个能在本地同时训练和运行 AI 模型的桌面应用。
LTX-2.5 支持多镜头序列生成,保持跨镜头一致性;升级的扩散视频解码器提升画质、减少伪影。新的提示词增强器(基于 Gemma4 E2B 和定制 Gemma4 12B 文本编码器)大幅提升提示遵循度。该模型针对 RTX GPU、DGX Spark 和 DGX Station 优化,在 RTX 6000 PRO 上性能提升最高20%,显存节省40%。
Muse Glimmer 是 Meta 发布的300亿参数稠密开源模型,支持超过12万 token 上下文,专为编码和本地智能体设计。在 RTX 5090 上可达到每秒200+ token,让智能体在单机本地处理数据并完成多步复杂任务。该模型支持针对自定义智能体、私有数据处理、凭证处理、多步任务和长周期工作流进行微调,可通过 vLLM、llama.cpp 等框架运行,NVIDIA 也提供 NeMo Automodel 支持本地微调。

GLM 5.2、DeepSeek V4 Flash 等新模型为本地系统带来云端级智能,但运行大模型往往需要多卡或多机协作。NVIDIA Sync 应用的新版 Cluster Assistant 可自动将多台 DGX Spark 配置为高速集群,通过 ConnectX-7 端口互联,自动配置网络、路由负载并监控健康状态。Windows 和 macOS 均可用。
此外,DGX Spark 将原生支持 Google Chrome(ARM64 Linux 版),一键安装同步账号与扩展。新的 Sync Resource Monitor 可实时或历史查看 CPU/GPU 使用率,帮助用户排查瓶颈。
NVIDIA 扩展 Nemotron 3 系列,推出300亿参数 MoE 模型的 Nemotron 3.5 Lightning,面向常驻智能体场景优化。相比同类开源模型,token 生成速度最高提升4倍,任务完成时间缩短30%。由于采用开放权重,开发者可用自有数据微调,使其适配写作风格、专业知识或特定编码规范。该模型与 vLLM、Ollama、llama.cpp、LM Studio 等框架深度协作,提供 NVFP4 和 GGUF 格式,支持从 RTX PC、DGX Spark、Jetson 到 RTX PRO 工作站、DGX Station 等环境。
同时发布的 NeMo Switchyard 是一个开源路由库,可根据准确性、速度和成本,将智能体工作流的每一步自动路由到最优模型。内部基准测试显示,在保持前沿任务完成率的同时,可将推理成本降至仅使用 Opus 4.8 时的约三分之一。
原文链接:NVIDIA AI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断