前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

NVIDIA 开源生态助力本地 AI 模型与智能体

AI 前沿2026年8月10日· 原作者:NVIDIA Writers· 5 分钟阅读0 阅读

8月,NVIDIA 联合开源社区发布 Cosmos 3 Edge、Nemotron 3.5 Lightning 等多款开源模型,更新 DGX Spark 集群工具与 Unsloth Desktop 应用,推动本地 AI 智能体的构建与部署,降低开发门槛与推理成本。

整个8月,NVIDIA 联合开源社区与合作伙伴,集中展示本地 AI 的最新进展——包括新发布的开放模型、软件工具和开发者资源,让爱好者与开发者能更轻松地在本地构建、定制和运行越来越强大的 AI 智能体。以下为本轮更新的核心亮点。

多款开源新模型登场

世界模型与视频生成

  • Cosmos 3 Edge:40亿参数世界模型,面向机器人、自动驾驶和视觉 AI。体积仅为 Cosmos 3 Nano 的四分之一,可在 DGX Spark 和 Jetson 设备上运行。
  • MiniMax-H3:330亿参数开放权重模型,能从文本、图像、视频、音频或混合输入生成视频,并原生同步立体声音频,可通过 ComfyUI 在本地运行。
  • Wan-Animate-2:阿里巴巴推出的140亿参数开源模型,将驱动视频中的动作和表情迁移到静态角色图上,支持人物、卡通、机器人等。在 RTX PRO 5000 Blackwell 上生成速度最高提升16倍,RTX 5090 上达26倍。

代码与推理模型

  • Laguna S 2.1:Poolside 推出的1180亿参数开源智能体编程模型,可处理长达数小时的任务。NVFP4 量化版本让开发者能在单台 DGX Spark 上以更低算力和内存需求运行。
  • DeepSeek-V4-Flash:2840亿参数 MoE 模型,激活130亿参数,支持100万 token 上下文窗口,可借助社区 GGUF 版本在 DGX Station 上本地运行。
  • Inkling-Small:Thinking Machines Lab 的开源权重多模态模型,原生支持文本、图像和音频推理,可调节思考强度。2760亿参数但每次仅激活120亿,单台 DGX Station 或两台 DGX Spark 即可运行。

Unsloth Desktop:本地训练与推理合二为一

Unsloth 发布了完全开源的桌面应用 Unsloth Desktop,将本地模型推理、图像与视频扩散、微调、智能体集成、网络研究和代码执行整合到一个应用中。官方称这是首个能在本地同时训练和运行 AI 模型的桌面应用。

LTX-2.5:更强的开源视频生成

LTX-2.5 支持多镜头序列生成,保持跨镜头一致性;升级的扩散视频解码器提升画质、减少伪影。新的提示词增强器(基于 Gemma4 E2B 和定制 Gemma4 12B 文本编码器)大幅提升提示遵循度。该模型针对 RTX GPU、DGX Spark 和 DGX Station 优化,在 RTX 6000 PRO 上性能提升最高20%,显存节省40%。

Meta Muse Glimmer:面向常驻本地智能体

Muse Glimmer 是 Meta 发布的300亿参数稠密开源模型,支持超过12万 token 上下文,专为编码和本地智能体设计。在 RTX 5090 上可达到每秒200+ token,让智能体在单机本地处理数据并完成多步复杂任务。该模型支持针对自定义智能体、私有数据处理、凭证处理、多步任务和长周期工作流进行微调,可通过 vLLM、llama.cpp 等框架运行,NVIDIA 也提供 NeMo Automodel 支持本地微调。

Muse Glimmer 运行示意图

DGX Spark 集群与系统更新

GLM 5.2、DeepSeek V4 Flash 等新模型为本地系统带来云端级智能,但运行大模型往往需要多卡或多机协作。NVIDIA Sync 应用的新版 Cluster Assistant 可自动将多台 DGX Spark 配置为高速集群,通过 ConnectX-7 端口互联,自动配置网络、路由负载并监控健康状态。Windows 和 macOS 均可用。

此外,DGX Spark 将原生支持 Google Chrome(ARM64 Linux 版),一键安装同步账号与扩展。新的 Sync Resource Monitor 可实时或历史查看 CPU/GPU 使用率,帮助用户排查瓶颈。

Nemotron 3.5 Lightning:更快更省的智能体模型

NVIDIA 扩展 Nemotron 3 系列,推出300亿参数 MoE 模型的 Nemotron 3.5 Lightning,面向常驻智能体场景优化。相比同类开源模型,token 生成速度最高提升4倍,任务完成时间缩短30%。由于采用开放权重,开发者可用自有数据微调,使其适配写作风格、专业知识或特定编码规范。该模型与 vLLM、Ollama、llama.cpp、LM Studio 等框架深度协作,提供 NVFP4 和 GGUF 格式,支持从 RTX PC、DGX Spark、Jetson 到 RTX PRO 工作站、DGX Station 等环境。

同时发布的 NeMo Switchyard 是一个开源路由库,可根据准确性、速度和成本,将智能体工作流的每一步自动路由到最优模型。内部基准测试显示,在保持前沿任务完成率的同时,可将推理成本降至仅使用 Opus 4.8 时的约三分之一。


原文链接:NVIDIA AI Blog
本文由前途科技编辑整理

标签:NVIDIA开源模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

OpenAI Daybreak 模型登陆 AWS
TOP1

OpenAI Daybreak 模型登陆 AWS

Coldcard被黑损失攀升 分析师估算存分歧
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

Coldcard被黑损失攀升 分析师估算存分歧

3

英伟达联手六大机构为AI工厂融资超5000亿美元

18小时前
英伟达联手六大机构为AI工厂融资超5000亿美元
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断