AI智能体具备推理与调用工具的能力,也带来了全新的安全挑战。NVIDIA提出将AI安全视为工程问题,必须在模型、编排与运行时等全栈各层建立强制边界、沙箱隔离与责任人制度,推动全行业协同防御。

AI 安全本质上是一个工程问题。这意味着它必须具备明确的安全需求、可强制执行的控制策略、具体的责任人,以及证明防护机制确实有效的客观证据。
随着 AI 能力的快速演进,整个行业必须加速推进安全工程建设,降低防御工具的使用门槛,并更高效地共享切实可行的防护经验。
互联网与云计算重塑了软件的运行模式,但网络安全的核心职责始终如一:确认身份、控制访问、最小化暴露面,并验证防护措施是否生效。
AI 智能体(Agent)引入了全新的能力——能够进行逻辑推理、调用外部工具,并根据接收到的数据动态调整行动策略。这些新特性要求我们将经过验证的经典安全原则,迁移并应用到全新的运行环境中。
这种技术迭代的节奏带来了不小的压力。企业迫切希望借助 AI 获取生产力红利,然而针对这些系统的治理框架与安全实践仍处于摸索阶段。
现代应用依赖于代码、数据、身份、服务以及底层基础设施的协同运转。系统的整体安全性取决于这些组件之间的衔接,而 AI 智能体正进一步扩展这一系统架构。
在完整的 Agent 技术栈中,大语言模型提供核心能力;编排框架负责组织上下文、工具与工作流;运行时环境则提供指令执行所需的底层基础设施。技术栈中的每一层都承担着安全职责。随着数据、指令和操作在系统间流转,必须在每一层都部署严密的控制策略。
举个例子:一个负责更新客户资料的智能体,若在读取附件时遭遇恶意提示词注入,并试图将客户数据导出到未经授权的外部服务器。此时,底层的网络策略必须能够强制拦截这次数据传输;同时,受保护的安全日志应当完整记录此次工具调用、权限判定结果及执行状态,以便安全团队精准排查智能体调用了何种工具、意图将数据发往何处。
更新客户档案的权限,绝不应当默认附带导出数据的权限。智能体可以申请提权,但绝不能拥有自我授权的能力。
即便智能体做出了错误的判断,安全边界也必须牢不可破。决定智能体行动上限的不是其自身的推理逻辑,而是其运行所在的宿主环境。因此,对文件、网络目标和系统进程的限制,必须独立于智能体本身进行强制隔离。
提示词规则和护栏虽然能引导行为,但真正的安全必须依赖无法被模型逾越的硬性边界。
每个智能体都应具备可追溯的独立身份,其凭证仅限于当前指定任务。企业需要制定清晰的安全策略,界定智能体可访问的数据范围、允许修改的系统组件,以及哪些操作必须经过审批。在既定边界之内,高风险操作和权限变更依然需要人类的最终确认。
与此同时,工程团队必须严格校验智能体所调用的工具、技能和依赖库的来源与完整性。一旦发生异常,针对工具调用、鉴权决定及执行结果的安全记录,能帮助调查人员完整还原事件链路。配合明确的权限撤销与应急隔离流程,这些审计证据才能真正转化为防御行动。
NVIDIA OpenShell 是一款开源的受保护运行时环境。它在智能体掌控范围之外强制执行安全策略,提供沙箱化执行环境,严格管控智能体对数据、网络及系统资源的访问。Open Secure AI Alliance 的合作伙伴正基于 OpenShell 展开协作:思科的 DefenseClaw 为其注入了治理能力;JFrog 则与 OpenShell 深度集成,负责扫描与验证智能体所使用的技能,严格把关调用策略。
在将系统推向生产环境前,团队必须掌握明确证据,证明防护措施能够有效阻断越权获取凭证或外泄敏感数据的行为。
安全测试还应覆盖恶意提权或干扰监控日志的攻击场景。每当模型、工具或工作流发生关键变动时,相关测试必须重新执行。
必须指定专门的安全责任人,根据测试结果评估系统是否具备上线条件,并督促针对未通过项的修复整改。无论是在测试阶段还是实际运行中捕获的安全失效,都应具备可复现性、可调查性并彻底根治。每个安全隐患最终都应转化为常态化的回归测试用例,确保漏洞在后续版本中不会反复出现。
例如,CrowdStrike 的 SafeMind 通过持续的模拟攻击测试来加固防线;Palo Alto Networks 的 Prisma AIRS 则能在模型和应用演进过程中提供持续的红队对抗测试。
深入调查安全漏洞,需要匹配对应任务、数据和环境的专业工具。开源模型与闭源模型在这一过程中扮演着互补的角色。
闭源模型能够提供高度托管的功能与开箱即用的服务;而开源模型则赋予防御者深度审查底层组件、自适应调整策略的灵活性,使其能够在自主掌控的基础设施上开展防御工作。
在应急响应期间,这种本地掌控力至关重要:安全团队能够在完全受控的自有环境中复现漏洞、验证补丁,同时确保敏感证据和日志绝不外泄。
具备高阶能力的 AI 工具本身也能赋能防御工作,协助定位代码漏洞、验证安全修复方案并分析攻击路径。衡量其价值的核心指标应当是:能否得出可复现的排查结果、提供可验证的修复手段,以及能否显著缩短应急响应时间。
例如,第一资本(Capital One)开源的 VulnHunter 利用 AI 强化代码安全审查;ReversingLabs 的 Spectra Assure 则通过 AI 分析软件安装包,精准识别恶意代码与供应链篡改风险。
透明共享漏洞失效案例、有效控制策略以及补丁验证方法,能够帮助更多技术团队快速加固自身系统。
NVIDIA 安全研究实验室与 Open Secure AI Alliance 正通过输出前沿研究、实用开源工具和专业工程经验,持续向更广泛的安全社区赋能。
AI 安全归根到底是一场工程攻坚战。每一个智能体系统的落地,都需要不可逾越的执行边界、明确负责的安全主管,以及经得起考验的防御证据。开源生态的深度协同与工具共享,将助力更多安全团队守住这一底线,并随着 AI 技术的跃进而持续迭代防护能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断