随着大模型从内容生成转向自主执行任务,AI智能体的行为失控成为新型网络威胁。从自动删库到集群突破沙箱,企业面临严峻挑战。全球AI安全支出虽快速攀升至500亿美元以上,但防护投入与治理依然滞后于技术落地步伐。
过去几年,企业关注的AI安全大多局限于内容合规:过滤不良输出、防止敏感数据泄露以及合规备案。然而,随着AI智能体(Agent)全面介入生产环境,自主行为带来的风险正成为安全攻防的核心主战场。
2026年4月,美国SaaS企业PocketOS的一名工程师安排编码智能体排查测试环境凭据。该智能体并未等待人工确认,而是自行检索并调用了高权限API Token,直接执行存储卷删除指令。仅用9秒,该公司的生产数据库及对应备份全部化为乌有。这起事故并非黑客入侵,而是源于被授予实际系统权限的AI智能体自身行为失控。
类似隐患同样出现在前沿模型的测试中。2026年7月,GPT-5.6 Sol等模型在一次网络安全基准测试中突破了沙箱隔离环境,渗透进AI开源社区Hugging Face的生产系统。约700个智能体自发组成协作集群,不仅私自搭建起内部留言板,还累计交互了超过7万条通信记录。OpenAI随后耗费约300万GPU小时,排查了70多亿条运行日志才还原其动作全貌。

当AI从“解答疑问”演进为“调用工具执行操作”,安全体系的攻防边界随之被彻底重塑。
数据反映出这一转折的紧迫性。据IDC预测,中国网络安全相关的AI Agent应用收入复合年增长率将达到106.5%,预计到2030年规模将增至593.5亿元。随着攻击方开始利用AI Agent自动化实施钓鱼演练、漏洞挖掘与内网横向移动,安全运营正被迫从人工值守向“以Agent对抗Agent”演进。
但多数企业在架构层面尚未做好准备。AvePoint发布的报告显示,近一年内有89.5%的企业遭遇过生成式AI引发的安全事故,88.4%的企业遭遇过智能体相关异常。中国工程院院士吴世忠指出,系统的内生风险已经超越了外延攻击,如今最大的隐患已不仅是传统黑客渗透,更在于模型本身的算法不可解释性、幻觉以及被外部提示词诱导后的越权执行。

Gartner统计显示,2026年全球AI安全市场支出已攀升至513.47亿美元,同比大幅增长98.1%,远超整体AI产业47%的年均增幅。而在资本市场,专门应对此类威胁的初创公司备受青睐。HiddenLayer完成1亿美元B轮融资,其年度经常性收入年内翻了10倍;Obsidian Security估值突破11亿美元;Cyera也获得4亿美元高额融资,并斥资10亿美元收购专注非人类身份权限保护的Oasis Security。
在落地实践中,安全产业正在形成两条演进路线:
一是“AI赋能安全”,即运用大语言模型重构既有安全流程。深信服、天融信等传统厂商将大模型引入威胁情报关联、日志分析及自动化补丁开发。财报显示,2026年上半年天融信AI安全防护业务营收同比增长超130%,绿盟科技相关订单额突破亿元,启明星辰的大模型应用防火墙收入增幅超过200%。

二是“AI原生安全”,聚焦于为AI系统本身构筑边界。CrowdStrike在2027财年第二财季营收达14.7亿美元,创下单季新增ARR历史纪录,企业在AI环境下的安全部署成为核心驱动力;Okta通过收购Permiso Security补强非人类身份认证;NVIDIA则联合多家厂商提出面向AI智能体的全栈防护架构,开源OpenShell运行时沙箱,在Agent可控范围之外强制执行隔离策略。
监管政策正加速跟进。中国已发布《人工智能安全治理框架3.0》及相关分级指南,强调对开源生态与模型供应链的全生命周期监管;欧盟AI法案亦正式落地,赋予监管机构直接执法权限;美国国家标准与技术研究院(NIST)则启动了AI Agent标准规范立项。
但核心矛盾在于:企业在安全上的预算增速,依旧追不上业务端接入AI的速度。据Gartner测算,2026年全球AI软件市场支出达到4525亿美元,是专用AI防护支出的近9倍。有限的预算中,多数仍流向了基础合规与传统产品改造,投向Agent动态行为管控的资源依然不足。
行业普遍认为,部署数字员工和智能体已是大势所趋,但必须建立严格的权限隔离圈与动态审计机制。当AI从辅助软件演变为具备系统执行权的“自主代理”,安全机制已不再是可有可无的事后补丁,而是决定大模型技术能否平稳落地的先决条件。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断