随着AI智能体从对话迈向实际行动,算力需求由纯算力堆叠转向低延迟与高能效。Arm展示了AGI CPU生态进展并发布Neoverse CSS N4,通过300瓦低功耗与统一软硬件平台,构筑AI基石。
当模型不再停留在被动问答,而是开始具备调用工具并执行复杂任务的行动力,底层算力的需求结构正在被彻底重塑。AI 智能体在运行中需要频繁交互与等待结果,系统对响应延迟极其敏感,单纯堆算力的粗放模式已不再具备经济性。
面对这一范式转移,Arm 给出了清晰的技术回应:在 Arm Everywhere China 大会上展示了 Arm AGI CPU 的中国生态进展,并发布了 Neoverse CSS N4,加速推动底层硬件向适应 AI 智能体交互的方向演进。

今年 3 月,Arm 正式推出首款冠以“AGI”之名的自研处理器 Arm AGI CPU,配备 136 个 Arm Neoverse V3 核心、96 条 PCIe Gen6 通道与 12 通道 DDR5 内存。
在数据中心场景中,最核心的考量始终是能效。Arm 云 AI 业务拓展副总裁 Eddie Ramirez 表示,在同等性能下,传统 x86 方案的 TDP 通常为 500 瓦,而 AGI CPU 仅需 300 瓦。

这 200 瓦的功耗差距击中了当下数据中心最稀缺的资源痛点——电力供应与机架空间。平摊到机架级别,同等功耗限制下可部署的计算核心数几乎翻倍。IDC 报告显示,基于 Arm 架构的机架级服务器市场规模已超越 x86,成为加速计算领域的主流平台。
对于自研芯片是否会与采购 Arm IP 的客户产生冲突,Arm 表示推出 AGI CPU 旨在填补私有云与本地部署的断层。例如 SAP 这类客户,云端采用基于 Arm 架构的 Graviton 实例,本地却运行另一套架构。Arm AGI CPU 提供了云端到本地一致的计算体验,是对既有市场的延伸而非内耗。
新发布的 Neoverse CSS N4 展现了 Arm 从单一算力指标向系统级升级的转型。作为 Arm 迄今可配置度最高的 CSS 平台,其单裸片支持 8 核至 128 核配置,最高频率达 3.8GHz。
比起堆叠核心数,CSS N4 的核心突破在于解决数据搬运效率:
从商业模式上看,Arm 形成了多层级供给:头部大厂如 AWS(Graviton)和微软(Cobalt)可自研芯片并采购 IP 或 CSS;而需要量产就绪算力的企业,则能直接部署商用 AGI CPU。两者共享完全一致的工具链。
在开发者生态层面,Arm 宣布上线 Arm AI Portal,为开发者提供发现、优化与部署 AI 软件的统一入口。

平台支持语言、语音、视觉等工作负载,首批预优化模型涵盖阿里巴巴通义千问、Google Gemma 和 Ultralytics YOLO,适配 ExecuTorch、LiteRT 及 ONNX-RT 框架。

值得关注的是,Arm 优化后的模型可通过 Hugging Face 直接获取,Portal 的底层资源则通过模型上下文协议(MCP)向编程智能体开放。这意味着未来的 AI 智能体可以自主发现、调用底层的优化算力与代码,无需人类开发者重复配置。
在性能实测中,得益于第二代可伸缩矩阵扩展(SME2)加速,Qwen3-TTS 语音模型在移动设备上实现了超 4 倍的速度提升;YOLO26 在采用混合量化方案后,相较 FP32 基准性能提升超过 40%。
从突破能效极限的 AGI CPU,到疏通数据总线的 CSS N4,再到用 MCP 连接人机协同的软件门户,Arm 正在为智能体经济构建一套兼顾能耗、系统吞吐与自动化开发的基础底座。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断