随着AI智能体从简单对话演变到全天候跨应用调度与工具调用,计算负载发生系统性转变。Arm正从基础IP授权向完整计算子系统转型,全力押注CPU在复杂流程中的调度价值,并预测未来CPU与GPU配比将趋近1:1。
过去两年,生成式AI的聚光灯几乎全被GPU和NPU占据。但在AI智能体(Agent)加速落地的趋势下,CPU正重新被推回算力舞台的中心。
在近日举行的 Arm Everywhere China 年度大会上,Arm 集中公布了涵盖终端、数据中心以及物理AI的最新布局,包括面向移动设备的第二代计算子系统 CSS for Mobile 2、面向数据中心的 Neoverse CSS N4,以及可直接部署的 AGI CPU 平台。这些看似分散的产品线,指向同一个战略判断:AI 不会永远停留在“一问一答”的文本框交互阶段。
当AI开始像人类一样自主规划、访问数据库、调用外部工具并在多应用间频繁切换时,底层的计算范式随之重构。虽然高强度的模型推理依然依赖GPU和NPU,但庞杂的状态控制、逻辑调度和通用数据流转,必须由CPU统揽全局。Arm 首席营销官 Ami Badani 指出:“未来 GPU 与 CPU 的配比将逐步接近,甚至有可能趋近 1:1。”

以智能手机为代表的端侧场景,对功耗、散热及内存带宽极度敏感。在运行端侧大语言模型时,系统不可能把所有处理环节一股脑推给NPU。此时,CPU需要维系长上下文状态并高效分派任务,GPU则要兼顾高动态图形渲染与并行计算。终端厂商比拼的维度,已从“单一芯片算力跑分”升级为“受限电量下的全系统协同能效”。
Arm 给出的答案是预整合解决方案 CSS for Mobile 2。该方案将 C2 CPU 集群、Mali G2-Ultra NX GPU、系统互联 IP、物理实现方案及软件开发工具预先打包。对芯片厂商而言,这大幅削减了底层验证与调优周期;对 Arm 而言,则把原本分散售卖的单点 IP 升级为了高附加值的系统级产品。
性能数据显示,小语言模型在 C2 CPU 集群上的运行速率最高可提升 70%;C2-Ultra 的 AI 性能较上代提升 1.7 倍,单线程性能提升 15%,同等性能下功耗降低最高达 38%。在GPU端,Mali G2-Ultra NX 引入了专用神经网络加速单元,可在图形管线中实时执行超分辨率采样、插帧与降噪,神经网络场景下的每瓦性能最高提升 4 倍。
在数据中心端,计算模式同样发生了质变。Arm 云 AI 业务拓展副总裁 Eddie Ramirez 表示:“AI智能体是 7×24 小时不间断运行的,工作负载不再呈现偶发性和突发性。”这促使云服务商将评估重心转向单线程性能的可预测性,以及SLA服务等级的稳定兑现。
针对不同客户的研发路径,Arm 采取了分层打法:
从单项 IP 授权,到计算子系统(CSS),再到成品级 AGI CPU 平台,Arm 正在实质性地“将产品越做越重”。
这种演进路径的商业收益相当可观:客户能够显著缩短产品上市周期,Arm 也有望摆脱单薄的版税分成,大幅推高单客价值。援引 IDC 统计,在加速计算领域,采用 Arm 架构的机架级服务器规模已正式超越传统 x86 方案。依托全球超过 3500 亿颗的芯片出货量与 2200 万开发者生态,Arm 正在将能效与软件一致性转化为极宽的护城河。
不仅如此,Arm 还在将这一平台策略复制至物理 AI(Physical AI)领域。面对涉及环境感知、多传感器融合、实时控制与高安全冗余的机器人与自动驾驶场景,Arm 将 Total Design 生态联盟延伸至该赛道,已吸引包括 AWS、Hugging Face、NXP、QNX、通义千问和西门子在内的逾 80 家产业伙伴加入,并牵头制定统一的机器人系统能力分级标准。
然而,这步棋也带来了不可忽视的平衡挑战。随着 Arm 向芯片系统设计纵深切入,其不可避免地会挤压芯片设计企业原本的客制化空间。如何在推进交钥匙工程以获取更大商业回报的同时,继续维持一个中立、开放的生态基石形象,将是 Arm 在AI智能体时代必须解答的核心命题。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断