AI重心正从云端大模型转向物理AI与端侧落地。面对弱网环境、实时性、隐私与成本挑战,纯靠堆算力的时代告终,内存带宽瓶颈与异构计算协同成为芯片厂商的新考题。
过去两年,关于人工智能的讨论近乎全部聚焦于参数规模与算力集群。但随着技术演进,产业重心正快速从“AI能做什么”转向“AI如何落地、由谁承载”。物理AI与端侧AI,正在成为技术落地的新支点。
从数据中心走向产线、车端与消费终端,AI面对的不再是恒温机房与充沛带宽,而是功耗受限、网络不稳定以及严苛的低延迟要求。
![]()
终端设备的智能化正在加速渗透。IDC数据显示,中国具身智能机器人市场规模预计将从2025年的14亿美元跃升至2030年的770亿美元,年均复合增长率达94%。在更广阔的消费端,AI PC的渗透率预计在2026年突破55%。
与基于网络文本训练的数字AI不同,物理世界的环境极为动态且离散。英特尔相关负责人指出,数字AI存在相对固定的数据获取路径,而物理世界千变万化,行业场景和任务差异极大。以具身智能为例,在特定工况下训练成熟的机器人,迁移到新环境常常失效;Figure AI的研究显示,尽管通过架构优化能将新场景迁移成功率提升至56%,但距离规模化量产部署仍有差距。
在真实商业场景中,离线可用性更是刚需。例如汽车进入弱网山区,云端语音与路径规划若出现卡顿,将直接影响行车安全。此外,虽然云端大模型的Token调用单价持续走低,但复杂任务所需的上下文窗口(Context window)呈指数级扩张,导致企业整体推理成本居高不下。本地部署不仅能削减开销,还能保障未成年人教育、企业核心数据等敏感信息的隐私安全。
端侧与边缘工作负载的复杂化,直接倒逼芯片架构发生变革:
1. 内存带宽与数据搬运损耗
AI推理的真实瓶颈往往不在峰值算力,而在数据搬运。当GPU、NPU和DSP等不同单元集成在SoC中时,各计算模块若频繁与外部内存交换数据,不仅功耗激增,还会引发严重的延迟。业界开始尝试通过让AI直接嵌入图形管线的方式,消除不必要的数据倒腾,在超分辨率渲染等任务中直接削减一半以上的内存带宽占用。
2. 预填充与解码阶段的算力失衡
在本地大模型推理中,预填充(Prefill)阶段要求芯片在极短时间内吞吐大量上下文,核心指标是首字延迟(TTFT);而在解码(Decode)阶段,系统性能严重依赖内存带宽。若系统带宽受限,盲目堆砌TOPS算力并不能解决卡顿问题。
3. 场景匹配与异构协同
终端设备不再追求极致大算力,而是强调“算力适度”。部分边缘场景仅需30-50 TOPS的算力即可满足小模型推理,无需配置高规格芯片。同时,工业与边缘场景要求7×24小时稳定运行、低功耗及抗电磁干扰。随着AI智能体(Agent)的普及,编排调度高度依赖通用CPU,专用视觉任务依靠NPU,复杂矩阵推理则交付GPU,算力负载呈现高度分层。
应对这种分层趋势,异构计算架构(XPU)正在成为主流策略——通过统一的软件框架,协同调度CPU、GPU与NPU等不同计算单元,兼顾能效比与部署成本。
如果说数字AI上半场比拼的是谁的模型更大,那么进入物理AI与端侧推理阶段,产业比拼的核心已经转向谁能以更低的成本、更稳健的架构,将算力扎实地嵌入现实场景之中。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断