当AI应用从单纯的大模型对话走向自主执行任务的智能体,底层算力需求发生结构性转变。硬件投资正从极度依赖GPU与HBM,向通用CPU、DRAM、企业级SSD及先进载板全面扩散。
从豆包、DeepSeek到ChatGPT,AI应用已迅速渗透进日常办公、搜索、编程和内容生产中。然而,当一款AI应用在短时间内涌入数千万甚至上亿活跃用户时,屏幕背后的算力基础设施正在经历一场深刻的重构。
根据行业研究机构TrendForce的数据,全球头部云服务商(包括Google、Amazon、Meta、Microsoft、Oracle,以及字节跳动、腾讯、阿里巴巴和百度)在2026年的资本支出合计将突破8800亿美元;全球AI服务器出货量预计增长接近31%。
这笔庞大资本开支的流向,正在发生关键位移:硬件采购红利正从单纯的大模型训练阶段,向支撑AI智能体(Agent)常态化运行的系统级硬件全面扩散。
在大模型爆发的初期,硬件需求传导逻辑清晰而聚焦。大语言模型的训练依赖极其庞大的矩阵并行计算,GPU凭借出色的并行计算架构成为绝对核心。
随着模型参数量激增,硬件扩容迅速形成连锁反应:
在这一阶段,算力军备竞赛基本围绕GPU集群展开。
随着AI产品形态由聊天机器人转向具备自主规划能力的AI智能体(Agent),底层系统的任务负荷随之改变。
传统的交互模式相对简单:用户输入提示词(Prompt),模型完成单次推理,返回文本答案。
Agent则需要自主完成长链条动作。以整理邮件、检索行程或分析跨组织文档为例,Agent必须先分解任务意图,规划调用步骤,随后频繁拉起浏览器、访问数据库、执行沙盒代码、读取上下文文件,并根据执行结果动态决定下一步。例如Meta推出的Muse应用,上线12天下载量即突破280万次。为了保证任务能够跨应用在后台持续运行,Meta为其配备了隔离的安全虚拟机(Secure VM)运行环境。
这种架构意味着,Agent不仅需要GPU提供模型推理算力,还需要消耗大量通用算力来调度工具和维系运行环境。
如果将GPU比作战场上的重装火力,CPU则是负责通讯、指挥和后勤调度的枢纽。TrendForce研究指出,在传统以大模型训练为主的数据中心,CPU与GPU的配比通常在1:4至1:8之间;但在面向复杂推理与多Agent协作的部署架构中,该配比有望向1:1至1:2靠拢。英特尔管理层此前也做出过相似研判:推理与多智能体工作负载的提升,正显著拉动通用计算在AI服务器中的价值占比。
通用计算重要性的抬升,正迅速沿着服务器主板向周边元器件扩散。
1. 服务器内存(DRAM)
Agent在处理复杂任务编排、多工具并发调用以及数据预处理时,极度依赖通用计算内存。CPU算力配置密度的提升,同步拉动了服务器DRAM的容量和带宽规格。
2. 企业级SSD
AI推理上下文窗口的持续拉长带来了庞大的KV Cache(键值缓存)。在DRAM成本居高不下的背景下,一部分非实时热数据必须分层下沉至高性能企业级SSD。加之Agent执行任务涉及持续的日志保存、文件读写和数据库更新,存储端迎来了强劲支撑。今年一季度,全球前五大企业级SSD厂商收入达184.6亿美元,环比激增86.1%,供需紧张态势明显。
3. 高端IC载板
高性能服务器CPU在封装时普遍采用高端ABF载板,以便将芯片内部极密集的线路桥接到主板PCB上。伴随服务器通用算力单元的升级,ABF载板在GPU、ASIC和高性能计算(HPC)原有的紧张产能之外,又迎来了一股来自CPU端的结构性新增需求。
英国经济学家杰文斯曾提出著名的“杰文斯悖论”:蒸汽机燃料效率的提升非但没有减少煤炭消耗,反而因大幅降低了动力成本,刺激蒸汽机在工业生产中被更广泛地普及,最终导致煤炭总消耗量急剧上升。
当下AI算力基础设施正在经历完全一致的技术演进。随着模型蒸馏技术和硬件执行效率的提高,单次推理任务的资源消耗正在下降。但由于成本大幅降低,原本受限于经济性的长程多Agent任务被大规模激活。
未来的计算形态,将从过去“几亿人每天向聊天机器人发起十余次询问”,演变成“几亿人指派数十个Agent在后台连续数小时自主工作”。单次成本下降,换来的是任务时长与交互频次的指数级放大。服务器采购清单的变迁,正真实映射着这场AI落地浪潮的技术转移。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断