英特尔 8 月发布白皮书,提出用「每机柜交付 Agent 数」取代理论参数衡量数据中心,称一轮 Agent 任务约六成时间在主机端;所有数据均为英特尔自己给出。
英特尔 8 月发布白皮书《How Many Agents Will Your Rack Actually Run》,并在同月 20 日的一篇署名文章里提出:衡量数据中心,应该看「每机柜交付的 Agent 数」,而不是核心数、带宽这类理论参数。InfoQ 中文站近日对其做了详细解读。
英特尔对它的定义是:在规定的吞吐、质量和延迟要求下,一个机柜能可靠完成多少 Agent 工作流,且处于既定的功耗和成本范围内。公式为:
每机柜交付 Agent 数 = 理论每机柜 Agent 数 × 调度有效性 × 资源平衡度 × 计算卸载效益
英特尔表示,将在给定 p99 延迟目标下、用真实的 Agent 轨迹报告这一数字。
InfoQ 转述的白皮书拆解是:一轮 Agent 任务里,模型调用约占 40%、主要跑在 GPU 上;其余 60% 在主机端,其中工具执行 35%、数据服务 10%、状态搬运约 8%、编排调度 7%。
英特尔的文章给出了并发带来的变化:主机 CPU 侧处理占单个请求总延迟不到 1%,到 32 个并发请求时升至最高 15%;GPU 真正干活的时间只占 50% 到 60%。InfoQ 还援引一项对 739 次匿名化 Claude Code 对话的测量:主机 CPU 耗时占端到端延迟的比例,单请求时为 0.4%~0.6%,32 并发时升至 11%~15%,其中约 94% 的增长来自调度和排队。
白皮书还给出两组示例:理论容量高 33% 的机柜,计入三个系数后实际交付反而落后 23%;在同一 p99 目标下,自适应运行时优化把「膝点」从 235 个并发 Agent 推到 300 个,提升 28%。
英特尔自家的方案包括 Xeon 6 的 Flat Memory 模式(把 CXL 扩展内存与 DDR5 合成一个地址空间),其文章称可达到全 DDR5 性能的 96%、内存总拥有成本约低 25%,以及用硬件加速引擎卸载压缩、数据搬运等任务。
这些数字全部来自英特尔。InfoQ 的文章以这套论点为主线,并在结尾预告英特尔 9 月 22 日至 23 日在苏州举办的 Intel Connection 大会。按 InfoQ 的描述,AMD 以整机柜功率为锚点、英伟达强调单核速度,几家的衡量口径并不相同;目前公开的数字均出自英特尔自己的测算。
英特尔说要用真实 Agent 轨迹公布交付量,这一数字何时出、其他厂商是否接受这把尺子,是观察点。InfoQ 写到,买家开始追问的是:在多少并发下测的、目标延迟是多少、排队损耗算进去了没有。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断