Agent长上下文让大模型KV Cache急剧膨胀,挤占显存并拖慢首字响应。英特尔提出由CPU内存分层卸载并借助QAT硬件压缩,不仅降低最高30%存储占用,更实现首字延迟数倍优化。
在编程智能体(Coding Agent)等场景中,AI 需要跨文件读写代码、运行测试和反复纠错。随着交互轮数增加,系统积压的历史信息呈爆炸式增长。
面对高并发需求,数据中心常陷入两难:服务器虽然跑满,但显存告急,首字生成延迟(TTFT)越来越长。难道只能无止境地追加 GPU?

问题的核心并不在算力本身,而在模型的“记忆”——KV Cache。
基于因果自注意力的 Transformer 架构在生成每一个新 Token 时,都需要回溯前文信息。系统为了避免每次从头计算,会将注意力层产生的 Key 和 Value 缓存起来,形成 KV Cache。
这份“计算笔记”能大幅减少重复计算,但体积相当惊人。以 Qwen3-8B 为例,在 BF16 精度下,仅单个 Token 对应的 KV Cache 约占用 147KB(计算式为:2份K/V × 36层 × 8个KV头 × 128维 × 2字节)。如果面对 100 万 Token 的超长上下文假设,单次会话的 KV 数据便高达 147GB。

当大量并发涌入,有限的 GPU 显存(HBM)无法承载如此海量的数据。系统若直接清理过期缓存,当 Agent 下一轮需要调用历史信息时,就必须重新执行耗时的 Prefill 阶段。这种重复计算不仅拖慢首字延迟,也白白挤占了 GPU 生成新 Token 的宝贵算力。
长上下文推理的瓶颈,已从单纯的算力竞争转变为存储与搬运的成本博弈。
破解显存焦虑的核心逻辑在于“以存代算”:将暂不活跃但后续可能复用的 KV Cache 搬出昂贵的 HBM,放置在更便宜、容量更大的存储介质中。
在现代服务器架构中,存储层级清晰存在:

然而,单纯分层并不够。跨层搬运数据需要总线带宽,如果“取回缓存”的时间比“重新计算”还要长,系统性能便会反向劣化。最直观的解法是对数据进行压缩,减少搬运字节数。
但通用 CPU 核心若全力承担复杂的压缩与解压任务,极易挤占系统调度资源,成为吞吐吞吐链条上的新瓶颈。这正是专用硬件加速介入的关键节点。
围绕 KV Cache 的生命周期管理,英特尔规划了四项核心技术布局:

其中,KV Shrink 已经完成落地测试。该技术通过分层管理 API 控制冷热调度,并结合第四代及以上至强可扩展处理器内置的 QAT(QuickAssist Technology) 硬件加速单元,将压缩解压任务从通用 CPU 核心完全卸载。
为了提高压缩效率,方案对 KV Cache 的内存排布格式进行了重新优化,在保持无损精度的前提下,让压缩算法能多削减 20% 至 30% 的存储空间。
实际性能测试验证了这种软硬协同的效果:

除了针对单会话压缩的 KV Shrink,英特尔的技术版图还包括跨文档重叠缓存融合(KV Fuse)、小模型筛选引导的串联推理(KV Cascade),以及长会话按需预取扩展(KV Infinity)。
大模型推理从“一问一答”转向“长程执行”已成定局。在这场演进中,系统设计的权衡越来越偏向全局成本。
让单价昂贵的 GPU 全力聚焦于计算与新 Token 生成,让 CPU、系统内存与专用加速单元负责打理繁琐的“记忆维护”。通过算力与存储的分工协同,数据中心不仅能缓解显存墙困扰,也为真正规模化的 Agent 商业部署提供了一条具备可行性的降本路径。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断