前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.16 · 00:00/5 MIN/编译自 十三/2 阅读

把大模型记忆交给CPU:分层卸载破解显存瓶颈

Agent长上下文让大模型KV Cache急剧膨胀,挤占显存并拖慢首字响应。英特尔提出由CPU内存分层卸载并借助QAT硬件压缩,不仅降低最高30%存储占用,更实现首字延迟数倍优化。

在编程智能体(Coding Agent)等场景中,AI 需要跨文件读写代码、运行测试和反复纠错。随着交互轮数增加,系统积压的历史信息呈爆炸式增长。

面对高并发需求,数据中心常陷入两难:服务器虽然跑满,但显存告急,首字生成延迟(TTFT)越来越长。难道只能无止境地追加 GPU?

大模型与智能体推理算力调度

问题的核心并不在算力本身,而在模型的“记忆”——KV Cache。

为什么大模型的“记忆”越来越贵?

基于因果自注意力的 Transformer 架构在生成每一个新 Token 时,都需要回溯前文信息。系统为了避免每次从头计算,会将注意力层产生的 Key 和 Value 缓存起来,形成 KV Cache。

这份“计算笔记”能大幅减少重复计算,但体积相当惊人。以 Qwen3-8B 为例,在 BF16 精度下,仅单个 Token 对应的 KV Cache 约占用 147KB(计算式为:2份K/V × 36层 × 8个KV头 × 128维 × 2字节)。如果面对 100 万 Token 的超长上下文假设,单次会话的 KV 数据便高达 147GB。

KV Cache 在长上下文中的膨胀示意

当大量并发涌入,有限的 GPU 显存(HBM)无法承载如此海量的数据。系统若直接清理过期缓存,当 Agent 下一轮需要调用历史信息时,就必须重新执行耗时的 Prefill 阶段。这种重复计算不仅拖慢首字延迟,也白白挤占了 GPU 生成新 Token 的宝贵算力。

长上下文推理的瓶颈,已从单纯的算力竞争转变为存储与搬运的成本博弈。

以存代算:让 CPU 接管缓存

破解显存焦虑的核心逻辑在于“以存代算”:将暂不活跃但后续可能复用的 KV Cache 搬出昂贵的 HBM,放置在更便宜、容量更大的存储介质中。

在现代服务器架构中,存储层级清晰存在:

  1. GPU 显存(HBM):存放当前正在推理的高频数据;
  2. CPU 侧 DDR 内存:容纳近期活跃的会话缓存;
  3. 本地 SSD 及远端存储:作为冷数据层,归档长周期未访问的历史记录。

英特尔数据中心分层存储方案

然而,单纯分层并不够。跨层搬运数据需要总线带宽,如果“取回缓存”的时间比“重新计算”还要长,系统性能便会反向劣化。最直观的解法是对数据进行压缩,减少搬运字节数。

但通用 CPU 核心若全力承担复杂的压缩与解压任务,极易挤占系统调度资源,成为吞吐吞吐链条上的新瓶颈。这正是专用硬件加速介入的关键节点。

硬件压缩加持:英特尔的 KV 优化方案

围绕 KV Cache 的生命周期管理,英特尔规划了四项核心技术布局:

英特尔四大 KV 优化技术矩阵

其中,KV Shrink 已经完成落地测试。该技术通过分层管理 API 控制冷热调度,并结合第四代及以上至强可扩展处理器内置的 QAT(QuickAssist Technology) 硬件加速单元,将压缩解压任务从通用 CPU 核心完全卸载。

为了提高压缩效率,方案对 KV Cache 的内存排布格式进行了重新优化,在保持无损精度的前提下,让压缩算法能多削减 20% 至 30% 的存储空间。

实际性能测试验证了这种软硬协同的效果:

  • 吞吐与延迟优化:在双路至强金牌 6554S、两张 NVIDIA L20 与 Qwen3-32B 模型的配置下(80% 缓存命中率),相比原生 vLLM 无分层卸载基线,KV Shrink 的首字延迟(TTFT)最高实现了约 5 倍的提速。
  • 硬件压缩开销控制:QAT 硬件压缩的综合性能达到纯 CPU 软件方案的 2 倍。在全流程中,启用 QAT 带来的额外 TTFT 开销被压缩至 10% 以内。
  • 集群环境实测:英特尔与道客联合实验室在 8 张 H800 环境下测试 Qwen3-32B FP8,相较于业内知名的 LMCache 方案,单路并发下的平均 TTFT 从 129.81 毫秒缩短至 114.13 毫秒,降低约 12.1%。

道客联合实验室测试结果对比

除了针对单会话压缩的 KV Shrink,英特尔的技术版图还包括跨文档重叠缓存融合(KV Fuse)、小模型筛选引导的串联推理(KV Cascade),以及长会话按需预取扩展(KV Infinity)。

算力分工的重塑

大模型推理从“一问一答”转向“长程执行”已成定局。在这场演进中,系统设计的权衡越来越偏向全局成本。

让单价昂贵的 GPU 全力聚焦于计算与新 Token 生成,让 CPU、系统内存与专用加速单元负责打理繁琐的“记忆维护”。通过算力与存储的分工协同,数据中心不仅能缓解显存墙困扰,也为真正规模化的 Agent 商业部署提供了一条具备可行性的降本路径。

标签:推理优化英特尔GPU大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
置顶

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

//

24小时热榜

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
TOP1

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者
TOP2

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者

3

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

20小时前
12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
4

别等想清楚再动手:用AI拆解庞大任务的“最小第一步”

20小时前
别等想清楚再动手:用AI拆解庞大任务的“最小第一步”
5

AI竞争的终局不是做大模型,而是争夺基建与权力

20小时前
AI竞争的终局不是做大模型,而是争夺基建与权力
6

AI在狂飙,但人类习惯走得很慢

20小时前
AI在狂飙,但人类习惯走得很慢
7

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

20小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
8

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

20小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断