前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/08.30 · 08:01/5 MIN/编译自 Malynnda Stewart, PhD, BCPA/0 阅读

你的第二块GPU,买的是缓存不是模型

很多团队加GPU时只盯算力,忽略了推理时KV cache对显存的吞噬。第二块GPU往往不是为模型买的,而是为缓存买的。理解这个逻辑,才能避免盲目堆卡,让GPU预算花在刀刃上,尤其是在长上下文场景。

你的第二块GPU,买的是缓存不是模型

很多团队在规划 GPU 集群时,习惯按“算力”做预算。第一块 GPU 用来把模型跑起来,第二块 GPU……大多数人以为是为了更大的模型或更高的吞吐。实际未必。多出来的那块 GPU,往往是被缓存吃掉的。

加 GPU 的三个理由

加 GPU 通常有三种意图:

  1. 训练更大的模型:需要更多的 FLOPs,这是算力需求。
  2. 支撑更多并发请求:需要更大的吞吐,这是带宽和调度需求。
  3. 扩展上下文窗口:需要更多的 KV cache,这是显存容量需求。

前两种都很直观,第三种最容易被忽视。当你把对话上下文从 2K 拉到 32K,KV cache 的显存占用会成倍增长,甚至超过模型参数本身。这时候,你加的第二块 GPU,实际上是在为缓存买单。

KV cache 为什么会吃显存

推理时,模型需要为每个 token 维护一组 Key 和 Value 向量,用来计算注意力。序列越长,KV cache 越大。对于一个 7B 参数的模型,如果上下文达到 128K,KV cache 可能占据几十 GB 显存。相比之下,模型权重可能才 14GB。也就是说,缓存才是显存的真正大户。

更麻烦的是,KV cache 无法像模型权重那样做量化压缩?其实也可以,但压缩后精度下降,很多场景不敢用。于是只能靠加卡。

怎么判断该不该加卡

不要只看模型参数大小。算一下峰值显存 = 模型权重 + 激活值 + KV cache。如果 KV cache 占比超过一半,那加卡的主要收益是缓存容量,而不是算力。

用国内的场景来说,爱奇艺的推荐系统、美团的外卖调度,如果要用大模型做实时推理,上下文一拉长,第一块 GPU 立刻捉襟见肘。第二块 GPU 的加入,往往让推理延迟不降反升——因为跨卡通信又成了瓶颈。这时候你要考虑的是换大显存卡,比如 A800 80G 到 H200 141G,而不是简单堆数量。

决策建议

  • 先分析推理负载的序列长度分布
  • 用 profiler 统计 KV cache 峰值
  • 再决定是加整卡、加显存,还是优化缓存策略(如 PagedAttention)

总之,GPU 预算不能只按模型参数量来定。第二块 GPU 很可能不是为模型买的,而是为缓存买的。想清楚这一点,能省不少钱。

标签:大模型显存基础设施

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
置顶

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent
置顶

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
Open ASR 首次收录印地语:Monsoon 给中文语料的三条硬提示
置顶

Open ASR 首次收录印地语:Monsoon 给中文语料的三条硬提示

//

24小时热榜

AI时代,作品集证明不了什么
TOP1

AI时代,作品集证明不了什么

多数人低估了AI加速学习的能力
TOP2

多数人低估了AI加速学习的能力

3

Claude 17分钟破解20年旧系统,还抓出一个Bug

1小时前
Claude 17分钟破解20年旧系统,还抓出一个Bug
4

AI+3个免费工具,30天赚900美元的实操记录

1小时前
AI+3个免费工具,30天赚900美元的实操记录
5

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

1小时前
索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
6

AI双刃剑:创造与毁灭同行的未来

1小时前
AI双刃剑:创造与毁灭同行的未来
7

测遍Claude Code技能,这4个最值钱

1小时前
8

硅统治芯片60年后,接班人只有三原子厚

1小时前
硅统治芯片60年后,接班人只有三原子厚
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断