前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.26 · 15:12/5 MIN/编译自 听雨/1 阅读

TPU推理Kimi反超英伟达57%:vLLM原班团队用megakernel榨干硬件

推理初创公司Inferact通过手写megakernel与结合DeepSeek的DSpark推测解码框架,让16块谷歌TPU v7运行Kimi K3的速度达到每秒709 Token,比英伟达GB200快57%,相关代码已全面开源。

在同等规模的硬件对抗中,谷歌 TPU 跑出了超越英伟达顶级 GPU 的成绩。

推理初创公司 Inferact 近期公布了一组基准测试数据:使用 16 块谷歌 TPU v7 运行 Kimi K3 模型,输出吞吐量达到每秒 709 个 Token,相比同规格的 16 块英伟达 GB200(每秒 452 Token)提升了 57%。

Inferact 测试表现

做出这一突破的 Inferact 团队由知名开源推理引擎 vLLM 的原班核心人马创立。他们为 TPU 专门设计了名为 megakernel 的底层方案,把模型推理时原本需要调度的数百个小程序整合成一个大程序,将片上内存与带宽利用率推向理论极限。

目前,这套优化内核代码已在 GitHub 上开源。

硬件规格逆转:带宽更低,速度反而更快 57%

测试由 16 块 TPU v7 Ironwood 与 16 块英伟达 GB200 正面对决,双方均运行 Kimi K3,使用 vLLM 推理引擎,唯一的变量是芯片与底层 Kernel 实现。

测试对比数据

709 Token/s 的高吞吐部分得益于 DeepSeek 提出的 DSpark 推测解码框架。该方案由小模型先快速生成候选 Token 序列,再由大模型批量验证。在 TPU 上,该流程的平均接受长度达到 6,单步解码耗时仅约 8.5 毫秒。

即便关闭推测解码,TPU 的原生裸速依然优势明显:

  • Batch Size = 1 时,TPU 每秒输出 249 Token,GB200 为 127 Token,性能接近翻倍;
  • Batch Size = 8 时,TPU 达到 865 Token/s,GB200 为 636 Token/s;
  • 在 Qwen 3.8 27B 的测试中,4 块 TPU v7 跑出了 1515 Token/s,而 4 块 GB200 仅为 695 Token/s。

不同 Batch Size 下的表现

加速并未牺牲模型精度。经测试,Kimi K3 在 TPU 上的 GPQA-Diamond 得分为 94.4%,GSM8K 为 97.2%,与 GPU 上的评测结果完全一致。

两款芯片硬件规格对比

从硬件参数来看,这一结果十分反直觉:TPU v7 的 HBM 带宽为 7380 GB/s,低于 GB200 的 8000 GB/s。显存带宽更低的硬件实现了更高的性能,关键变量在于上层的算子调度逻辑。

megakernel:把几百个独立算子焊成一个程序

大模型推理的核心性能瓶颈并非算力,而是数据搬运。每生成一个 Token,模型的全部权重都需要从 HBM 主存搬运到芯片内部的高速片上缓存,处理完成后再进行下一轮读取。

传统推理模式下的带宽空转

传统方式将推理流程拆解为数百个独立的 Kernel,排队依次执行。前一个 Kernel 结束到下一个 Kernel 启动之间存在调用间隙,导致显存带宽短时间空转。即使通过 CUDA Graphs 等机制缩小间隙,Kernel 之间的逻辑边界依然存在。

megakernel 调度架构

Inferact 的 megakernel 直接打破了这层边界。以 Kimi K3 为例,其包含 92 层 MoE 计算,Inferact 将整整 92 层的计算逻辑全部封装进单个 Pallas 程序中,单次调用即可走完整个前向传播。

92层计算合为一个整体

边界消除后,跨层权重预取(Prefetching)得以顺畅实现:当芯片还在计算第 N 层的 MoE 时,第 层的 Attention 权重就已经开始向片上缓存搬运。计算与数据传输全面重叠,几乎消除了带宽空转。

计算与数据搬运并行流水线

TPU 的硬件架构为这种编排提供了天然支撑:

  1. 显式内存控制:TPU v7 的每个 TensorCore 配备 64 MiB VMEM 片上内存,其生命周期完全由软件接管,工程师可以精准掌控数据加载与释放时机;相比之下,英伟达 Blackwell 架构的片上内存分散在 152 个 SM 内(总计约 38 MiB),主要由硬件自动调度,精细化流水线控制门槛更高。
  2. 绕过 XLA 自动编译:Inferact 采用谷歌底层的 Pallas 语言手写了全部算子逻辑。XLA 擅长单层自动优化,但面对跨 92 层的全局调度难以找到最优策略。手写 megakernel 不仅突破了调度瓶颈,还将编译耗时从 30 分钟以上压缩至不到 90 秒,极大提升了调试与工程迭代效率。
标签:TPUNVIDIADeepSeek

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算
置顶

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

TPU 与 GPU 片上架构差异

vLLM 核心团队创业,推动 TPU 成为第一梯队支持

Inferact 成立于去年 11 月,核心成员均为 vLLM 的核心开发者。团队于今年 1 月全职投入创业,首轮即获得由 a16z 与 Lightspeed 领投、真格与红杉等跟投的 1.5 亿美元融资,公司估值达到 8 亿美元。

  • CEO Simon Mo:vLLM 早期核心维护者,毕业于加州大学伯克利分校 EECS,曾供职于分布式计算平台 Anyscale。
  • 联合创始人 Woosuk Kwon:vLLM 发起人,加州大学伯克利分校博士,PagedAttention 显存优化算法的提出者。
  • 首席科学家游凯超:清华大学特等奖学金获得者,在 vLLM 中主导了分布式推理架构的落地。

此次 TPU megakernel 的工程突破源于 Inferact 与 Google Cloud 的联合研发项目。双方的目标是让谷歌 TPU 成为 vLLM 生态中的顶级支持后端,开源的 tpu-megakernels 代码库正是这一合作的首期成果。团队后续还将把该内核优化拓展至更多主流模型架构。

Transformers 直接跑 GGUF:Python 追平 llama.cpp
置顶

Transformers 直接跑 GGUF:Python 追平 llama.cpp

//

24小时热榜

Anthropic旗下Claude自主发现类CRISPR新酶系统
TOP1

Anthropic旗下Claude自主发现类CRISPR新酶系统

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解
TOP2

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解

3

OpenAI Academy 升级,新增开发者与企业管理学习路径

8小时前
OpenAI Academy 升级,新增开发者与企业管理学习路径
4

OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%

8小时前
OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%
5

Airbnb深化与OpenAI合作,全面接入GPT-6 Astra加速开发

8小时前
Airbnb深化与OpenAI合作,全面接入GPT-6 Astra加速开发
6

ChatGPT广告业务拓展至东南亚及台湾地区

8小时前
ChatGPT广告业务拓展至东南亚及台湾地区
7

奥特曼联合国演讲:警惕AI失控,呼吁建立全球监管标准

8小时前
奥特曼联合国演讲:警惕AI失控,呼吁建立全球监管标准
8

OpenAI Academy 成立两周年:覆盖400万人,推社区培训师计划

8小时前
OpenAI Academy 成立两周年:覆盖400万人,推社区培训师计划
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断