推理初创公司Inferact通过手写megakernel与结合DeepSeek的DSpark推测解码框架,让16块谷歌TPU v7运行Kimi K3的速度达到每秒709 Token,比英伟达GB200快57%,相关代码已全面开源。
在同等规模的硬件对抗中,谷歌 TPU 跑出了超越英伟达顶级 GPU 的成绩。
推理初创公司 Inferact 近期公布了一组基准测试数据:使用 16 块谷歌 TPU v7 运行 Kimi K3 模型,输出吞吐量达到每秒 709 个 Token,相比同规格的 16 块英伟达 GB200(每秒 452 Token)提升了 57%。

做出这一突破的 Inferact 团队由知名开源推理引擎 vLLM 的原班核心人马创立。他们为 TPU 专门设计了名为 megakernel 的底层方案,把模型推理时原本需要调度的数百个小程序整合成一个大程序,将片上内存与带宽利用率推向理论极限。
目前,这套优化内核代码已在 GitHub 上开源。
测试由 16 块 TPU v7 Ironwood 与 16 块英伟达 GB200 正面对决,双方均运行 Kimi K3,使用 vLLM 推理引擎,唯一的变量是芯片与底层 Kernel 实现。

709 Token/s 的高吞吐部分得益于 DeepSeek 提出的 DSpark 推测解码框架。该方案由小模型先快速生成候选 Token 序列,再由大模型批量验证。在 TPU 上,该流程的平均接受长度达到 6,单步解码耗时仅约 8.5 毫秒。
即便关闭推测解码,TPU 的原生裸速依然优势明显:

加速并未牺牲模型精度。经测试,Kimi K3 在 TPU 上的 GPQA-Diamond 得分为 94.4%,GSM8K 为 97.2%,与 GPU 上的评测结果完全一致。

从硬件参数来看,这一结果十分反直觉:TPU v7 的 HBM 带宽为 7380 GB/s,低于 GB200 的 8000 GB/s。显存带宽更低的硬件实现了更高的性能,关键变量在于上层的算子调度逻辑。
大模型推理的核心性能瓶颈并非算力,而是数据搬运。每生成一个 Token,模型的全部权重都需要从 HBM 主存搬运到芯片内部的高速片上缓存,处理完成后再进行下一轮读取。

传统方式将推理流程拆解为数百个独立的 Kernel,排队依次执行。前一个 Kernel 结束到下一个 Kernel 启动之间存在调用间隙,导致显存带宽短时间空转。即使通过 CUDA Graphs 等机制缩小间隙,Kernel 之间的逻辑边界依然存在。

Inferact 的 megakernel 直接打破了这层边界。以 Kimi K3 为例,其包含 92 层 MoE 计算,Inferact 将整整 92 层的计算逻辑全部封装进单个 Pallas 程序中,单次调用即可走完整个前向传播。

边界消除后,跨层权重预取(Prefetching)得以顺畅实现:当芯片还在计算第 N 层的 MoE 时,第 层的 Attention 权重就已经开始向片上缓存搬运。计算与数据传输全面重叠,几乎消除了带宽空转。

TPU 的硬件架构为这种编排提供了天然支撑:
免费获取企业 AI 成熟度诊断报告,发现转型机会

Inferact 成立于去年 11 月,核心成员均为 vLLM 的核心开发者。团队于今年 1 月全职投入创业,首轮即获得由 a16z 与 Lightspeed 领投、真格与红杉等跟投的 1.5 亿美元融资,公司估值达到 8 亿美元。
此次 TPU megakernel 的工程突破源于 Inferact 与 Google Cloud 的联合研发项目。双方的目标是让谷歌 TPU 成为 vLLM 生态中的顶级支持后端,开源的 tpu-megakernels 代码库正是这一合作的首期成果。团队后续还将把该内核优化拓展至更多主流模型架构。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断