OpenAI 自研推理芯片 Jalapeño 测试结果:在 GPT-OSS、DeepSeek R1、Kimi K2.5 上,每瓦性能是对比系统的 1.5-1.9 倍,延迟低 1.7-3.6 倍。该芯片协同设计兼顾吞吐与延迟,年底部署。

OpenAI 公布了自研推理芯片 Jalapeño 的首批测试结果。数据显示,Jalapeño 在单位功耗下能处理更多 AI 任务,响应速度也更快,无需像现有系统那样在吞吐量和延迟之间妥协。对客户而言,这意味着更快的响应、更敏捷的智能体,以及更可靠的访问。OpenAI 表示,这有助于让强大的 AI 更平价、更普及。
Jalapeño 的性能在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上均得到验证。峰值吞吐量下,每瓦完成的 AI 任务量是对比系统的 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍;高交互负载下,性能可达对比系统的 2.1 至 4.1 倍。这表明其架构不仅适配 OpenAI 内部模型,也适用于外部开放权重模型。
测试基于 SemiAnalysis 发布的 InferenceX 基准,衡量系统在满足延迟要求的同时、单位功耗完成的有用工作量。Jalapeño 额定功率 700 瓦,实测功耗低于 550 瓦,在三个公开模型上均处于帕累托前沿。在规模最大的 Kimi K2.5 1T 上,每瓦性能约为对比系统的 1.5 倍,端到端延迟低 3.4 倍。OpenAI 透露,在内部前沿模型上优势更大。
Jalapeño 的核心是协同设计,也是 OpenAI “全栈优势”的体现——将模型、软件、芯片、内存、网络与系统整合优化。语言模型推理分为预填充和解码两个阶段:前者计算密集,后者受内存带宽限制,数据移动也会造成延迟。Jalapeño 将模型状态与 KV 缓存显式保留在本地,通过广泛互联的网络整合整个工作负载,减少数据移动,并能根据预填充/解码比例灵活调配资源。
AI 深度参与了开发。早期模型协助设计调试,最新模型帮助优化编程,使团队九个月内完成从设计到流片。Jalapeño 被设计为清晰可预测的编程目标,AI 可优化映射与调度。借助搭载 GPT-Astra 的 Codex,团队两个月内让三款原本不在计划内的开放权重模型实现高性能运行。针对 GPT-OSS 的注意力与混合专家模块,AI 生成的实现比人类专家方案快 1.5 至 1.8 倍。
Jalapeño 计划今年年底前部署到 OpenAI 计算基础设施。第二代芯片正在深度开发,第三代也已启动。OpenAI 同时表示,将继续与 NVIDIA 等伙伴合作,为训练和推理提供算力,以兑现“确保通用人工智能造福全人类”的使命。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断