前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
产品/08.26 · 00:03/5 MIN/0 阅读

OpenAI自研推理芯片Jalapeño首秀:性能与效率双领先

OpenAI 首款自研推理芯片 Jalapeño 公布初步测试结果,在每瓦性能和延迟上均超越现有系统,支持多款开源模型,计划年底部署。该芯片与模型、软件协同设计,展示了全栈优化的潜力。

Jalapeño 推理芯片特写

OpenAI 首款自研推理芯片 Jalapeño 公布初步测试结果,性能表现显著领先。该芯片能在每单位功耗下处理更多 AI 工作,同时响应速度更快,在同一架构上实现了高吞吐与低延迟的兼得,而现有硬件系统往往需要在二者之间权衡。

对客户而言,这意味着更快的响应、更灵敏的 AI 智能体,以及需求增长时更可靠的服务。OpenAI 表示,这些性能提升将让越来越强大的 AI 更便宜、更易获得,有助于实现让通用人工智能(AGI)惠及全人类的使命。

跨模型性能全面领先

OpenAI 在 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上对 Jalapeño 进行了测试。结果显示,与对比系统相比,Jalapeño 在峰值吞吐下的每瓦特 AI 工作量提升了 1.5 至 1.9 倍,端到端延迟降低了 1.7 至 3.6 倍。在高度交互式工作负载下,性能提升了 2.1 至 4.1 倍。

这些模型既有 OpenAI 自研,也有外部开发,证明该架构具备广泛的适用性。在内部测试中,Jalapeño 在 OpenAI 前沿模型上的优势进一步扩大,表明其价值随工作负载规模增长而增加。

测试方法:以匹配用户体验为准

OpenAI 使用 SemiAnalysis 的公开基准 InferenceX 进行评测,重点衡量系统在满足延迟要求的前提下,每单位功耗能完成多少有效 AI 工作。这种评估方式对 AI 智能体尤为重要——它们需要按顺序完成多步任务,任何延迟都会在整个任务中被放大。

对比系统为 NVIDIA GB200 和 GB300(按各芯片标称功率归一化)。Jalapeño 额定功耗 700 瓦,实测持续功耗不超过 550 瓦。在所有测试运行区间内,Jalapeño 均处于帕累托前沿,即在性能和效率上无法被同时超越。

单芯片内的速度与效率架构

Jalapeño 从设计之初就围绕现代及未来语言模型、尤其是交互式智能体的需求展开。语言模型推理分为预填充(prefill)和解码(decode)两个阶段,前者是计算密集型,后者受内存带宽限制,而数据在核心和芯片间的移动还会引入额外延迟。

Jalapeño 的架构最大程度减少了数据移动和通信延迟。模型状态(包括生成响应时使用的 KV 缓存)可被显式放置并保持本地化,系统为每个推理阶段灵活调配计算、内存和网络资源。其大规模网络域让整个工作负载保留在一个互联系统中,避免跨设备通信,确保请求从开始到结束都保持快速高效。这种设计使其能适应不断变化的模型架构,在预填充和解码中均表现出色。

AI 参与设计,芯片也便于 AI 编程

AI 直接参与了 Jalapeño 的开发。通过 AI 辅助探索实现方案、缩短设计验证循环,团队仅用 9 个月就完成了从初始设计到流片。AI 还帮助优化了芯片的算术电路,使计算性能按计划提升。

Jalapeño 被设计成一个清晰、可预测的编程目标。工程师通过局部张量、显式通信和可预测的同步来描述工作,AI 则负责优化任务的映射、调度和协调。这种结构让 AI 能够处理传统上棘手的并行编程问题。

借助 Codex 和 GPT‑Astra,团队在两个月内让三个不属于原始生产计划的开源模型达到了高性能。在选定的 GPT‑OSS 注意力层和混合专家模块中,AI 生成的实现比人类专家手写版本快 1.5 至 1.8 倍。这展示了一种强大的新型开发循环。

部署路径与未来规划

Jalapeño 能在相同功耗和硬件下产出更多有效工作,从而降低交付成功结果的平均成本,改善运营杠杆,支持更广泛的采用和持续投资。更快的推理还能加速迭代并催生新的应用场景。

OpenAI 计划于今年年底前将 Jalapeño 部署到其计算基础设施中。这只是一个多世代路线的第一代:第二代正在深度开发中,第三代已初具雏形。每代产品都将继承前代经验,进一步提升效率与速度。

与此同时,OpenAI 表示将继续广泛部署 NVIDIA 及其他合作伙伴的加速器,用于训练和推理工作负载。目前,团队正在推进生产认证、完善软件栈、准备大规模运维,并在更多模型上验证性能。初期结果证明了全栈协同设计的潜力:以更低成本,让更多用户获得更快捷、更强大、更具智能体能力的 AI。

标签:OpenAI推理性能全栈优化

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

硅谷押注的下一个 Harness,是整个桌面操作系统
TOP1

硅谷押注的下一个 Harness,是整个桌面操作系统

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

为什么DeepSeek Harness选择了Cordis作为Agent的内核?

3

DeepSeek Harness 源码深潜(上)——从 API 到 Agent 心脏(附源码)

16小时前
DeepSeek Harness 源码深潜(上)——从 API 到 Agent 心脏(附源码)
4

19 万 Star 之后,我给 DeepSeek Harness 接入了Milvus

16小时前
19 万 Star 之后,我给 DeepSeek Harness 接入了Milvus
5

GPT-5.6接入Kiro,开发者编码成本降82%

18小时前
GPT-5.6接入Kiro,开发者编码成本降82%
6

OpenAI 预览隐私安全处理,强化零数据保留承诺

1小时前
OpenAI 预览隐私安全处理,强化零数据保留承诺
7

OpenAI自研推理芯片Jalapeño首秀:性能与效率双领先

1小时前
OpenAI自研推理芯片Jalapeño首秀:性能与效率双领先
8

OpenAI自研芯片Jalapeño性能首秀

1小时前
OpenAI自研芯片Jalapeño性能首秀
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断