OpenAI 推出 GPT-6 Astra 极速模式,基于 NVIDIA Blackwell 架构实现深度推理优化,Token 生成速度最高提升 8 倍。这大幅缩短了 AI 智能体的代码调试与工具调用延迟,显著提升交互体验。

OpenAI 旗下 GPT-6 Astra Ultrafast(极速模式)现已正式上线 OpenAI API,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。该模型运行在 NVIDIA Blackwell GPU 架构之上。
得益于 OpenAI 针对 Blackwell 硬件特性进行的端到端推理优化,Ultrafast 模式的 Token 生成速度较 Astra 标准模式最高提升达 8 倍。对开发者而言,更快的生成速率能够直接缩短编程 AI 智能体(Agent)的“编辑-测试-调试”闭环,减少跨工具调用时的等待间隙,让交互式应用的响应更加流畅。
在工作流频繁复用的场景中,响应速度的提升尤为关键:AI 智能体需要编写代码、调用工具、校验运行结果,随后决策下一步动作。Ultrafast 模式让 Astra 能够无缝融入这些对时间高度敏感的高频循环,借助 NVIDIA 的 AI 基础设施,在开发者需要时即时提供高质量的模型输出。
OpenAI 推理业务负责人 Philippe Tillet 表示,NVIDIA 在开发工具链和技术文档上的持续积累,使模型能够极其出色地针对 Blackwell 及 Rubin GPU 进行编程。Astra 能将这部分能力转化为高性能算子(kernel),在延迟、吞吐量和成本的全维度权衡中,最大化发挥硬件优势。这直接转化为 AI 智能体在处理复杂任务、编写代码及调用工具时更迅速的响应表现。
模型的部署上线并非性能提升的终点。OpenAI 正利用自身的内部模型反哺并优化运行在 NVIDIA GPU 上的推理软件栈,借助平台的可编程性快速验证与落地改进方案,使已部署的基础设施随时间推移释放更高生产力。
OpenAI 计算首席技术官 Uday Ruddarraju 指出,内部模型在优化 GPU 推理效率方面发挥了核心作用,而 NVIDIA 平台的开放与可编程特性,正是 Astra Ultrafast 实现大幅加速的关键基石。
此外,灵活可编程的计算平台允许团队在模型演进过程中,统一复用底层的训练、推理和强化学习基础设施。这种弹性让算力资源能随业务需求动态流转,有效提升硬件利用率,避免了为不同工作负载过度配置硬件资源。
目前开发者已可通过 API 接入 GPT-6 Astra Ultrafast,权限开通、计费与部署细节可参阅 Ultrafast 使用指南。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断