OpenAI发布GPT-6 Astra与Pro:ARC-AGI-3得分99.9%,漏洞利用测试满分,可自主操作电脑完成复杂任务;API输出价50美元/百万token。OpenAI称:欢迎来到AGI时代。
OpenAI 正式发布 GPT-6 Astra 与 GPT-6 Astra Pro。官方称,这是目前世界上最智能、最协调的模型,在 Computer Use、浏览器操作、软件工程、网络安全、科学和专业工作上树立了新标杆。发布会结尾,OpenAI 总裁 Greg Brockman 留下一句话:“欢迎来到 AGI 时代。”

Astra 是 OpenAI 历史上规模最大的训练任务,在得州 Stargate 园区动用超过 10 万块 GPU 完成预训练,也是第一款由前代模型深度参与监督训练的旗舰产品。API 定价同步公布:输入 10 美元/百万 token,输出 50 美元/百万 token,约为 GPT-5.6 Sol(输入 4 美元、输出 20 美元/百万 token)的 2.5 倍,与 Fable 5.1 持平。

OpenAI 表示,相比每百万 token 多少钱,真正有意义的指标是完成一项任务需要多少钱。单次调用更贵,但如果能减少返工、用更少步骤完成整项工作,总成本反而可能更低。
相比前代,Astra 的核心变化是从“回答问题”转向“直接完成工作”。它能操作电脑和浏览器,在不同软件里执行多步骤任务,交付能直接使用的文档、表格、演示文稿、网站甚至工程项目。
最突出的三项成绩:FrontierMath Tier 4 v2 拿到 97.6%,ARC-AGI-3 得分 99.9%(上一代 GPT-5.6 Sol 只有 7.8%),漏洞利用测试 ExploitBench 达到 100%。

ARC-AGI-3 专测模型在陌生环境中的适应能力:不给规则说明,直接把模型丢进从未见过的二维游戏,让它边玩边找通关方法。OpenAI 解释,99.9% 的成绩使用了 Responses API Harness 运行框架,并非纯基础模型成绩,也包含记忆管理和 Agent 框架带来的增益。
编程方面,Terminal-Bench 4.0 得分 57.7%,超过 Fable 5.1 的 55.8% 和 GPT-5.6 Sol 的 37.3%;DeepSWE v1.1 得分 74.1%;GPQA Diamond 研究生级科学问答得分 96%,略高于 Gemini 3.8 Flash 的 95.3%。更关键的是,Astra 把代码能力与 Computer Use 结合,能进入终端和开发工具执行、测试、发现问题,再继续修改。
在 Agents' Last Exam 上,Astra 得 59.3%,高于 GPT-5.6 Sol 的 53.6% 和 Claude Opus 5 的 55.5%;AutomationBench 上从 Sol 的 18.1% 提升到 41.4%。OSWorld 2.0 离线测试得分 72.6%,完成单项任务平均约 40 分钟,比 Sol 的约 75 分钟减少 47%。
Astra 在 ExploitBench 上拿到满分;ExploitGym 上从 Sol 的 30.3% 提高到 42.4%。面对近三个月公开的新漏洞,它的成功率为 39%,Sol 只有 5.5%。测试期间,Astra 还发现并利用了此前未知的两个 V8 零日漏洞。
OpenAI 还专门测试它会不会越界。在一项模拟网络安全任务中,当原任务难以完成时,GPT-5.6 Sol 有 48.2% 的测试出现越界行为,Astra 则是 0%。它更会找漏洞,也更清楚哪些系统不能碰。

在电子工程演示中,Astra 直接进入 KiCad,根据原理图完成 PCB 布局:自己放置元器件、规划位置、连接铜线,最终生成一块可进入制造流程的电路板。

另一个案例中,Astra 先在 Blender 里建好房屋模型,再导入 Unreal Engine 5,生成一个可以自由行走的三维空间。整个流程跨越不同软件和文件格式,它需要理解界面、操作工具,并保证前后步骤衔接。

办公场景中,Astra 可以根据企业已有模板直接制作演示文稿,而不是输出等待排版的文字。它还能完成找儿科医生、筛选公寓、预约车管所业务等任务,其中找儿科医生只用 2 分 54 秒,人类完成相同任务约需 5 小时。

Brockman 认为,只要模型足够擅长 Computer Use,它就能像人一样通过屏幕、鼠标和键盘直接操作企业软件,无需为每套系统重新开发 API、插件和连接器。这也是 Astra 与传统聊天机器人最明显的区别:人类交代目标和边界,检查最终结果即可。
与 Astra 配套的 Codex 能力也在更新。过去任务超过上下文窗口后,Codex 通常要压缩早期信息,可能丢掉关键细节;现在它可以跨上下文窗口保存工作笔记,并搜索此前的消息和工具输出。Astra 还能一边工作,一边在无关紧要的环节继续执行,只在涉及重要选择时停下来等用户确认。在 Mind2Web 测试中,新 Computer Use 运行框架搭配 Astra 的任务完成速度,是当前 GPT-5.6 Sol 体验的 1.9 倍。
免费获取企业 AI 成熟度诊断报告,发现转型机会
法律 AI 平台 Legora 用 Astra 一次核对了 41 份财务文件,几分钟内找出全部 4 个预埋错误,其中包括一处 50 万英镑的差额。单看这项任务比上一代快近 40%,放到 Legora 全部智能体任务里平均则提升约 3%。游戏公司 Playco 让 Astra 直接进入 Unity 和 Godot 做游戏,同一份灰盒底稿一次生成 3 个不同主题的可玩原型,人工修补工作量减少约一半。
按官方计划,Astra 将向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,Astra Pro 面向 Pro、Business 和 Enterprise 用户,免费用户还要再等等。
对于 AGI,Brockman 给出了大胆判断:“再过几年,当我们回头追问 AGI 究竟诞生于何时,答案很可能就是现在,而 Astra 或许就是那个起点。”从 GPT-4 发布后微软科学家称其为“AGI 的早期火花”,到后来用 LaTeX 绘制 TiKZ 独角兽仍像简笔画,再到现在最新模型生成的画面已经完全看不出是用代码画的——这种变化称得上质变。

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断