OpenAI 拓展 GPT-6 家族,正式推出主打高性价比的 GPT-6 Sol 与 Luna。两款模型承袭 Astra 的核心能力,在专业工作、代码编写和电脑操作等基准中表现出色,API 价格较上一代直降 50%。
继月初推出旗舰模型 GPT-6 Astra 之后,OpenAI 宣布进一步拓展 GPT-6 产品线,正式推出两款全新模型:GPT-6 Sol 与 GPT-6 Luna。
两款模型采用了与 GPT-6 Astra 相似的训练方法,将 Astra 在专业工作、真实性、代码编写、电脑操作(Computer Use)及对齐能力上的技术突破,移植到了运行更快、成本更低的模型上。
得益于缓存技术与推理架构的改进,OpenAI 将服务成本的下降直接让利给开发者:Sol 与 Luna 的 API 价格较 GPT-5.6 促销价直接腰斩,降幅达 50%。
旗舰级 GPT-6 Astra 依然是各领域能力最强的顶级模型,适合对效果有极致要求的任务。
专业工作流程
在衡量跨应用商业流程的 AutomationBench 1.0.6 基准测试中,超高思考强度的 GPT-6 Sol 表现超越了极限强度的 Claude Opus 5,而单任务成本仅为后者的 9%。在多智能体复杂工作流评估 Agents' Last Exam 中,GPT-6 Sol 极限强度的得分达到 56.4%,超越 Claude Opus 5 的最高表现,任务成本降低 60%。
真实性与减少幻觉
在基于用户报错的真实对话评估中,GPT-6 Sol 的错误率较上一代减少了约一半,以更低成本达到了接近 Astra 的可靠性。GPT-6 Luna 在高思考强度下,则以约百分之一的成本追平了 GPT-5.6 Sol 的真实性水平。
代码编写与工程实践
随着 AI 智能体在代码领域的深度应用,日常 Token 消耗急剧增加。在评估代码能否直接合并至真实仓库的 FrontierCode 测试中,GPT-6 Sol 追平了高强度 Claude Fable 5.1,成本显著降低。在真实软件工程评测 DeepSWE v1.1 中,极限强度的 GPT-6 Sol 取得 68.8% 的成绩,紧逼 Claude Fable 5 的最高分(69.9%),单任务成本降低约 80%。
电脑操作
在评估 AI 智能体长程电脑操作能力的 OSWorld 2.0 离线测试中,GPT-6 Sol 达到 60.5% 的得分,与 Claude Opus 5(60.3%)持平,但任务成本低了约 80%。
配合低廉的 Token 价格,OpenAI 对 GPT-6 的提示词缓存机制进行了升级,默认提供更高的缓存命中率。读取已缓存的输入 Token 可享受 90% 的折扣。
此外,OpenAI 推出了多项优化功能:
GPT-6 Sol 与 GPT-6 Luna 即日起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 及 Edu 用户开放。免费及 Go 用户可通过桌面端体验 GPT-6 Luna。在 OpenAI API 中,两款模型对应的调用标识分别为 gpt-6-sol 和 gpt-6-luna。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断