SpaceXAI 发布 Grok 4.7,主打编程与专业知识工作:CursorBench 4.0 从 40.4% 升至 46.3%,API 价格维持每百万输入 2 美元、输出 6 美元不变。
xAI(官方账号 SpaceXAI)9 月 22 日发布新模型 Grok 4.7,定位「面向编程与知识工作的最强模型」,强调处理数小时级长任务,API 价格维持原价。以下综合机器之心、APPSO 报道及官方公布的数据。
Grok 4.7 换用了比 Grok 4.6 更大的基础模型,强化学习周期更长,训练任务中有相当一部分需要数小时才能完成。官方数据:CursorBench 4.0(长时间编码任务)从 40.4% 升至 46.3%;DeepSWE v1.1 从 65.2% 升至 71.0%;Terminal-Bench 4.0 从 20.3% 升至 38.0%。横向对比中,Grok 4.7 在 CursorBench、Terminal-Bench 上仍低于 Fable 5.1 Max,DeepSWE 上略低于 GPT-5.6 Sol Max(71.0% vs 72.7%)。

图:SpaceXAI 官方公布的 Grok 4.7 跑分与定价对比表。来源:36氪(原推特 @SpaceXAI)
评测范围也扩展到律师、护士、金融分析师等多步骤专业任务:AA Briefcase v1.1 从 1546 分升至 1657 分,GDPval Elo 从 1605 升至 1695,接近 Fable 5.1 的 1735、高于 GPT-6 Astra 的 1542;Harvey Legal Agent Benchmark 从 15.8% 升至 19.6%。
文档协作平台 Box 展示了一个案例:Grok 4.7 在 Box Agent 中核对一笔 200 万美元的保险索赔,发现 8.2 万美元重复发票、6.4 万美元遗漏的供应商抵扣,并识别出一处可能导致 14.3 万美元差异的免赔额问题,生成审查报告供理赔员参考,承保与付款决定仍由保险公司完成。

图:Box 官方展示 Grok 4.7 处理保险理赔案例。来源:36氪(原推特 @Box)
SpaceXAI 称 Grok 4.7 是其测试过在拒答与抗越狱上最强的模型:生物安全基准 LatchBio 得分 62.4%,网络安全基准 HackerBench v0.3 中仅 3.3% 的高风险双重用途提示被放行。标准版价格维持每百万输入 2 美元、输出 6 美元,与 Grok 4.6 相同;新增快速版速度翻倍、价格也翻倍。模型已上线 Cursor、Grok Build 与 Grok API。
首批开发者测试评价两极分化:有人认为多步骤视觉任务细节丰富,也有人反映物理效果生硬、token 消耗快。据马斯克公开信息,下一代 Grok 4.8 参数规模约 2.5 万亿、采用全新 C++ 训练栈,均未给出发布时间表。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断