前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.12 · 00:00/3 MIN/编译自 henry/2 阅读

GPT-6 Astra攻克最后难题,FrontierMath Tier 4宣告饱和

GPT-6 Astra攻破了FrontierMath Tier 4中最后一道难题,使该测试集所有题目均被AI攻破,Epoch AI宣告其测试饱和。这标志着大语言模型在研究级数学推理上取得重要跨越,未来基准测试将转向形式化验证与开放猜想。

曾被视作大语言模型数学能力“终极试金石”的研究级评测集 FrontierMath Tier 4,正式迎来了全部被攻破的历史性节点。

随着 GPT-6 Astra 成功解出此前唯一未被攻克的一道题,Epoch AI 正式宣布:FrontierMath Tier 4 已经饱和。

Epoch AI 统计显示 FrontierMath Tier 4 题目已全部被 AI 解出

虽然在单次综合评测中,OpenAI 公布的 Astra 成绩为 97.6%,尚未直接达到满分,但依照 Epoch AI 的累计评估标准,只要题库中的每道题目在历次测试中至少被任意模型成功解答过一次,即视为该测试集被整体覆盖。而 Astra 此次攻下的,正是此前所有 AI 模型都未能解开的最后盲区。

各模型在 FrontierMath 上的成绩表现

整个演进历程极为迅速。2025年7月 Tier 4 刚推出时,榜单上的最高正确率仅在 5% 左右。仅仅过去一年零两个月,曾经宛如天堑的高墙已被彻底翻越。

出题人之一、马凯特大学数学副教授 Jay Pantone 评价称,以往 AI 往往依赖数值捷径,但这一次 Astra 的推理路径与人类数学家的推导非常接近。

马凯特大学副教授 Jay Pantone 对 Astra 表现的评价

从不足2%,到加设“研究级防线”

FrontierMath 最早于 2024 年 11 月由 Epoch AI 联合陶哲轩、Timothy Gowers 等 60 余位数学家推出,初衷是为了解决 GSM8K、MATH 等传统基准过快被刷穿的问题。

陶哲轩当时曾直言题库极其困难,并预测高难度层级足以阻挡 AI 相当长一段时间。初次测试中,领先模型的准确率甚至不足 2%。

陶哲轩此前对 FrontierMath 难度的评价

最初的题库包含 300 道题,分为 Tier 1 至 Tier 3:

  • Tier 1:接近高难度本科题及数学奥赛水平;
  • Tier 2:达到高年级研究生阶段水准;
  • Tier 3:接近博士生早期的探索性研究课题。

FrontierMath 初始三层难度架构划分

随着具有显式推理能力的模型持续演进,前三层题目迅速被大模型消化。2025 年,Epoch 顺势追加了难度极高的 Tier 4。

Tier 4 题库由数学教授及博士后设计,题目涵盖分析学、数论、组合数学、拓扑及代数几何等方向,最初收录 50 道题。刚上线时,所有模型累计仅解出过 3 道题,Epoch 甚至在官网上推测“部分题目可能数十年都无法被 AI 解决”。

FrontierMath Tier 4 题库构成与说明

伴随模型能力的暴涨,题库自身也经历了审查与迭代。在 OpenAI 指出题库中存在校验漏洞后,Epoch 开展了独立审计,使用 GPT-5.5 和 Claude Opus 4.7 筛查疑点,并交由专家逐题复核。2026 年 6 月发布的 v2 版本中,Tier 4 修正了 12 题,移除了 7 题,最终保留 43 题。

审计修正后的题目依然未能阻挡模型分数的激增:GPT-5.6 Sol 达到 83.0%,Claude Fable 5 达到 90.2%,最终 GPT-6 Astra 以 97.6% 的单次高分补齐了最后一道未解题目。

主流大模型在 Tier 4 上的得分爬升曲线

Astra 攻破 Tier 4 最后一道未解难题

数学测试迈向形式化验证时代

Tier 4 的饱和并不代表 AI 已经彻底解决数学问题,反而推动基准测试走向更深的水域。

FrontierMath 目前已设立两项新分支:面向人类尚未解决的“开放问题”(Open Problems),以及将埃尔德什(Erdős)开放问题形式化进 Lean 证明器的“FrontierMath Erdős”。

新基准 FrontierMath Erdős 的测试情况

前者直接考验大模型对前沿数学猜想的探究能力,后者则要求模型生成严谨的形式化验证代码。面对 FrontierMath Erdős 的 68 道问题,即使是强大的 Astra 目前也仅成功推导出 2 道。面对真正的未解之谜与严格的形式化证明,大语言模型探索数学边界的征途才刚刚开始。

标签:OpenAIGPT-6数学推理大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
置顶

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

//

24小时热榜

别被UMAP骗了:你看到的聚类可能是算法造假
TOP1

别被UMAP骗了:你看到的聚类可能是算法造假

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
TOP2

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

3

支撑10亿用户:OpenAI在线存储平台Habitat演进实录

1天前
支撑10亿用户:OpenAI在线存储平台Habitat演进实录
4

蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施

1天前
蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施
5

Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3

1天前
Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3
6

具身智能落地三问:告别单次演示,走向低成本规模复制

1天前
具身智能落地三问:告别单次演示,走向低成本规模复制
7

素人IP批量走红:靠情绪出圈,变现考验专业功底

1天前
8

外滩大会观察:AI加速落地产业,数据基础设施成突围核心

1天前
外滩大会观察:AI加速落地产业,数据基础设施成突围核心
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断