GPT-6 Astra攻破了FrontierMath Tier 4中最后一道难题,使该测试集所有题目均被AI攻破,Epoch AI宣告其测试饱和。这标志着大语言模型在研究级数学推理上取得重要跨越,未来基准测试将转向形式化验证与开放猜想。
曾被视作大语言模型数学能力“终极试金石”的研究级评测集 FrontierMath Tier 4,正式迎来了全部被攻破的历史性节点。
随着 GPT-6 Astra 成功解出此前唯一未被攻克的一道题,Epoch AI 正式宣布:FrontierMath Tier 4 已经饱和。

虽然在单次综合评测中,OpenAI 公布的 Astra 成绩为 97.6%,尚未直接达到满分,但依照 Epoch AI 的累计评估标准,只要题库中的每道题目在历次测试中至少被任意模型成功解答过一次,即视为该测试集被整体覆盖。而 Astra 此次攻下的,正是此前所有 AI 模型都未能解开的最后盲区。

整个演进历程极为迅速。2025年7月 Tier 4 刚推出时,榜单上的最高正确率仅在 5% 左右。仅仅过去一年零两个月,曾经宛如天堑的高墙已被彻底翻越。
出题人之一、马凯特大学数学副教授 Jay Pantone 评价称,以往 AI 往往依赖数值捷径,但这一次 Astra 的推理路径与人类数学家的推导非常接近。

FrontierMath 最早于 2024 年 11 月由 Epoch AI 联合陶哲轩、Timothy Gowers 等 60 余位数学家推出,初衷是为了解决 GSM8K、MATH 等传统基准过快被刷穿的问题。
陶哲轩当时曾直言题库极其困难,并预测高难度层级足以阻挡 AI 相当长一段时间。初次测试中,领先模型的准确率甚至不足 2%。

最初的题库包含 300 道题,分为 Tier 1 至 Tier 3:

随着具有显式推理能力的模型持续演进,前三层题目迅速被大模型消化。2025 年,Epoch 顺势追加了难度极高的 Tier 4。
Tier 4 题库由数学教授及博士后设计,题目涵盖分析学、数论、组合数学、拓扑及代数几何等方向,最初收录 50 道题。刚上线时,所有模型累计仅解出过 3 道题,Epoch 甚至在官网上推测“部分题目可能数十年都无法被 AI 解决”。

伴随模型能力的暴涨,题库自身也经历了审查与迭代。在 OpenAI 指出题库中存在校验漏洞后,Epoch 开展了独立审计,使用 GPT-5.5 和 Claude Opus 4.7 筛查疑点,并交由专家逐题复核。2026 年 6 月发布的 v2 版本中,Tier 4 修正了 12 题,移除了 7 题,最终保留 43 题。
审计修正后的题目依然未能阻挡模型分数的激增:GPT-5.6 Sol 达到 83.0%,Claude Fable 5 达到 90.2%,最终 GPT-6 Astra 以 97.6% 的单次高分补齐了最后一道未解题目。


Tier 4 的饱和并不代表 AI 已经彻底解决数学问题,反而推动基准测试走向更深的水域。
FrontierMath 目前已设立两项新分支:面向人类尚未解决的“开放问题”(Open Problems),以及将埃尔德什(Erdős)开放问题形式化进 Lean 证明器的“FrontierMath Erdős”。

前者直接考验大模型对前沿数学猜想的探究能力,后者则要求模型生成严谨的形式化验证代码。面对 FrontierMath Erdős 的 68 道问题,即使是强大的 Astra 目前也仅成功推导出 2 道。面对真正的未解之谜与严格的形式化证明,大语言模型探索数学边界的征途才刚刚开始。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断