研究者重新审评 6 个物理基准,专家复核后发现大量"错误"实为评分失误,真实得分远高于公开排行;但这也引出一个问题:基准饱和后 LLM 的真实能力边界究竟在哪里。
两篇近期发布的内容——一篇学术论文和一篇博客——从不同角度对"大模型物理能力"给出了截然相反的诊断,合在一起却指向同一个问题:我们究竟在用什么来评估 LLM 的能力。
arXiv 论文(arXiv:2609.13009)对 6 个主流物理基准展开专家重新评分,结果出乎意料:大多数被标记为"模型答错"的案例,经专家复核后发现是评分错误、参考答案有误,或题目本身措辞模糊。真实正确率远高于此前排行榜显示的数字,多个基准已接近饱和。
结论是:目前的物理基准评估存在系统性失真,低分数给人一种"模型物理能力很差"的错觉,而这与物理学从业者实际使用模型的体验明显不符。
博客作者则把这篇论文当作反面证据。核心论点是:
博主认为,科技叙事将"针对特定高分任务的改进"过度包装成了"泛化推理能力的突破",而市场估值建立在这一叙事之上。
两篇内容并不矛盾:基准评估确实存在严重问题(论文的观察),同时通过"针对基准优化"来提升分数也确实不代表真实泛化能力(博客的批评)。
随着 Navier-Stokes、FreeBSD CVE 等标志性任务不断被 LLM 攻克,评估社区面临的挑战是:如何设计出不被快速饱和、且真实反映泛化推理能力的基准。一个可能的方向是动态基准——持续引入新问题并以开放竞赛形式运营,而非固定题库。但这要求更高的社区协作成本,且验证"新问题是否真的测试了推理"本身就是一个待解问题。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断