前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.17 · 00:00/5 MIN/作者:苏晚/0 阅读

LLM 看空者的新论据:物理基准接近饱和,但评估本身是坏的

研究者重新审评 6 个物理基准,专家复核后发现大量"错误"实为评分失误,真实得分远高于公开排行;但这也引出一个问题:基准饱和后 LLM 的真实能力边界究竟在哪里。

两篇近期发布的内容——一篇学术论文和一篇博客——从不同角度对"大模型物理能力"给出了截然相反的诊断,合在一起却指向同一个问题:我们究竟在用什么来评估 LLM 的能力。

学术论文:评估系统本身坏掉了

arXiv 论文(arXiv:2609.13009)对 6 个主流物理基准展开专家重新评分,结果出乎意料:大多数被标记为"模型答错"的案例,经专家复核后发现是评分错误、参考答案有误,或题目本身措辞模糊。真实正确率远高于此前排行榜显示的数字,多个基准已接近饱和。

结论是:目前的物理基准评估存在系统性失真,低分数给人一种"模型物理能力很差"的错觉,而这与物理学从业者实际使用模型的体验明显不符。

博客回应:这正是为什么我仍然看空

博客作者则把这篇论文当作反面证据。核心论点是:

  • LLM 正在被大量标注样本和强化学习"针对性训练"到特定任务上,包括 Navier-Stokes 方程等物理题
  • 针对可验证输出的任务,LLM 确实表现得好;但一旦稍微偏移分布,表现急速下滑
  • 基准饱和并不意味着"会物理",只意味着"会做物理基准题"
  • 真正自主完成复杂知识任务的 LLM 仍然需要大量人工监督

博主认为,科技叙事将"针对特定高分任务的改进"过度包装成了"泛化推理能力的突破",而市场估值建立在这一叙事之上。

两个观点都能成立

两篇内容并不矛盾:基准评估确实存在严重问题(论文的观察),同时通过"针对基准优化"来提升分数也确实不代表真实泛化能力(博客的批评)。

接下来看什么

随着 Navier-Stokes、FreeBSD CVE 等标志性任务不断被 LLM 攻克,评估社区面临的挑战是:如何设计出不被快速饱和、且真实反映泛化推理能力的基准。一个可能的方向是动态基准——持续引入新问题并以开放竞赛形式运营,而非固定题库。但这要求更高的社区协作成本,且验证"新问题是否真的测试了推理"本身就是一个待解问题。

标签:基准测试
苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

//

24小时热榜

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据
TOP1

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
TOP2

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

3

Nvidia 宣布支持原生 GPU 内核 Rust 编程,直接编译到 PTX

12小时前
Nvidia 宣布支持原生 GPU 内核 Rust 编程,直接编译到 PTX
4

Google Home 接入 MCP 标准,AI Agent 可控智能家居

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
12小时前
Google Home 接入 MCP 标准,AI Agent 可控智能家居
5

华为郭平:ICT 及计算领域目标是成为英伟达,不做自研大模型

12小时前
华为郭平:ICT 及计算领域目标是成为英伟达,不做自研大模型
6

研究突破三值大模型存储极限,新格式降至 1.485 bits/参数

12小时前
研究突破三值大模型存储极限,新格式降至 1.485 bits/参数
7

ChatGPT 上线分析套件:量化企业 AI 业务价值与回报

5小时前
ChatGPT 上线分析套件:量化企业 AI 业务价值与回报
8

4B 参数模型通过强化学习优化查询计划,比 Postgres 快 81%

12小时前
4B 参数模型通过强化学习优化查询计划,比 Postgres 快 81%
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断