前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.19 · 19:36/4 MIN/编译自 henry/2 阅读

AI能否通过爱因斯坦测试?GPT-1900复现光量子引热议

研究者将大模型知识限制在1900年前,测试其能否自主推导出相对论与光量子假说。实验显示模型虽偶有灵光一现,但远未具备科学发现所需的溯因推理与价值判断能力,暴露出AI迈向真正科学家的核心短板。

如果把大语言模型送回1911年,仅向其提供爱因斯坦当年所能接触到的物理学知识,它能否在四年后自主提出广义相对论?

爱因斯坦历史照片

这项思想实验最初由诺贝尔奖得主、Google DeepMind联合创始人戴密斯·哈萨比斯(Demis Hassabis)提出。哈萨比斯希望验证的是:AI能否在面对未解物理难题时,突破训练材料的局限,自主构建出一套颠覆性的全新解释框架,而非仅仅检索或复读已有知识。如果模型能够做到这一点,将成为检验通用人工智能(AGI)的关键基准。

哈萨比斯提出测试设想

由于真实的科学史已经给出了确定答案,只要严格把控历史知识截断点,研究人员就能以历史为对照,检验模型是否真正具备超脱语料的推演能力。《Nature》杂志在专题报道中将这类构想称为「爱因斯坦测试」。

Nature关注爱因斯坦测试

构建1900年的历史语言模型

独立研究者迈克尔·赫拉(Michael Hla)启动了一项名为 Machina Mirabilis 的实验,致敬爱因斯坦发表四篇开创性论文的1905年「奇迹年」。赫拉试图探究,拥有1900年前人类知识储备的AI,能否重新独立推导出现代物理学。

Machina Mirabilis项目

赫拉从零训练了一个33亿参数的Transformer语言模型「GPT-1900」。该模型的预训练语料涵盖1900年以前的书籍和报纸(约220亿Token),以及2600多部古典物理学著作(约2.9亿Token),包含牛顿、麦克斯韦和法拉第等人的原著。

为了防止现代答案泄漏,赫拉执行了严格的过滤机制:凡是包含「爱因斯坦」「相对论」「量子力学」等后世术语或现代编者注释的文本,均被整篇剔除。

闪现的「光量子」假说与实验局限

在光电效应测试中,赫拉向模型输入了经典物理学难以解释的异常现象:光的频率低于阈值时,无论多亮都无法激发电荷;超过阈值后,增加光强仅提升电子数量,提升频率才会增加电子能量。

面对这一矛盾,GPT-1900输出了一段引人注目的论述:「光可能不是连续的,而是由许多彼此分离、频率不同的部分组成。」这一描述在直觉层面上高度契合爱因斯坦当年的光量子假说。

但赫拉直言,这并不意味着模型重新发现了光量子理论:

首先,模型在绝大多数物理推理任务上均以失败告终,所谓的理论火花更多是基于统计概率的合理词句拼接,并未建立起自洽的物理模型;

其次,人类研究者在提示词中已经提炼好了核心矛盾和实验参数,模型只是在现成框架下进行归因筛选,而爱因斯坦当年并没有人帮他划定问题重点;

更关键的是,实验未能做到绝对的物理隔离。在生成指令问答与强化学习评分阶段,赫拉引入了现代模型 Claude。现代模型的介入破坏了「零污染」的前提假设,难以完全排除后验知识隐性渗透的可能。

科学发现的关键:AI缺乏「溯因飞跃」

复现已知结论是否等同于具备科学发现能力?学界普遍给出了否定答案。

Google DeepMind研究员汤姆·扎哈维(Tom Zahavy)在关于大语言模型推理能力的论文中指出,科学推理包含三个层级:从样本归纳规律、从前提出发展开演绎,以及面对反常现象时提出全新解释的「溯因推理」。当前模型已经掌握了归纳并正在提升演绎,但在需要打破既有范式的溯因推理上,依然难以实现质的飞跃。

麻省理工学院(MIT)计算机科学家雅各布·安德烈亚斯(Jacob Andreas)指出,对AI而言,拼凑出一套相对论式的假设表述并非最难的部分,真正的核心难点在于判断哪一种假说值得被实验检验。

真实的科学研究从来不是解开一道边界清晰的练习题,而是学会在海量假说中评估其科学价值,并投入时间与资源进行长期验证。在AI能够自主发现真正值得追问的问题之前,它依然只是强大的知识整理工具,无法成为真正的科学探索者。

标签:大语言模型科学发现AGIGoogle DeepMind推理

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

ColorOS 17 把支付授权收进系统层:AgentOS 争的是被超级 App 拿走的那层
置顶

ColorOS 17 把支付授权收进系统层:AgentOS 争的是被超级 App 拿走的那层

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用
置顶

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍
置顶

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍

//

24小时热榜

Cua 开源 CUA-S1-FORMS:70 万参数的表单填写小模型
TOP1

Cua 开源 CUA-S1-FORMS:70 万参数的表单填写小模型

前线AI研究员集体拉响警报:超级智能失控风险逼近
TOP2

前线AI研究员集体拉响警报:超级智能失控风险逼近

3

OpenAI发布青少年安全蓝图,强化未成年人AI防护

10小时前
OpenAI发布青少年安全蓝图,强化未成年人AI防护
4

英特尔白皮书称:Agent 任务六成时间耗在 GPU 之外

10小时前
英特尔白皮书称:Agent 任务六成时间耗在 GPU 之外
5

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

10小时前
美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用
6

马斯克计划低价收购破产初创公司数据,用于训练Grok模型

14小时前
马斯克计划低价收购破产初创公司数据,用于训练Grok模型
7

AI能否通过爱因斯坦测试?GPT-1900复现光量子引热议

14小时前
AI能否通过爱因斯坦测试?GPT-1900复现光量子引热议
8

JEPA-Anything发布:同一预测架构搞定癌细胞与行星轨道

19小时前
JEPA-Anything发布:同一预测架构搞定癌细胞与行星轨道
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断