研究者将大模型知识限制在1900年前,测试其能否自主推导出相对论与光量子假说。实验显示模型虽偶有灵光一现,但远未具备科学发现所需的溯因推理与价值判断能力,暴露出AI迈向真正科学家的核心短板。
如果把大语言模型送回1911年,仅向其提供爱因斯坦当年所能接触到的物理学知识,它能否在四年后自主提出广义相对论?

这项思想实验最初由诺贝尔奖得主、Google DeepMind联合创始人戴密斯·哈萨比斯(Demis Hassabis)提出。哈萨比斯希望验证的是:AI能否在面对未解物理难题时,突破训练材料的局限,自主构建出一套颠覆性的全新解释框架,而非仅仅检索或复读已有知识。如果模型能够做到这一点,将成为检验通用人工智能(AGI)的关键基准。

由于真实的科学史已经给出了确定答案,只要严格把控历史知识截断点,研究人员就能以历史为对照,检验模型是否真正具备超脱语料的推演能力。《Nature》杂志在专题报道中将这类构想称为「爱因斯坦测试」。

独立研究者迈克尔·赫拉(Michael Hla)启动了一项名为 Machina Mirabilis 的实验,致敬爱因斯坦发表四篇开创性论文的1905年「奇迹年」。赫拉试图探究,拥有1900年前人类知识储备的AI,能否重新独立推导出现代物理学。

赫拉从零训练了一个33亿参数的Transformer语言模型「GPT-1900」。该模型的预训练语料涵盖1900年以前的书籍和报纸(约220亿Token),以及2600多部古典物理学著作(约2.9亿Token),包含牛顿、麦克斯韦和法拉第等人的原著。
为了防止现代答案泄漏,赫拉执行了严格的过滤机制:凡是包含「爱因斯坦」「相对论」「量子力学」等后世术语或现代编者注释的文本,均被整篇剔除。
在光电效应测试中,赫拉向模型输入了经典物理学难以解释的异常现象:光的频率低于阈值时,无论多亮都无法激发电荷;超过阈值后,增加光强仅提升电子数量,提升频率才会增加电子能量。
面对这一矛盾,GPT-1900输出了一段引人注目的论述:「光可能不是连续的,而是由许多彼此分离、频率不同的部分组成。」这一描述在直觉层面上高度契合爱因斯坦当年的光量子假说。
但赫拉直言,这并不意味着模型重新发现了光量子理论:
首先,模型在绝大多数物理推理任务上均以失败告终,所谓的理论火花更多是基于统计概率的合理词句拼接,并未建立起自洽的物理模型;
其次,人类研究者在提示词中已经提炼好了核心矛盾和实验参数,模型只是在现成框架下进行归因筛选,而爱因斯坦当年并没有人帮他划定问题重点;
更关键的是,实验未能做到绝对的物理隔离。在生成指令问答与强化学习评分阶段,赫拉引入了现代模型 Claude。现代模型的介入破坏了「零污染」的前提假设,难以完全排除后验知识隐性渗透的可能。
复现已知结论是否等同于具备科学发现能力?学界普遍给出了否定答案。
Google DeepMind研究员汤姆·扎哈维(Tom Zahavy)在关于大语言模型推理能力的论文中指出,科学推理包含三个层级:从样本归纳规律、从前提出发展开演绎,以及面对反常现象时提出全新解释的「溯因推理」。当前模型已经掌握了归纳并正在提升演绎,但在需要打破既有范式的溯因推理上,依然难以实现质的飞跃。
麻省理工学院(MIT)计算机科学家雅各布·安德烈亚斯(Jacob Andreas)指出,对AI而言,拼凑出一套相对论式的假设表述并非最难的部分,真正的核心难点在于判断哪一种假说值得被实验检验。
真实的科学研究从来不是解开一道边界清晰的练习题,而是学会在海量假说中评估其科学价值,并投入时间与资源进行长期验证。在AI能够自主发现真正值得追问的问题之前,它依然只是强大的知识整理工具,无法成为真正的科学探索者。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断