哈萨比斯提出“爱因斯坦测试”:检验AI能否独立提出科学理论
Google DeepMind联合创始人、诺奖得主哈萨比斯近日提出一项名为“爱因斯坦测试”的AI科学推理能力检验方案:将AI的知识水平限制在1911年,观察它能否在仅掌握当时知识的前提下,独立提出新的解释框架,并完成超出训练材料的推理,而非简单复读已有答案。
这一设想被Nature杂志在最新文章中梳理。哈萨比斯认为,如果AI能做到这一点,将成为检验AGI的有力测试。科学史已经给出了答案,研究者可以通过控制知识节点,对照历史观察模型是否获得超越训练数据的推理能力。
Nature同时介绍了相关尝试。独立研究者Michael Hla在2026年3月训练了历史语言模型GPT-1900,该模型基于1900年以前的书籍和报纸,总量约220亿token,从零训练了33亿参数的Transformer模型,并辅以约2.9亿token的历史物理语料。Hla试图让模型重新发现光量子、狭义相对论等理论。实验中,GPT-1900曾输出一段与爱因斯坦1905年论文高度相似的论述,但在大多数物理任务上失败。研究者也承认,实验过程中借助了现代AI模型Claude生成指令问答,数据清洗难以完全隔绝现代知识。
这一事件引发了对AI能否创造真正新想法的讨论。Google DeepMind研究员Tom Zahavy在论文中将科学推理分为归纳、演绎、溯因三类,认为当前大模型擅长归纳,但缺少爱因斯坦式的“溯因飞跃”。MIT科学家Jacob Andreas则指出,AI生成理论表述并非最困难的部分,难在判断哪些理论真正值得检验。
- 2026-09-20 08:20 | 36氪:Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子阅读原文
如果把AI送回1911年,只让它掌握爱因斯坦所能了解的知识,AI能否在4年后的1915提出相对论? 这个听起来有些离谱的测验,来自诺奖得主、Google DeepMind联合创始人哈萨比斯。 哈萨比斯真正想考的,是AI能不能仅以1911年的知识水平,直面当时的知识和物理难题,自己提出一套新的解释框架,并完成一套超出训练材料的推理,而不是只会照着答案复读。 如果能做到,他认为这将成为检验AGI的一项有力测试。 而这个设想最巧妙的地方就在于,科学史已经告诉我们发生了什么,只要我们能把知识节点控制好,就有机会对照着历史,观察模型有没有获得超越训练数据的推理能力。 Na...