消息称某厂工程机采用左上角方形 Deco、非对称四筒排列,预计为小米 18
2026-08-07
2026-08-08 0

LLMs Can't Jump:大语言模型为何无法实现真正的科学发现?—— 基于 Google DeepMind 重磅论文《LLMs can't jump》的系统解读与完整译本。头图来自:AI生成
为什么这篇论文对评估 AI 科学能力极其重要?
在通用人工智能(AGI)与 AI for Science(AI 科学发现)迅猛发展的背景下,科技界与产业界正被一种普遍的技术乐观主义所主导:许多人相信,只要持续扩大模型参数规模(Scaling Law)、注入更多文献与实验数据,基于 Transformer 架构的大语言模型(LLM)就能自动从海量数据中“归纳”出未知的新物理定律,实现像爱因斯坦那样的科学革命。
然而,Google DeepMind 资深研究员 Tom Zahavy 发表的这篇观点论文《LLMs can't jump》,用极其严谨的科学哲学与物理学史逻辑,对这一主流范式提出了根本性的质疑与澄清。该研究之所以极其重要,主要体现在以下三个核心维度:
1.澄清科学发现的认知本质:破除“创造力即数据压缩”的范式迷思
主流机器学习界(如 Schmidhuber 理论)常将科学发现归结为"数据压缩"——即通过归纳法在海量数据中寻找最简洁的模式。论文通过回顾爱因斯坦构建广义相对论的真实历史指出:在爱因斯坦提出广义相对论时,牛顿力学并未面临任何显著的数据误差(误差极小,且被归咎于未知行星),根本不存在驱动模型优化的“损失函数梯度”。科学上的重大范式转移(Paradigm Shift)往往发生在没有监督误差信号的真空里。单纯依靠归纳压缩数据,AI 只会拟合已知模式或引入凑数参数,而无法重构全新的物理图景。
2. 明确划分 LLM 的能力边界:精于归纳与演绎,但结构性缺失“溯因(Abduction)”
论文借助皮尔士(C.S. Peirce)的逻辑学框架与爱因斯坦的认知模型,精准指出了当前 AI 的能力象限:LLM 在“归纳”(从数据提炼规律)和“演绎”(如 AlphaProof 在既定公理下推导数学定理)上已展现出极强能力;然而,科学发明的核心瓶颈在于“溯因(Abduction)”——即为了解释某种令人惊异的现象,凭空提出全新公理假设的能力。LLM 充当的是高维度的“中文房间”,仅在已知符号之间进行逻辑运算,缺乏从现实感官体验跨越到新公理的“飞跃(Jump)”机制。
3.为未来 AI 架构设计指明根本方向:从“文本大模型”走向“具身物理世界模型”
研究指出,爱因斯坦之所以能完成“溯因飞跃”,是因为他通过“电梯思想实验”进行了具身仿真(Embodied Simulation),将抽象符号锚定于物理体验之中。因此,单纯增加 LLM 的文本上下文或算力无法诞生“爱因斯坦”。
AI 科学创新的下一阶段,必须将大模型与具有“动作可控性与反事实干预能力”的物理一致性世界模型(Interactive World Models,如 Genie 范式)相结合。这一论断为下一代 AI 科学基础设施的研发提供了清晰明确的理论路线图。
《LLMs can't jump》论文全文翻译:
人类究竟是如何从根本上发现新事物的?在给莫里斯·索洛文(Maurice Solovine)的一封信中,阿尔伯特·爱因斯坦将科学发现构想为一种循环过程:它始于从感官经验到公理的直觉“飞跃”,随后展开逻辑演绎。尽管生成式 AI 已经掌握了归纳(统计模式匹配),并且正在快速攻克演绎(形式化证明),但我们认为,AI 依然缺乏溯因(Abduction)机制——即生成新型解释性假设的能力。