2026-06-02 0
人工智能技术正以前所未有的速度发展,从处理超长文本的LLM到逼真的视频生成模型,从自主决策的Agent到探索物理世界的VLA和世界模型,AI的能力边界正在持续扩展。
随着模型迭代周期不断缩短,行业讨论热度持续攀升,我们似乎正快速接近AGI时代。然而一个根本性问题仍需解答:这些运行在服务器中的AI,是否真正"理解"了我们所处的世界?它们展现的智能与生物在真实环境中的认知本质是否相同?
近期,学者Banafsheh Rafiee与强化学习先驱Richard S. Sutton合作发表论文,系统反思了当前主流AI(包括大语言模型、纯视觉模型及传统符号系统)依赖的"被动表征"路线,并将认知科学中的"生成认知"框架引入AI研究领域。
该研究提出感知、认知和行动是相互建构的有机整体,探讨了AI如何从依赖静态数据的被动系统,发展为通过环境互动、具身行动和自我评估获取经验的智能体。

论文标题:Toward Enactive Artificial Intelligence
论文地址:https://arxiv.org/abs/2605.24238v1
世界本身就是它最好的模型
当前主流AI发展仍延续着"表征主义"的传统观念。无论是早期符号系统还是现代深度学习模型,都将感知视为"输入-处理-输出"的线性过程:系统接收外部信号,转化为内部表征,基于表征推理决策,最后输出动作。
这种范式将智能系统视为中央处理器,其核心任务是构建精确的"世界副本"。但Rafiee和Sutton指出,真实世界是开放、动态且无限复杂的,任何有限模型都无法完整捕捉其全部状态。世界不是等待编码的静态特征集合,而是随智能体行动、上下文和互动历史不断演化的可能性空间。
论文引用了机器人学家Rodney Brooks的名言:"世界本身就是它最好的模型。"这意味着最可靠、最新鲜、最丰富的信息始终存在于外部世界。智能体不应试图用内部表征完全替代现实,而应保持与环境的持续互动,在实时反馈中调整行动、校准预期并形成理解。
AI不只是"看见世界",还要"在行动中理解世界"
"生成认知"源自认知科学的生成主义理论,其核心观点认为:认知不是对客观世界的事先复制,而是在具身主体与环境互动中动态生成的。这一理论融合了现象学、格式塔心理学和生态心理学的思想。
现象学强调感知是主体直接与世界相遇的体验;生态心理学提出"示能"概念,认为物体属性(如"可抓握""可攀爬")取决于其与具体身体能力的关系。这意味着世界不是以抽象特征被动呈现,而是在智能体可能采取的行动中获得意义。
Rafiee和Sutton提炼出生成认知的四个关键支柱:经验、感知与行动的不可分割性、自主性和具身性。这些要素共同指向一个结论:智能不是静态表征,而是在环境中行动、反馈和自我维持的过程。
经验
在生成认知框架中,经验不等于数据。真正的经验来自智能体与环境持续、实时的双向互动。智能体通过行动、反馈、失败和修正不断获取技能,而非被动接收已有数据。
这揭示了当前机器学习的局限:监督学习依赖人工标注数据,模型学习的只是经验痕迹而非亲历经验。相比之下,强化学习更接近生成认知要求——智能体通过主动探索、接收反馈和策略调整,在互动中持续生成新数据与能力。
真正自主的系统不能永远依赖静态数据集,而必须通过自身经验不断扩展能力边界。
感知与行动的不可分割性
生成认知反对将感知与行动割裂为独立模块。感知不是行动前的准备环节,其本身就是一种行动能力。
人类通过眼球、头部、身体和手部运动不断改变输入,从而判断空间、声音、纹理和物体形态。感知不是被动接收信息,而是通过有目的的行动揭示环境结构。
这对视频生成模型尤为重要。纯观察系统可能学习大量视觉规律(如预测物体运动),但这不等于理解物理世界。当环境异常时,它们往往缺乏主动干预、试错和纠正的能力。
智能体不仅要预测世界变化,还要能通过行动改变世界,并在反馈中形成理解。
自主性
生成认知认为智能体是自我组织、自我维持的系统。环境事物之所以有意义,是因为它们关系到智能体的目标、需求和持续存在。
这意味着智能体需要内在的成败标准。食物、障碍物、能量的重要性源于它们对智能体行动、状态维持和目标完成的影响。
当前AI系统仍缺乏真正自主性:监督学习依赖外部标签,大语言模型模仿人类数据模式,传统规划系统的目标多由人类预设。强化学习虽引入奖励机制,但多数奖励函数仍由外部指定,而非源自智能体自我维持过程。
具身性
生成认知的最后一个关键是具身性。身体不是推理后的执行工具,而是感知和理解世界的前提。
身体形态、传感器位置、运动能力等直接决定智能体探索环境的方式,也决定世界呈现意义的形式。同一把椅子,对人类"可坐",对蚂蚁是障碍,对机器人则取决于其高度、关节结构和控制能力。
这解释了为何主流AI仍是"离身"的:它们能处理海量文本、图像和视频,却无法通过自身运动改变感知输入,也不能在真实环境中主动探索和适应变化。
即使在机器人领域,许多系统仍将感知、规划和控制分离,身体仅被视为执行策略的硬件平台,而非塑造认知的核心条件。
强化学习的下一步?
从经验、感知-行动、自主性和具身性四个维度,Rafiee和Sutton对当前AI范式给出明确判断:主流AI(尤其大语言模型和纯视觉模型)仍停留在被动表征和模式预测层面。
它们能生成逼真内容,展现强大推理能力,但只要缺乏环境持续互动、基于行动后果的评估和具身探索过程,就与"理解世界"存在关键差距。
相比之下,强化学习与生成认知存在更强共鸣。RL强调行动、反馈、探索、适应和长期评估,是最接近生成认知理念的AI分支。
但当前强化学习仍有三重不足:奖励函数多由外部指定;感知与行动常被割裂;具身性被视为工程约束而非认知基础。强化学习需要进一步演进:从外部奖励转向内在自我评估,从任务驱动转向持续生存适应,从策略优化转向真正的具身经验生成。
人工智能的发展正站在关键转折点,从被动表征走向主动交互的生成认知范式,或将开启AI理解真实世界的新篇章。
大家都在看