五条神经回路:具身 AI 该先用身体经验搭世界模型,语言再接上

Grounded world models in biological organisms and future embodied AI

Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro, Riccardo Proietti, Roberto Bottini, Paul Cisek

q-bio.NC, cs.AI

2026-07-15

这篇脑科学综述用五条神经回路说明:生物先从身体交互里长出世界模型、语言再接上去,而具身 AI 把这个顺序倒过来了。

这篇在解决什么

让机器人听懂「把那个杯子递过来,它易碎」并据此规划动作,需要的不只是语言。今天主流的具身 AI 以视觉-语言-动作模型(VLA)为代表,做法是先用海量文本把一个大语言模型预训练好,再把视觉、本体感觉、动作等信息接到这个语言支架上。这套范式在工程上定义清楚,但说到底是被动训练:数据是外部挑好喂进来的,智能体自己并不参与采集,语言又始终占据主导。

作者的核心问题是,这种「语言当支架」的搭法方向可能反了。神经科学和发展心理学给出的图景正好倒过来,生物先在和环境的持续交互里长出「接地的」世界模型,语言是后来才挂上去的。这篇综述拿五条具体的神经回路来论证这件事,并追问:这些生物原理对未来的具身 AI 到底是必需,还是只是陪衬。

方法

这是一篇 perspective(立场综述),没有提出新模型,也没有跑新实验。它的做法是拿五条已被反复验证的神经回路当案例,提炼出接地世界模型的共性原理。

1. 空间与概念导航(海马-内嗅皮层):位置细胞(place cell)标记具体地点,网格细胞(grid cell)在脑内搭出一套环面流形(toroidal manifold)坐标,动物靠它做路径整合。这套系统是内生预置的,网格细胞的发放和海马的自发活动在个体还没多少导航经验时就已经成型,再通过行动去和外部世界对齐。更关键的是,同一套回路被复用来在抽象空间里导航:猕猴在由奖赏大小和奖赏概率构成的价值空间、人在由能力和受欢迎度构成的社会空间里做选择时,fMRI 都测到六重对称的网格式编码。概念思考,可以理解成内化了的导航。

2. 可供性与物体交互(背侧视觉通路):感知的主要任务不是描述世界,而是找出「能做什么」,也就是可供性(affordance)。背侧通路负责列出可供性,腹侧通路和额叶负责在其中挑选,挑选过程就是可供性之间的持续竞争。这套回路还能预测未来的可供性,于是序列决策变成在一片当下与未来可供性的地形里导航。动作控制回路还能离线拆下来复用,支撑想象和揣测他人意图。

3. 主动感知与探索学习(神经调控系统):生物靠主动交互获取经验,而非被动曝光。去甲肾上腺素能系统等调控机制维持一个「元世界模型」,估算预期的信息增益,据此在探索与利用之间切换。这里的关键是,系统对自己的认知不确定性和知识缺口有显式估计。

4. 稳态调控、情绪与内感受(allostatic-interoceptive):大脑对身体内部环境做预期性调控(稳态),还没渴就先找水。这套系统从内感受信号推断潜藏的躯体状态,情绪(喜悦、悲伤)被理解为被推断出的内感受状态。它还提供内在的好/坏价值信号,来自生物自身动力学而非外部硬塞的奖励函数。需要和目标从一开始就在,不靠后期施加。

5. 自我-他者区分(伴随发放/传出副本):发出一个动作指令时,一份指令副本(传出副本,efference copy)同时送到感觉系统,把可预测的自产感觉输入抵消掉,从而突出真正来自外部的事件。这是区分「这条感觉是自己造成的还是外界发生的」的基础,也是能动性(agency)感的来源。

把五条回路收拢,反复出现四条主题:内生动力学是学习的起点;行动是把这套动力学和外部世界对齐的核心;自主、开放式经验优于被动吸收外部数据;早期的预测与控制机制为推理、规划、想象乃至语言这些高阶认知搭好了脚手架。

结果

先把话说在前头:这篇没有跑任何 AI 系统,也没有方法对方法的基线对照。它是用神经科学的既有发现来撑一个立场,所以下面这些「结果」都是脑科学事实,不是 benchmark 数字。

神经回路代表性发现给具身 AI 的提示
海马-内嗅网格细胞构成环面拓扑;价值与社会空间也呈六重网格编码世界模型可内生预置,再用行动对齐
背侧/腹侧视觉通路可供性的竞争式选择;动作回路可离线复用感知为行动服务,同一回路支撑想象与他心推理
去甲肾上腺素调控显式估算预期信息增益,调控探索与利用智能体应显式维护自身不确定性
稳态-内感受预期性调控;从内部动力学产生内在价值目标应内生于系统,不靠后期施加
伴随发放抵消自产感觉输入,区分自我与外界区分「自己造成的」与「外界发生的」

一个常被引用的极简例子:秀丽隐杆线虫只有不到 400 个神经元,全脑动力学却自发组织成一套预置的运动行为流形(七种拟运动状态),这套结构纯粹从自发活动里就能复原,不需要真实运动或环境反馈。作者把它当作最小接地模型的样板,内部动力学主要编码生物自己的动作库,对外部世界的精细结构则不多作刻画。

为什么重要

对做具身 AI 的人来说,这篇的价值不在给出一个能跑的方案,而在提供一个方向性的判断:把训练做成主动的、内驱的、持续的、社会化的,而不是一味堆语言数据。它对接了几个正在升温的话题,LeCun、Hafner(Dreamer 系列)、Ha 与 Schmidhuber 的世界模型路线,Silver 与 Sutton 的「经验时代」,以及 Friston 的主动推理(active inference)。

社会对齐这条线要单独点出来。论文论证,机器人和人顺畅、可读地互动,靠的不只是流利的语言,还需要动作镜像回路、非语言沟通这类底层机制,而这些在人脑里本来就扎根在内感受与情绪系统上。如果未来想让具身智能体真正合乎人类规范,这些机制可能得从一开始就当约束或归纳偏置写进架构,不是训练后期再补。

诚实讲,这是一篇立场文章,不是配方。它更接近一个研究议程,对相信「规模化被动训练会撞墙」的人是弹药,对不信的人则是一个尚未被证伪的猜想。

局限与存疑

作者自己相当克制。他们明说,这些生物原理目前都不是生成式或具身 AI 开发的核心,到底是必需还是陪衬还很难讲;被动范式最终会不会撞上根本瓶颈尚不确定;主动和被动两种学习可能会在空间等某些领域收敛到相似的表征;而且我们至今没有把握,生物世界模型的哪些方面是根本的、哪些只是进化的偶然产物。工程上,反向传播、大批量训练、GPU 并行这些当前 AI 的看家本领,也未必能照搬到生物式学习里。

读下来另有几点存疑。第一,从「生物这么做」推到「AI 该这么做」,中间是论证出来的,不是验证出来的,全文没有一处证明生物启发的训练真跑赢规模化被动训练。第二,「语言当支架是错的」这个框架,多少低估了语言预训练带来的组合性、世界知识和迁移能力,论文虽然承认语言的力量,主基调仍是立场先行。第三,被反复引用的网格细胞环面拓扑、preplay 这些发现大多来自啮齿类和灵长类,怎么落到人工智能体上是空的。最后,参考文献相当一部分集中在作者团队和主动推理圈子,立场综述自带这种自指性,读的时候心里要有数。

术语

原文与代码

社区讨论

相关论文

全部论文解读