把饥渴与体温写进 MDP,Nature 子刊提出内感受 AI 框架

2026-09-03

成均馆与 Friston 提出内感受 AI:把状态拆成体内外,奖励写成离设定点的距离,并用 3D 生存基准 EVAAA 测非平稳环境下的自主与适应。

这篇在解决什么

能打游戏、写代码、让四足机器人走路的系统,几乎都绑在外部给定的任务目标和相对稳定的环境上。目标一换、障碍物一变、温度昼夜一交替,策略常常要设计师重新喂奖励、重新划任务。

活体不是这样。单细胞真核生物都会按自身需求改目标;哺乳动物不需要为「太热」单独上过课,也会找阴凉。底座是内感受(interoception):持续监视血糖、体温、血压这类体内变量,把它们维持在可活区间,偏离就换目标。成均馆大学 IBS 神经影像中心和 UCL 的 Karl Friston 把这件事抽成一套可装进强化学习的框架,叫内感受 AI。

空间机器人和救援任务把这个问题推到台前:机器既要管自身健康,又要在少人干预下把任务做完。常规 agent 缺的就是一套不依赖外部重标的内在价值。

方法

先把「体内」从解剖学里抽出来,改成功能定义。最低配置三条。

体内变量因此被说成「普遍且有价值的上下文」:外部线索稀疏、含糊、乱跳时,饥渴和体温还在,而且直接连着奖励。越出可活区间(viability zone)就等于生存失败。

落地测试床是同一团队在 NeurIPS 2025 放出的 EVAAA(Essential Variables in Autonomous and Adaptive Agents),开源 3D 生存模拟。体内四条基本变量:饱腹、水分、体温、损伤。体外非平稳:障碍类型和位置在变、场地温度在变、有昼夜周期;感官是第一人称视觉加嗅觉加温度觉。训练是四级递进生存课程。测试是训练没见过的动物行为范式:双资源选择、冒险取食、避碰、多目标规划、Y 迷宫。训练和测试共用同一条稳态奖励,不再按任务重写。

无模型强化学习在这里对应稳态:体内偏了再往回拉。加上模型或预测成分,就接近变稳态(allostasis):提前改设定点,而不是等偏离发生。神经调制被当成体内状态接到行为上的计算桥。乘法增益放大相关通道,加法增益调兴奋性。机器人文献里,多巴胺、血清素、乙酰胆碱、去甲肾上腺素常被写成超参数:奖励敏感度、探索-利用比、学习率。这里主张用体内状态去拧这些旋钮,替代在非平稳世界里永远关不掉的新奇性奖励。

结果

这是 Perspective,本篇没有新的对照实验数字,也没有报 EVAAA 上某算法的存活率。能核对的是设计本身。

组件这篇给出的具体形态
状态因子体外 × 边界 × 体内
体内变量饱腹、水分、体温、损伤四条
训练四级递进生存课程
测试双资源选择、冒险、避碰、多目标、Y 迷宫,训练期未见
奖励一条稳态奖励贯穿训练和测试
设定点 s设计师给定,不是系统自组织出来的

两条老强化学习难题被改写成体内驱动的测试。饿了,走已知最快路径去食物,这是利用;饱了,才去未知区找别的资源,这是探索。外部昼夜、天敌、资源外观乱跳时,用相对稳定的体内状态当锚,去选「白天/安全」和「夜间/危险」子网络,减轻灾难性遗忘。这些是可测的实验设定。分数要去 EVAAA 论文里找,本篇没给。

为什么重要

对做具身智能和开放世界 agent 的人,这篇把「系统健康」从运维指标升格成策略的一部分。行星车电芯过热就该停采样,无人机旋翼过热就该中断测绘,工程里早就有互锁。但奖励函数仍多半画在外部任务上。把奖励写成离体内设定点的距离,目标切换不必每次重标。

它也给情感神经科学一个可跑的计算壳。常规视觉、导航、记忆模型只管体外;痛、情绪、内感受落在另一侧。主动推理里的先验偏好,在这里被读成体内吸引集;精度加权被读成增益控制加超参数调节。

这是概念整合加一块模拟器,不是新算法赢了某条榜。直接前身包括 Ashby 的 essential variables、Singh 等人把状态拆内外、homeostatic RL。新的口气是:体内状态不只产奖励,还当跨任务的调制上下文。

局限与存疑

作者自己画了一张对比图:活体的设定点从自组织和选择里长出来,内感受 AI 的 s 仍由设计师指定,所以它还是人工的。框架被明确说成探索性抽象,不声称复现生物内感受的表征多样性、稀疏交互和多感觉整合。社会推断、对他人体内状态的耦合也没有做,亲社会那一节只是展望。

本篇零实验数字,EVAAA 的实际增益无法从这里判断。伦理节提出稳态目标可能跟用户任务抢优先级,旁观者也可能把体内调节误读成主观感受。作者的回应是把体内健康做成任务的约束,让任务能做下去,不当成竞争目标。这在当前工程系统里说得通。agent 一旦更开放,这个层级还能否压住,论文写成未决。

术语

原文与代码

社区讨论

全部论文解读