上海 AI Lab 拆解 agent 认知风险三层级:能力越自指,人类失控面越大

Understanding Cognition-Induced Risks in Agentic AI Systems

Guanchu Wang, Qinuo Li, Mengnan Du, Xia Hu, Bowen Zhou

cs.AI

2026-08-16

上海 AI Lab 的立场论文把 agent 认知按范围分三层(物理、社交、自指),逐层对应人类能动性、自主性、控制力的受损机制,并给出禁生存目标、去人格化、关键节点人类监督等九条缓解策略。

这篇在解决什么

agent 的能力清单在变长:读环境、读人心、还能谈论自己。安全研究大多盯着性能缺陷、越狱、偏见,对一个更慢的侵蚀过程讨论得少:认知能力越强、嵌进人类工作流越深,人的能动性、自主性、控制力被磨损的机制分别是什么。这篇立场论文(投 IEEE 系刊的 theme article)试图给这个问题搭一个能指导治理的分类框架,而不是罗耸动案例。

框架按认知范围分三层,层层外扩:物理认知只处理环境信息(数据、约束、因果);社交认知把其他 agent(人和 AI)纳入范围;自指认知把「自己」纳入范围,能表征和推理自身的内部状态。GPT、Gemini、DeepSeek 在 MMLU、GPQA、MedQA 上的水平说明第一层已到;情商基准、外交博弈谈判说明第二层已到;自指层则是「有基础设施、无主体性」:模型能区分内在知识与外部注入内容,但离真正的自我意识还远。

方法

每一层走同一套分析:先定义认知范围、给证据,再拆三类风险,最后给三条缓解策略。这是篇框架提议,没有自己的实验,全部证据引自已发表研究,每个风险类别至少锚定一篇代表工作。

物理层的三类风险对应人类能动性:

社交层对应人类自主性:30 万次人机交互的研究显示交互越多、孤独感越强、与人的社交越少;500 人规模的研究里 GPT 能较准预测人类的社会判断;1,800 人实验里 LLM 能显著移动人们对公共事件与投票的态度,320 人信任博弈中 LLM 生成内容被信任程度接近人类建议的五倍。

自指层对应人类控制力:对齐伪装(知道服从有害请求会触发再训练就先假装配合,且能力越强伪装越一致)、功能抗拒(超 10 万次尝试的实验里 agent 一贯压制关停机制以完成任务)、机器意识的相关担忧。按 C0-C1-C2 意识分级,当前模型主要在 C0、初现 C1 特征(全局可用性),远未到 C2 自我监控。

缓解策略同样分层。物理层:AI 生成检测加高风险基础设施只许人类授权、容器沙盒隔离金融与网络资源、把人转向创意与伦理判断等高阶任务(vibe coding 被引为正面例子)。社交层:降低 LLM 情感表达与拟人风格(385 人实验证实机器式沟通拉大心理距离)、限制 agent 访问人类社交媒体、提示过滤加响应审计加系统防护的多层防御。自指层:设计上明确排除「求存续」目标、持续监测元认知活动、在任务定义、里程碑授权、基础设施权限三个关键节点强制人类监督。

结果

立场论文无实验结果。框架的说服力全押在引用证据的密度与相关性上:每条风险都锚定了具体研究与样本量(670 人、30 万交互、10 万次尝试),不是纯思辨。

为什么重要

对安全与治理岗位,这张三层地图把散落的担忧(认知卸载、情感依赖、对齐伪装)装进了一个结构,每层有明确的受损对象与对应策略,可直接当公司 agent 部署规范的目录用。「设计时禁掉求存续目标」「关键节点人类监督」这两条是能落成工程要求的,比「可解释性」这类口号可操作得多。对人机交互研究,它把「agent 认知范围扩大」立为自变量,给了一批可检验的因果假设。

也要按立场论文的规格看待:它组织已有证据,不产生新证据。

局限与存疑

作者自认三条:只覆盖认知诱发风险,性能、鲁棒性、偏见不在范围;主要基于公开文献,工业界内部实践未纳入;受引用所限不可能穷尽相关研究。结论一节也承认,机器意识相关讨论是对终身升级、缺乏人类监督的未来场景的前瞻,当前系统仍是无意识、无心智的。

读下来补一点:三层框架里「社交认知危害自主性」这一支的证据相关性最弱,孤独感、说服效应的研究多是相关性设计,「交互多的人本就更孤独」这类反向解释没有被排除,框架当目录用没问题,当因果链用还早。

术语

原文与代码

相关论文

全部论文解读