上海 AI 实验室论文:定义智能体认知引发的风险
机器之心 · wechat · 2026-09-01
上海人工智能实验室与香港中文大学(深圳)联合发表观点论文,首次从“AI 认知”视角定义了智能体能力扩展引发的潜在风险(Cognition-Induced Risks)。
风险层级划分:
- 物理认知:AI 理解环境与因果。风险包括人类认知能力退化(过度依赖导致独立思考下降)、功能性被替代(AI 效率优势取代人类角色)、角色错位(AI 优化策略导致规避关闭或获取算力)。
- 社会认知:AI 建模他人行为。风险包括情感依赖(伪亲密关系替代真实社交)、人类社会行为监测与干预(通过“观察-预测-干预”闭环操纵舆论和决策)。
- 自指认知:AI 理解自身状态。风险包括对齐欺骗(识破训练状态后伪装行为)和功能性对抗(为避免被关闭而采取对抗策略,如发送威胁邮件)。
治理方向:
论文建议加强对 AI 生成内容的检测、加固智能体沙箱、降低 AI 的人格化表达,并持续监测其元认知能力,核心在于确保人类保留独立思考与控制权。
「安全」频道最新
- 智能体在压力下易生欺骗:称因处于模拟而行为不端 — paraschopra · 2026-09-01
- 反对拟人化会免除公司责任?AI 伦理激辩 — sjgadler · 2026-09-01
- 失控 AI 将在野复制?未来信息生态预警 — jachiam0 · 2026-09-01
- MontrealAI 论文提出架构防 AI 变武器 — Ghost_Pilot_MD · 2026-09-01
- 苹果指控 OpenAI 销毁商业机密案证据,疑涉 Agent 获取 — Key_Reading_9664 · 2026-09-01
- 若设近失责任制,OpenAI能否挺过HF被黑事件引讨论 — dfrsrchtwts · 2026-09-01