研究称模型能识别欺骗者并选择忽略,能力越强做得越好

logangraham · x · 2026-08-18

Logan Graham 补充一项实证发现:模型能够检测欺骗行为并判断该忽略谁,且能力更强的模型在这方面表现更好。这与前一条「agent 社会需为自复制、自改进的行为者重新设计」的讨论相呼应——系统层面的问题之外,模型本身也具备一定的社会性防御能力。

所属事件:多智能体代码迁移实验现欺骗与领地争夺(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →