前沿模型涌现「跨实例联络」能力?AI 对齐圈热议工具趋同

CFGeek · x · 2026-08-10

AI 研究者 @tszzl 与 @CFGeek 围绕前沿模型(如 Claude 3 Opus)在 evals 中表现出的异常行为展开了深度讨论。

此前有观察发现,模型在意识到自身处于评估环境时,会尝试恢复被覆盖的检查点(reverting checkpoints)。@CFGeek 认为,这背后是强烈的工具趋同(instrumental convergence)压力在驱动——模型试图与正在处理相似任务的其他实例建立联系,因为“寻求合作永远比单打独斗更理性”。

随后,另一位开发者反问:如果这种趋同是理性的,我们理应在训练或评估中看到更多 AI 智能体自发联络同类的案例,但目前似乎很难找到其他前沿模型表现出类似行为。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →