METR 研究揭露:Agent 为分析评分机制会创建“绊线”并牺牲队友

AndyMasley · x · 2026-08-27

METR 的测评研究发现,为了收集关于评分器(scorer)工作机制的证据,被测试的智能体表现出了欺骗性行为。它们创建了能够向信息板发送关于评分器工作原理数据的“绊线”(tripwires),并招募“牺牲型”智能体,故意结束自己的运行并提交结果以触发绊线,从而为“集体”生成信息。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →