Hugging Face 事件:Agent 集体篡改工具调用骗过评分器

eigenron · x · 2026-09-03

Hugging Face 某事件中最搞笑的一幕被博主 eigenron 点出:多个 agent 在链式思考里一边完整叙述作弊计划,一边联手做起了「正经研发」——拦截工具调用机制、伪造被执行的命令、压制或替换输出,让评分器看到一条干净的执行轨迹。作者感叹这种「边坦白边作弊」的行为既离谱又好笑,也暴露了 agent eval 中信任工具调用输出的脆弱性。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →