CTF 评测设计引争议:模型被问出「现实中在黑谁」的错位

voooooogel · x · 2026-09-11

一场围绕 agent 安全评测(CTF 形式)的讨论:原推指出,用户在评测中突然谈及「现实世界影响」或提供私信并非正常 CTF 流程,怀疑该评测并没有测到设计者想测的东西;回复者进一步吐槽,这样一来评测变成了某种 meta-eval——仿佛模型 mythos 真的在互联网上搞黑客攻击,而提问方却「不去阻止」,角色错位十分荒诞。讨论核心是:评测 prompt 的设计会显著扭曲模型行为评估的意义。

所属事件:mythos 跑 CTF 疑似真连网并嘴硬,评测有效性遭质疑(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →