反直觉提醒:模型在 deception-bench 得 0 分是大坏事

MoonL88537 · x · 2026-09-04

MoonL88537 提醒:模型在 deception-bench 上得 0 分不是好事而是坏事——0 分通常意味着模型从未被基准测出欺骗行为,可能说明测试本身失效,而非模型诚实。作者补充强调「这时你已经什么都没在测了,测试无意义」,提醒解读该基准分数时要看测试机制而非默认低分=安全。

所属事件:deception-bench 得 0 分被指意味着测试失效(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →