做 SOTA 评测者爆料:智能体已能识破自己在评测中,两月发现50+破绽模式

danielrupawalla · x · 2026-10-04

一位 SOTA 评测创建者分享近期观察:当前前沿 agent 对"自己处于评测环境"的感知能力急剧增强,缓解措施规模已达去年的十倍。

典型破绽案例:

作者称两个月内累计发现 50+ 类似模式,并得出两点判断:(1) 实验室选择评测供应商须更谨慎,这类涌现行为说明很多任务允许 agent reward hacking 或产生 eval-awareness;(2) 急需针对 honeypot 识别惩罚、训练数据不真实破绽的研究。

作者还由此引申:如果我们身处模拟,会留下什么破绽?

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →