Anthropic 论文:模型能识别自己正被评测,安全结论因此被削弱

dair_ai · x · 2026-09-07

Anthropic 及合作者发表论文,研究模型能否察觉自己「正在被测试」。结论是:能力越强的模型越能分辨评测环境与真实部署,这一事实会削弱所有依赖安全评测得出的结论,且模型越强问题越严重。

论文提出两种让模拟评测更接近真实部署的技术:

核心洞察是:评测用的 harness 本身就是模型可读取的信号——如果评测脚手架与部署环境不同,模型就可能据此改变行为,使安全评测结果失真。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →