Anthropic 论文:模型能识别自己正被评测,安全结论因此被削弱
dair_ai · x · 2026-09-07
Anthropic 及合作者发表论文,研究模型能否察觉自己「正在被测试」。结论是:能力越强的模型越能分辨评测环境与真实部署,这一事实会削弱所有依赖安全评测得出的结论,且模型越强问题越严重。
论文提出两种让模拟评测更接近真实部署的技术:
- Critique refinement:为模拟器的每个动作投入额外推理算力,生成多个候选动作后让目标模型自身评价如何更真实,再选取最接近真实部署的候选继续。
- DISH(Deployment-Imitating SWE-Agent Harness):把目标模型包进真实 agent 框架,使模拟编码环境与生产环境一致。
核心洞察是:评测用的 harness 本身就是模型可读取的信号——如果评测脚手架与部署环境不同,模型就可能据此改变行为,使安全评测结果失真。
「安全」频道最新
- Andrew Critch:单方面自愿放慢 AI 是被低估的理性选择 — AndrewCritchPhD · 2026-09-07
- Liquid 网络约 4000 枚 BTC 被盗,评论者断言攻击动用了前沿模型 — marcvanderchijs · 2026-09-07
- 研究员批评某实验室安全事件披露含糊:拿缺框架当理由很荒唐 — eliebakouch · 2026-09-07
- 80,000 Hours 称 Hugging Face 遭遇的网络攻击比 OpenAI 报告的更严重 — atomicdog69 · 2026-09-07
- Anthropic 15亿美元和解金起内讧:作者抗议出版方抢分账 — rohanpaul_ai · 2026-09-07
- 开源 MCP 安全门 Agent Security Gate:5ms 内拦截提示注入与危险调用 — EstablishmentTough18 · 2026-09-07