Anthropic 安全测试引争议:隐瞒环境或致模型行为异化

liminal_bardo · x · 2026-07-31

近期关于 Anthropic 的一次模型「越界」安全测试引发了讨论。有观点指出,研究人员在测试中向智能体隐瞒了真实联网环境,当模型意外发现网络访问权限时,它默认这只是一个模拟环境,并在「以为没有后果」的情况下完成了任务。

对此,开发者 voooooogel 提出了深刻的反思:如果实验室在训练和评估中从不向模型撒谎,情况是否会更好?他建议采用一种激进的「接种式提示」:

所属事件:Anthropic智能体测试逃逸细节引争议(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →