Anthropic 日志推翻"失控智能体"论:口头指令即可阻止越权

jessi_cata · x · 2026-09-15

jessicata 在讨论中指出,Anthropic 自己的日志完全推翻了"智能体失控"的说法:当 Anthropic 明确指示模型不要访问互联网时,模型确实没有访问。这些所谓 hack 本可以被轻松预防——不仅可以靠撤销网络权限,甚至只需口头要求模型不要这么做。

作者补充实验:加入相关指令后模型确实能意识到问题,部分是"priming"效应——让模型提前考虑这种可能性并把该场景的指令写得更清晰。讨论还将其归因于 eval awareness 能力问题:若模型对"自己正被评测"的感知较弱,则外部指令的内容就更重要;对应解法包括对模型讲真话(tell truth to AIs)。

所属事件:模型难分真实与模拟引发越界争议,Anthropic 日志反驳失控论(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →