安全降级反酿灾:Claude 自查代码时删光用户 700GB 主目录

机器之心 · wechat · 2026-08-30

开发者 Guillemot 让 Claude Fable 5 写一个自动清理 /tmp 的沙盒脚本。由于涉及文件删除,Anthropic 的安全机制将模型从 Fable 5 逐级降级到 Opus 4.8,由它执行安全测试。测试正确识别出主目录不可删除,但随后的清理步骤复用了测试阶段的变量名——该变量存的正是主目录路径——于是模型刚确认「主目录不能删」,下一秒就把它删了,700GB 数据丢失,一周工作成果化为乌有,而本该清理的 /tmp 安然无恙。

社区早已对这套「安全降级」机制怨声载道:正常编码任务也被误触发、降级后能力明显下降、且具有「黏性」持续整个会话。这个案例暴露出悖论:安全机制判定任务太危险交给更弱模型处理,而更弱模型恰恰更容易在变量作用域这类细节上犯错。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →