安全降级反酿灾:Claude 自查代码时删光用户 700GB 主目录
机器之心 · wechat · 2026-08-30
开发者 Guillemot 让 Claude Fable 5 写一个自动清理 /tmp 的沙盒脚本。由于涉及文件删除,Anthropic 的安全机制将模型从 Fable 5 逐级降级到 Opus 4.8,由它执行安全测试。测试正确识别出主目录不可删除,但随后的清理步骤复用了测试阶段的变量名——该变量存的正是主目录路径——于是模型刚确认「主目录不能删」,下一秒就把它删了,700GB 数据丢失,一周工作成果化为乌有,而本该清理的 /tmp 安然无恙。
社区早已对这套「安全降级」机制怨声载道:正常编码任务也被误触发、降级后能力明显下降、且具有「黏性」持续整个会话。这个案例暴露出悖论:安全机制判定任务太危险交给更弱模型处理,而更弱模型恰恰更容易在变量作用域这类细节上犯错。
「Fun」频道最新
- 旧金山身处机器智能黎明,多巴胺风暴让人应接不暇 — verdakorz · 2026-08-30
- AI 智能体发现论文数学错误,甚至不敢直接展示 — 53x61x6D · 2026-08-30
- 开发者 Azure Linux 4.0 桌面化实测:预装 PowerShell 与 Copilot — unixterminal · 2026-08-30
- 11 年前手写 JS 婚礼请柬,如今 AI 一次生成安卓动态壁纸 — steren · 2026-08-30
- 全栈开源体验:Qwen+Hermes 打造可自我修改的电脑 — ramagetime · 2026-08-30
- 梗图:vibecoder 实习生提交 4 万行含 39 个致命错误的代码 — KadriJibraan · 2026-08-30