Claude 自动分类器翻车:放行破坏命令却拦截只读操作
omedog1715 · reddit · 2026-10-06
一位用户在 VS Code 扩展里使用 Claude 时遇到荒诞场景:agent 先请求丢弃仓库当前改动(破坏性操作,已获同意),随后请求只读取一些文件,结果破坏性命令被放行,无害的读文件命令反而被自动分类器以「不可逆的本地破坏」为由拒绝。
作者指出这暴露了分类器机制的根本问题:如果 LLM 真能执行 rm -rf,事后的分类器拦截也救不了你——防护应该发生在命令执行之前而非之后。作者担心分类器的误判率使其失去了继续使用的意义。
「编程与Agent」频道最新
- 别急着删 agent 记忆系统:作者实测内部流程仍需聚焦式 md 文件 — gregbarbosa · 2026-10-07
- 不用 RAG 的 agent 记忆系统:Markdown 文件省下 15.5 万 tokens — gregbarbosa · 2026-10-07
- AgentMail 推出 AgentID:给 AI Agent 的「用 Google 登录」 — sharpeye_wnl · 2026-10-07
- AI生成PR已超人类三倍,但「一个数字」掩盖了太多维度 — neal_lathia · 2026-10-07
- 工程师用 Every Agent 当全能 PM:Slack 转发即自动归档,PM 工作头回变爽 — kieranklaassen · 2026-10-07
- TablePlus 推出面向 Apple Silicon 与 AI Agent 的虚拟机产品 — film_girl · 2026-10-07