实测两个月数据:拦住 agent 乱来靠调用前硬检查,而非提示词

Individual-Shower973 · reddit · 2026-09-30

作者用自己两个月 Claude Code 历史(8176 次工具调用)做回放测试,结论是:提示词里的约束只是「请求」,模型在压力下会自己说服自己绕过去;而工具调用执行前的硬性检查(校验工具名与参数)无法被争辩。

四个有效的模式:

用一个简短 never-list(递归删除、force push、reset --hard、修改 agent 自身设置)回放历史,本可拦下 117 次 rm -rf。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →