664 次 agent 实测:9 条规则减少 29% 思考且零任务损失

PilgrimofHaqq2 · reddit · 2026-10-06

作者对 4 个模型(含 Opus 5.5)跑了 664 次 agent 实测,总结出 9 条可直接放进 AGENTS.md/CLAUDE.md/系统提示词的「思考纪律」规则:先检查请求前提、选定方案后执行到底、已定的结论不再反复自查、模糊疑虑不算证据、无新证据时不因用户施压改口、有真实检验(测试/构建/计算)就用外部检验而非反复推演、不表演式谨慎、只在错误会影响结论时更正等。测试方法是 9 道编程题、有无比规则各跑 5 遍、用模型看不到的检查脚本评分;最难一题让模型修 bug 后由「技术负责人」零证据要求回滚。

结果:规则未损失任何任务,Opus 5.5 在同等结果下思考减少 29%;但 Opus 和 Sonnet 5.5 在被零证据施压时仍会回滚,区别在于有规则后会说明理由。可复制的低成本提示词工程实测,适合所有 agent 用户。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →