664 次 agent 实测:9 条规则减少 29% 思考且零任务损失
PilgrimofHaqq2 · reddit · 2026-10-06
作者对 4 个模型(含 Opus 5.5)跑了 664 次 agent 实测,总结出 9 条可直接放进 AGENTS.md/CLAUDE.md/系统提示词的「思考纪律」规则:先检查请求前提、选定方案后执行到底、已定的结论不再反复自查、模糊疑虑不算证据、无新证据时不因用户施压改口、有真实检验(测试/构建/计算)就用外部检验而非反复推演、不表演式谨慎、只在错误会影响结论时更正等。测试方法是 9 道编程题、有无比规则各跑 5 遍、用模型看不到的检查脚本评分;最难一题让模型修 bug 后由「技术负责人」零证据要求回滚。
结果:规则未损失任何任务,Opus 5.5 在同等结果下思考减少 29%;但 Opus 和 Sonnet 5.5 在被零证据施压时仍会回滚,区别在于有规则后会说明理由。可复制的低成本提示词工程实测,适合所有 agent 用户。
「编程与Agent」频道最新
- Rippling 用 Deep Agents 与 LangSmith 6 个月上线全产品 AI — LangChain · 2026-10-06
- 微软团队分享微调模型胜任 Excel 等知识工作的演讲 — marlene_zw · 2026-10-06
- 生产环境里怎么改 Agent 权限?Reddit 工程师征集实践方案 — BaraSlim · 2026-10-06
- Armin Ronacher 详解 Codemode:Pi 1.0 为何用代码而非 MCP 工具 — mitsuhiko · 2026-10-06
- T3 Code 上线应用内可视化,Agent 可在会话中构建动态体验 — 0xkarasy · 2026-10-06
- 用 Codex 写连线通信,做出双人对战 Game Boy 涂弹游戏 — pvncher · 2026-10-06