让 Agent 变得无聊到可信:七道工程防护栏总结
arthaudm · reddit · 2026-09-22
作者反思用更好的 prompt 修复 agent 失败的思路:真正长期有效的方案最终都变成了模型之外的确定性代码。他总结出七道防护栏:
- 不可逆工具前的最小时间/证据要求:语音 agent 必须等对方先说话才能挂断,支付 agent 必须确认最终金额才能提交。
- 提案不等于执行:模型提议工具调用,由确定性代码校验金额、接收方、权限与当前状态。
- 可变状态唯一所有者:多个 agent 可以读,但状态字段只允许一个系统写。
- 每次写入后读回凭据:不要信任 200 响应,要回读对象确认真实可见。
- 重试前先做幂等检查:超时后先确认首次写入是否成功,盲重试会导致重复邮件和订单。
- 临时上下文设置过期机制:如「被 X 阻塞」需要关闭条件或 TTL,否则旧状态会泄漏到后续运行。
- 在真正的边界做人工审批:同时审核接收方和具体内容;代码场景中写代码和批准上线应分离。
核心观点:这些不提升模型智能,而是让模型错误的代价更低、更可见。
「编程与Agent」频道最新
- 儿童故事 App 的 agent 记忆难题:哪些细节该进永久记忆? — Miserable-Shock3552 · 2026-09-22
- 开发者用 Gemini Flash Lite 做近实时编辑助手,将开源为 Chrome 扩展 — Saboo_Shubham_ · 2026-09-22
- 本地 MLX 大战托管 API:两个 AI 决策模型对玩 Chrome 恐龙游戏 — usamawahabkhan · 2026-09-22
- 文件监听静默丢事件一个月:一次 agent 日志竞态 bug 的完整复盘 — ClaudeCdGuy · 2026-09-22
- D-RAC 文档切块法省 95.7% token,企业 RAG 摄取成本降 78%~86% — Yellow-AI-NLP · 2026-09-22
- Agent 工具调用超时后动作是否执行?一套确认机制设计方案 — felix_baron · 2026-09-22