人工审批常不是有效控制
MediaPositive4282 · reddit · 2026-07-19
作者认为,很多 agent 系统里的“人工审批”其实并不是控制,只是看起来像控制。常见失效方式有三种:审批节点根本不在 agent 实际执行路径上;人批准的是模型生成的描述而不是精确调用;以及审批者长期习惯性点“同意”,导致门禁沦为形式。
他提出更可靠的做法是把写权限放在审批之后,让 agent 默认只有只读/提议能力,真正的副作用只能由拥有权限的一侧执行。作者补充说,实践里最先出问题的往往不是攻击者,而是重试、重规划带来的重复或错误操作,因此幂等性比很多人以为的更关键。
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11