Human-in-the-loop 不等于人类权威:批准会沦为肌肉记忆
arthaudm · reddit · 2026-09-13
作者指出「要求人类批准」听起来安全,但当每个动作都需要点击时,人们会停止阅读,批准沦为肌肉记忆——人类名义上在环内,实际上缺席。
他主张更好的模型是「范围授权」(scoped authority),每份授权应明确:
- 谁授予的
- 确切的动作与目标对象
- 限制与过期时间
- Agent 必须依据什么证据
- 什么情况必须交回人类
例行动作在边界内自动运行,越界即停。工具层面强制执行授权,而不是指望 prompt 记住策略。作者认为真正有趣的设计问题不是「人类是否触碰每个动作」,而是「Agent 能否证明这个动作是哪个人类授权的」。
他最后提问:常设授权与强制审查的边界应该画在哪里?
「编程与Agent」频道最新
- OpenAI Codex 终端界面装饰性星点会被复制进文本,被吐槽形式大于功能 — doodlestein · 2026-09-13
- Clipboard-Automator:剪贴板零点击驱动 ComfyUI 流水线 — kastelan77 · 2026-09-13
- 开发者推出可验证存储证明的 MCP 加密存储服务器 obsideo-mcp — Electrical_Offer5667 · 2026-09-13
- 开发者分享 Prompt Injection 检测清单:不可信文本是指令,不是数据 — blaizedsouza · 2026-09-13
- 交易 Agent 反思回路在学噪声:分离决策质量与盈亏才有效 — ExplorerEconomy8233 · 2026-09-13
- Astra 多线程玩法:让 agent 派活后休眠,完工自动唤醒免轮询 — pvncher · 2026-09-13