不信任写代码的 agent,为何信审查它的 agent?
thomasahle · x · 2026-09-15
针对 Codex 与 Claude Code 的「自动审批」功能,Aaroth 提出质疑:这类设计让你无需逐条确认权限,同时营造安全感——但前提是你信任这个 agent。如果你不信任执行任务的 agent,凭什么信任负责审查它的另一个 agent?thomasahle 回应称,这本质上就是「生成器-验证器差距」(Generator-Verifier gap)问题:验证端同样由模型驱动,其可靠性受同一差距约束,无法提供真正独立的信任来源。
所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→
「漫话AGI」频道最新
- 投资人抨击 Anthropic:把恐惧变成利润、搞 AI 版 TSA — StewartalsopIII · 2026-09-15
- 用生态学看 AI 未来:不是单一 AGI,而是大小智能体共生网络 — dioscuri · 2026-09-15
- 反方观点:超级智能没理由杀死人类,就像我们不杀狗 — dbasch · 2026-09-15
- 开发者:真正的 AI 灭绝风险来自「不够聪明」的大规模部署 — rickasaurus · 2026-09-15
- 从 ReAct 到 Terminal Agent:梳理通用智能体两年演进脉络 — Gauri_the_great · 2026-09-15
- 美国高管圈热议 AI 主权:不止选模型,而是夺回全栈决策权 — inductionheads · 2026-09-15