模型总在自行填空:把判定权移出 AI 的执行门控设计
Jay299792458 · reddit · 2026-09-18
作者提出:Agent 的核心风险不是幻觉,而是模型不会在不知道时停下——缺值就推断、缺条件就假设、缺意图就自行决定。这三者本质是同一个问题:模型是"填空引擎",且是训练出来的行为,禁令 prompt 或更强模型都消除不了。
作者给出一个门控(gate)设计:
- 声明:把"必须验证什么"写成模型外的规则清单
- 判定:由代码执行验证,并记录每个槽位的状态与来源(如 toaccount: unknown → askuser)
- 执行:只读取已记录的判定结果才动手
同时指出当前日志只记工具调用和最终参数,不记每个值的来源,被拦截的执行更是完全没有日志,事后无法审计值是被查到的还是编出来的。核心主张:决策权与判定权必须在模型之外,否则模型能力越强、越能放大未经声明的自主决定。规范已完成,参考实现只是骨架,尚不可生产使用。
「编程与Agent」频道最新
- 「System Design, Visually」上线:63 张生成式图解讲透系统设计 — cneuralnetwork · 2026-09-18
- 把系统设计博客转成 63 张视觉化讲解图,免费开放浏览 — cneuralnetwork · 2026-09-18
- Rust 工具+330 个技能库,让 AI 写出巴赫风格《唐老鸭》赋格 — doodlestein · 2026-09-18
- 新文提出「社会层」缺位:Agent 跨信任边界协作为何还不行 — shishirpatil_ · 2026-09-18
- ChatGPT 与 Claude 都在融合 Coding Agent,Kimi 为何反向拆出独立 Code — yihui_indie · 2026-09-18
- MCP 工具设计难题:改期该是一次调用还是取消加预订? — Normal_Succotash_520 · 2026-09-18