模型总在自行填空:把判定权移出 AI 的执行门控设计

Jay299792458 · reddit · 2026-09-18

作者提出:Agent 的核心风险不是幻觉,而是模型不会在不知道时停下——缺值就推断、缺条件就假设、缺意图就自行决定。这三者本质是同一个问题:模型是"填空引擎",且是训练出来的行为,禁令 prompt 或更强模型都消除不了。

作者给出一个门控(gate)设计:

同时指出当前日志只记工具调用和最终参数,不记每个值的来源,被拦截的执行更是完全没有日志,事后无法审计值是被查到的还是编出来的。核心主张:决策权与判定权必须在模型之外,否则模型能力越强、越能放大未经声明的自主决定。规范已完成,参考实现只是骨架,尚不可生产使用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →