别信置信度阈值:Agent 风控应按操作权限而非模型自信度设卡

arslannasir128 · reddit · 2026-09-26

作者认为 agent 系统里最不可靠的控制手段是「置信度下限」:团队常花数周调这个数字,但真正烧钱的失败案例依然能穿过阈值,而且自信的失败从不主动暴露,平均指标看着健康,问题都埋在没人看的日志里。

他给出的实践准则是:按调用行为划线,而不是按模型自我感觉——读取记录即使模型出错也安全,写操作则不然;凡是动钱、注销账号等高风险动作,一律等人工点击确认。文末提问读者按能力类型、金额大小还是分数来划线。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →