别信置信度阈值:Agent 风控应按操作权限而非模型自信度设卡
arslannasir128 · reddit · 2026-09-26
作者认为 agent 系统里最不可靠的控制手段是「置信度下限」:团队常花数周调这个数字,但真正烧钱的失败案例依然能穿过阈值,而且自信的失败从不主动暴露,平均指标看着健康,问题都埋在没人看的日志里。
他给出的实践准则是:按调用行为划线,而不是按模型自我感觉——读取记录即使模型出错也安全,写操作则不然;凡是动钱、注销账号等高风险动作,一律等人工点击确认。文末提问读者按能力类型、金额大小还是分数来划线。
「编程与Agent」频道最新
- Atom、Bit、Commit:agent 时代的知识单位正在成形 — tallmetommy · 2026-09-26
- Agent 常犯的五类使用错误:微观管理与放任都不可取 — HamelHusain · 2026-09-26
- skills.sh 七个月破百万技能,安装量近 2.8 亿次 — cramforce · 2026-09-26
- Huszár 团队发 TLA+ 实战教程:形式化验证非银弹,正用 AI 补齐 — fhuszar · 2026-09-26
- Opus 5.5 生成视频,直观演示 Hindley-Milner 类型推断算法 W — ctjlewis · 2026-09-26
- Runway MCP 接入 Claude,聊天里直接调 Gen-4.5 等生成图视频 — runwayml · 2026-09-26