自审 AI 事故响应 agent:所谓 96% 置信度竟是三个 bug 造出来的
Life_Rest_2488 · reddit · 2026-09-30
开发者审计自己搭的事故响应 agent(FastAPI + Next.js + Hindsight 记忆 + Groq),发现仪表盘上任何场景都显示约 96% 置信度,根源在检索之后的评分层有三个 bug:
- 相似度其实是排名:similarity = round(0.95 - idx 0.04, 2),所谓 95%/91%/87% 只是列表位置,且所有匹配硬编码为「成功」。
- 「部署次数」是召回条数:timesused = max(len(results), timesused),导致成功率永远等于 (N−2)/N。
- 置信度饱和:假相似度与假成功率的 0.4/0.6 加权必然落在 0.96 附近,加上 max(…, 0.50) 下限,agent 永远不会承认「不知道」。
修复方案:计数器从零开始、只由分析师反馈更新;相似度取自召回载荷否则不显示;去掉置信度下限让冷启动如实呈现。遗留问题:playbook 选择仍是关键词查表。作者结论:UI 上出现的任何百分比都应能指到产生它的那行代码。
「编程与Agent」频道最新
- 开发者演示让 agent 接入 1930 年代至今宏观数据,24/7 盯经济 — virattt · 2026-09-30
- Findatasets 接入宏观数据,Agent 可拉取 1930 年代至今经济指标 — virattt · 2026-09-30
- 用 Opus 5.5 做游戏?先学会 Pinterestmaxxing 攒美学素材 — nptacek · 2026-09-30
- Conductor 接入 Sign in with ChatGPT,Codex 订阅一键登录 — charlieholtz · 2026-09-30
- OpenAI 预告 Decisions API:用 gpt-6-luna 快速做图文决策 — stevenheidel · 2026-09-30
- 开发者开始构建专为 ChatGPT 内使用设计的 Codex 原生应用 — danshipper · 2026-09-30