用 LLM 给检索段落打分:低于 0.15 就承认不知道而非编造
TejasKumar_ · x · 2026-10-02
- 作者在其个人问答机器人中,用一个 LLM 调用对检索出的前 10 段逐一打分:「这段是否回答了问题?」
- 两个攻击性问题只得 0.06 和 0.07 分,而 60 个本应被回答的问题最低分也有 0.13,于是设定 0.15 阈值:低于阈值就明确说「我没覆盖过这个话题」,而不是让模型编造答案。
- 与上一条攻击拦截方案配套,构成同一套低成本问答机器人的防幻觉与防注入工作流。
「编程与Agent」频道最新
- 微软论文:编码 Agent 分析日志优化提示词,4 项基准胜 3 项仅花 $1.60 — rohanpaul_ai · 2026-10-02
- 别急着上最大模型:GPT-6.1 Sol 主代理 + Luna 子代理省钱实测 — chiliraupe · 2026-10-02
- Dot 不是更强的 Codex:一款对标 OpenClaw/Hermes 的差异化编码产品 — gabrielchua · 2026-10-02
- Engineering.com 母公司 Arrowfly 推出 AI for Engineers 常设计划 — burhop · 2026-10-02
- exe.dev 倡议少跑 Agent:用快模型接管人机沟通,减少并发压力 — sull · 2026-10-02
- 给 AI agent 1000 美元让它自己跑对冲基金,全程直播中 — kleffew94 · 2026-10-02