Evidentiality 框架:给模型每个断言打来源标签,防幻觉扩散
jzesbaugh · reddit · 2026-10-01
作者发布了 Evidentiality Framework:一个纯提示词层面的溯源标注框架,要求模型为每条断言加内联标签——(u) 用户给的、(m) 已对照指定来源核实、(g) 模型生成的。无需再训练或改基础设施,配一个小型解析器和"门控":任何依赖 (g) 标签或未标注文本的行动都会被拦截。
初步测试结果:
- 单轮测试中 9 个模型各收到一次提示,多数标注正确,但有几个把自己算的数学标成了"给定"。
- 五智能体测试里,带标签的事实有 33/36 次保留了来源;不带标签仅 4/36。
- 伪造的"已核实"标签 4/4 次骗过了下一个智能体——所以标签是审计线索,不是安全保证。
作者自认非工程师,框架只做到提示词层,公开征求关于更合适实现层与先前工作的批评(网站与 GitHub 仓库已开放)。
「编程与Agent」频道最新
- Retriever AI 实测 OpenAI Dots:五项日常任务 24/24 力压对手 — quarkcarbon · 2026-10-01
- AI Agent 测评怎么做?开发者晒出抓「假装调用工具」的工具 — mbtigeekjung · 2026-10-01
- 开发者喊话 agent 厂商:别造新入口,去做人类讨厌的事 — SuB8u · 2026-10-01
- 月烧 3000 美元组多模型工作流:白领岗位危险了 — opmgyhx · 2026-10-01
- 让 AI 工具把自己换成更便宜的另一个 AI,开发者直呼爽快 — yacineMTB · 2026-10-01
- 50 人律师团队用 Devin 首响,日处理 20-40 个 bug 噪音减半 — graceisford · 2026-10-01