实测 LLM 引用质量问题:八条引用从未全对,多源观点只标一条

pizzababa21 · reddit · 2026-09-22

作者用 JEV 作为裁判,检验 LLM 在网页搜索任务中引用的来源是否真正支持其论断并给出强度评分。实测中模型平均每个任务引用约 8 条来源,但没有一次 8 条全部通过审查。在无额外规则的纯搜索下,JEV 能通过文章日期发现信息过时(用户要最新动态却引了几个月前的文章),令人印象深刻。它抓到的最主要问题是:模型的论断综合了多个来源的信息,却往往只标注其中一条引用。作者乐观认为,这类审查工具将帮助下一代模型用上更好的 AI 生成测试数据,显著提升可靠性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →