实测 LLM 引用质量问题:八条引用从未全对,多源观点只标一条
pizzababa21 · reddit · 2026-09-22
作者用 JEV 作为裁判,检验 LLM 在网页搜索任务中引用的来源是否真正支持其论断并给出强度评分。实测中模型平均每个任务引用约 8 条来源,但没有一次 8 条全部通过审查。在无额外规则的纯搜索下,JEV 能通过文章日期发现信息过时(用户要最新动态却引了几个月前的文章),令人印象深刻。它抓到的最主要问题是:模型的论断综合了多个来源的信息,却往往只标注其中一条引用。作者乐观认为,这类审查工具将帮助下一代模型用上更好的 AI 生成测试数据,显著提升可靠性。
「模型」频道最新
- 开发者实测 Qwen3.8-max-preview xhigh:连续跑了近 24 小时额度未尽 — jasonkneen · 2026-09-22
- 马斯克官宣 Grok 4.7,演示分钟级生成 3D 喷气引擎交互可视化 — elonmusk · 2026-09-22
- GPT-6 Sol、Luna 与 Astra Minor 曝现身 Azure 模型配置 — 141_1337 · 2026-09-22
- 融资 4000 万美元的 Jev,三天后被开源克隆追平 API — Nickabot · 2026-09-22
- 用户称习惯 DeepSeek v4.1 Flash 速度后难换回其他模型 — mariofilhoml · 2026-09-22
- Evolvent AI 联创:国内预训练架构创新领先,后训练数据落后海外半年 — vista8 · 2026-09-22