HalluHard 基准:前沿模型多轮幻觉率仍居高不下
maksym_andr · x · 2026-09-18
新发布的 HalluHard 幻觉基准排行榜揭示:现有基准已饱和、多为单轮场景、评判能力有限,而 HalluHard 采用多轮任务与严格校验,要求模型读取并解析包括 PDF 在内的全文来源。
- 覆盖领域:法律案例、科研问题、医疗指南、编程四类,可切换是否开启联网搜索,并按 1-3 轮细分。
- 自条件效应:在引用类任务中,模型越往后轮次幻觉越多——3-20% 的错误引用会在后续轮次复现,因为模型以自己早先的错误为条件;编程类随任务聚焦反而呈下降趋势。
- 能力相关性:更强模型幻觉率一致更低(GPT-5-nano → GPT-5-mini → GPT-5),GPT-5.2、Claude-Opus 等新旗舰全面改善。
- 推理并非万能:有效思考能降低 GPT 系幻觉,但效果因模型而异(DeepSeek-Reasoner 无改善)。
即使开启联网搜索,前沿专有模型在该基准上仍然吃力。
所属事件:GPT-6-Astra 幻觉评测大幅领先,多轮幻觉仍是行业难题(3 条相关)→
「模型」频道最新
- 斯坦福 Marin 开放实验室直播训练 535B 模型,十人团队全程公开 — wandb · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18
- GPT-6 Astra 破译一封此前无人解开的 1918 年德军无线电报 — moultano · 2026-09-18
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 — SakanaAILabs · 2026-09-18
- Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用 — 4bTechDecode · 2026-09-18