HalluHard 基准:前沿模型多轮幻觉率仍居高不下

maksym_andr · x · 2026-09-18

新发布的 HalluHard 幻觉基准排行榜揭示:现有基准已饱和、多为单轮场景、评判能力有限,而 HalluHard 采用多轮任务与严格校验,要求模型读取并解析包括 PDF 在内的全文来源。

即使开启联网搜索,前沿专有模型在该基准上仍然吃力。

所属事件:GPT-6-Astra 幻觉评测大幅领先,多轮幻觉仍是行业难题(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →