HalluWorld 基准获 NeurIPS 采纳:感知近乎满分,模拟与弃答仍是幻觉重灾区
Jeande_d · x · 2026-09-29
HalluWorld 是一个通过「参考世界模型」来测量 LLM 幻觉的可控基准:在完全规定好的 grid world、国际象棋和终端环境里,模型任何与事实不符的可观察陈述即算幻觉,已被 NeurIPS 2026 Evaluations & Datasets 采纳。
关键发现:
- 感知几乎解决:12 个模型中 7 个在 grid world 感知探针上达到 0.0% 错误,5 个在无 FEN 输入的象棋感知上零错误。
- 模拟仍很难:多步状态追踪与前向模拟全线失守,所有模型在 grid memory 探针上至少 16.7% 幻觉;上下文里有错误 FEN 时,最强模型在因果象棋探针上也失败 18–32%。
- 弃答能力落后:没有模型能在 grid 不确定性探针上把幻觉压到 24% 以下;真实终端任务中不确定性类幻觉仍达 9–27%,其他类别已接近零。
结论是「幻觉不是一个单一能力」,不同 mitigation 需要分类评估,现有跨任务基准碎片化问题因此被针对性解决。
「研究」频道最新
- 谷歌趋势美国区榜首全是怀俄明州?作者疑因数据中心机器流量 — lilyraynyc · 2026-09-29
- K3-Node 发布:基于 Keras 3 的多后端 GNN 库,与 PyG API 完全对齐 — fchollet · 2026-09-29
- 哥伦比亚团队用智能体完成 p53 与激素受体基因组语法研究 — anshulkundaje · 2026-09-29
- 新研究定位 VLM 中负责 OCR 的注意力头,竟能读出图像全部语义 — gsarti_ · 2026-09-29
- kipply 推出推理成本算术教程,拆解 H200/B200 上的 prefill 与 decode 开销 — ycombinator · 2026-09-29
- 研究者讨论:输入长度直接影响激活稀疏性,盼序列压缩新方法 — antoine_chaffin · 2026-09-29