HalluWorld 基准:前沿模型感知接近满分,但开思考反而让因果幻觉变多

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

cs.CL, cs.AI, cs.LG, stat.ML

2026-05-19

HalluWorld 用可控世界模型测幻觉:前沿模型感知近满分,因果和不确定性仍糟,开思考反而让因果幻觉从 19.7% 涨到 24.0%。

这篇在解决什么

大模型的幻觉(生成不符合事实的内容)是个老问题,但评测一直很碎。摘要、问答、RAG、agent 交互各有各的幻觉测试,口径对不齐,在一个任务上有效的缓解方法换个场景还灵不灵,根本说不清。现存的基准要么靠人工标注(迟早被模型背下来),要么观察真实场景(没法系统复现)。

HalluWorld 想做的是把幻觉定义在一个可控、可自动判分的框架里,这样能单独拧动「世界复杂度」「模型能看到什么」「信息冲突时信谁」这些变量,把不同类型的幻觉拆开来测。

方法

核心是「参考世界模型」框架。一个模型产生幻觉,定义为它说出了一个相对于参考世界 W 为假的说法。框架有四个部件:参考世界 W(编码真实状态和转移)、观测函数 V(控制模型能看到什么)、冲突策略 P(决定相互矛盾的信息怎么取舍)、真值函数 T(判对错)。

三个环境都程序可生成、自动判分:网格世界(MiniGrid,33 关 839 题)、国际象棋(Lichess 棋局,7 关 350 题)、终端任务(从 Terminal-Bench 跑出来的真实软件工程任务,110 个 529 题)。题目分五类探针:感知 P、记忆 M、因果 C、不确定性 U、复合 X,分别压不同的认知能力。作者测了十几个前沿和开源模型。

结果

感知类,前沿模型接近满分。网格世界上 GPT-5.5 总体幻觉率 5.0%(感知 0.4%),Claude Opus 4.6 是 5.9%,o3 是 6.8%。这一类基本被解决了。

因果推理和不确定性仍然很糟。Kimi K2.6 总体 9.3%,因果探针高达 47.4%。终端任务上,不确定性是最难的(GPT-5.5 也到 23.1%)。

最反直觉的发现是开「思考」反而让因果幻觉变重。Sonnet 4.6 的因果幻觉从 19.7% 升到 24.0%,Opus 4.6 从 20.1% 升到 25.2%。多想一步,在需要正向推演世界状态的题上,反而更容易错。

模型网格总体感知因果
GPT-5.5(T)5.0%0.4%25.3%
Claude Opus 4.65.9%3.7%20.1%
o36.8%0.3%26.0%
Kimi K2.69.3%5.4%47.4%

为什么重要

这篇的价值不在排名,在于把幻觉拆成了可独立测量的失败模式。对做模型的人,「感知接近解决、因果和不确定性还差得远」是个清楚的研发地图。那个「思考让因果幻觉变重」的发现尤其值得注意:它说明推理能力的提升和幻觉的减少不是一回事,更长的思维链在某些场景下是负资产。

局限与存疑

探针只测模型显式说出来的信念,不测内部表征。探针位置是和环境一起设计的,没有用主动学习去找「认知负荷最大」的状态。终端环境复杂,单独隔离某类失败比合成环境难。模型排序在不同探针上很不一致(比如某关 Opus/Sonnet 是 0%,o3 却是 43.3%),这说明排名对具体题型高度敏感,别拿单个总分下结论。

术语

原文与代码

社区讨论

相关论文

全部论文解读