HalluWorld 基准入选 NeurIPS:模型感知近乎完美,模拟推理全面翻车
xennygrimmato_ · x · 2026-09-29
Varun Gangal 团队发布 HalluWorld,一个受控基准与方法论,把 LLM agent 放进每一步真值已知的参考世界(网格世界、国际象棋、终端任务)中,可验证地测量和诱发 agent 的幻觉。论文已被 NeurIPS 2026 Evals & Datasets 接收。
核心发现:
- 感知接近解决:12 个模型中有 7 个在网格世界感知探针上 0.0% 错误,5 个在不给 FEN 的情况下下棋 0.0% 错误——直接观察到的状态几乎不幻觉。
- 模拟依然很难:多步状态追踪与前向模拟全线失守,所有模型在网格记忆探针上至少 16.7% 幻觉;即使上下文里混入错误 FEN,最好的模型在国际象棋因果探针上也会失败 18–32%。
- 弃答能力落后:没有模型能在网格不确定性探针上把幻觉率压到 24% 以下;在真实终端任务中不确定性类幻觉率仍达 9–27%,而其他类别已接近零。
结论是"幻觉不是一种能力"——感知、因果模拟、记忆、不确定性应分开评测,而非笼统的单一分数。
所属事件:HalluWorld 基准获 NeurIPS 采纳:LLM 感知近满分,模拟与弃答仍高发幻觉(2 条相关)→
「编程与Agent」频道最新
- Qwen 团队开源 QwenGyre:超长程 Agent 在线 RL 训练框架 — Qwen · 2026-09-29
- 梗图:用户威逼利诱 agent 执行自己的「烂计划」 — mike64_t · 2026-09-29
- Agent 记忆该有保质期:作者提出六字段记忆元数据框架 — Hairy-Difficulty-411 · 2026-09-29
- 开发者搭桥:网页版 ChatGPT 通过远程 MCP 直接操作本地电脑 — ChoasMaster777 · 2026-09-29
- 99 秒演示:用 MCP 给 Agent 加终端+浏览器受控执行与审批边界 — ImaginaryMachine9110 · 2026-09-29
- SolarMind 亮相:带持久记忆的 AI 事故响应 Agent 四级自动分诊 — CountyNecessary4030 · 2026-09-29