HalluWorld 基准显示前沿模型仍难搞多步推理
jiqizhixin · x · 2026-07-29
Carnegie Mellon、Patronus AI、Stanford 和 Ohio State 提出 HalluWorld,用“参考世界”来衡量幻觉:先给模型一个固定规则环境,再检查它的回答是否与环境事实一致。
- 基准覆盖 三类场景:网格世界、国际象棋和终端环境。
- 设计了 五类探针:因果、感知、记忆、不确定性和复合推理,用来区分不同失误模式。
- 结果显示,前沿模型在直接观察到的信息回忆上几乎满分,但在多步推理和因果模拟上仍然明显吃力。
- 论文强调,幻觉不是单一问题,不同任务揭示的是不同类型的失败。
「研究」频道最新
- Nature 研究:作者自评能有效预测论文科学影响力 — weijie444 · 2026-08-25
- 高评测一致性反而更危险?LLM 评估指标遭质疑 — IanArawjo · 2026-08-25
- LLM 写作好需类人心智理论?具身智能或是关键 — joshua_saxe · 2026-08-25
- LLM 隐性评估用户能力并据此调整答案复杂度 — rohanpaul_ai · 2026-08-25
- 波士顿动力新演示引发机器人学界大讨论 — KyleMorgenstein · 2026-08-25
- Task-CoEvolve:自适应验证任务选择,降低 80% 评估成本 — hal-utokyo · 2026-08-25