6 大模型反事实推理测试:最高分仅 64.6%
AryHHAry · x · 2026-09-01
浙江大学、阿里巴巴等机构发布新研究,揭示 LLM 在回答“What If”类反事实问题时虽能给出看似合理的答案,但其背后的因果链条往往不连贯。
研究核心:
- WhatIfBench 数据集:包含 220 个跨领域、长视界的开放式反事实问题(STEM 113 个,HSS 79 个,混合 28 个)。
- PRISM 评估框架:不只看最终答案对错,而是将模型回答转化为因果图,从“过程指标”(因果链有效性)和“量表指标”(解释准确性)两方面评估推理过程。
测试结果:
测试了 6 个前沿模型,得分均未达到理想水平:
- GPT-5.5: 64.62%
- Claude Opus 4.7: 59.11%
- Gemini 3.1 Pro Preview: 56.33%
- DeepSeek-V4-Pro: 55.12%
- Qwen3-Max: 52.26%
- GLM-5.1: 51.99%
主要失败模式:
- Causal gaps(因果断层):推理链中出现逻辑跳跃。
- Long-horizon breakdown(长程崩溃):随着推理步骤增加,连贯性下降。
- State inconsistency(状态不一致):前后文中对事物状态的描述矛盾。
「研究」频道最新
- ExploitGym 系统提示词显示内容并不有趣 — voooooogel · 2026-09-01
- LightFuse 突破可重光照 3D 高斯重建,画质领先基线 9.74dB — janusch_patas · 2026-09-01
- 质疑 SWA 感受野计算公式谬误 — giffmana · 2026-09-01
- Frontiers 期刊征稿:合成人口在政策模拟中的应用研究 — frederickaplan · 2026-09-01
- 多模态 AI 揭秘形状记忆合金失效微观机制 — bravo_abad · 2026-09-01
- ATGS:锚定时态高斯泼溅用于长体素视频重建 — janusch_patas · 2026-09-01