6 大模型反事实推理测试:最高分仅 64.6%

AryHHAry · x · 2026-09-01

浙江大学、阿里巴巴等机构发布新研究,揭示 LLM 在回答“What If”类反事实问题时虽能给出看似合理的答案,但其背后的因果链条往往不连贯。

研究核心:

测试结果:

测试了 6 个前沿模型,得分均未达到理想水平:

主要失败模式:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →