针对“错误闭合”现象的 LLM 基准测试

Plastic-Cell-4497 · reddit · 2026-08-31

作者构建了名为 CFC 的基准,专门测试 LLM 的一种特定失败模式:错误闭合(False Closure),即模型在证据不充分时强行得出确定结论。包括未解决状态被静默转为真/假、冲突记录无效解决、错误范围证据干扰等情况。

测试包含 100 个案例,在四个模型轨道上运行了 1200 次。结果显示强模型(如 Claude、Gemini)语义通过率约 98.7%,但失败案例各不相同;GPT 轨道虽全通过,但被标记为非独立测试。作者强调关注点不在于微小的分数差距,而在于那些在高通过率下依然存活的特定推理错误,并邀请社区批评该方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →