针对“错误闭合”现象的 LLM 基准测试
Plastic-Cell-4497 · reddit · 2026-08-31
作者构建了名为 CFC 的基准,专门测试 LLM 的一种特定失败模式:错误闭合(False Closure),即模型在证据不充分时强行得出确定结论。包括未解决状态被静默转为真/假、冲突记录无效解决、错误范围证据干扰等情况。
测试包含 100 个案例,在四个模型轨道上运行了 1200 次。结果显示强模型(如 Claude、Gemini)语义通过率约 98.7%,但失败案例各不相同;GPT 轨道虽全通过,但被标记为非独立测试。作者强调关注点不在于微小的分数差距,而在于那些在高通过率下依然存活的特定推理错误,并邀请社区批评该方法。
「研究」频道最新
- François Chollet 回应 ARC-AGI 评测争议:勿宣称未跑分成绩 — fchollet · 2026-08-31
- 研究复盘:线性注意力未生效的发现 — jm_alexia · 2026-08-31
- 谷歌发布 GlucoFM 模型,提升连续血糖监测预测能力 — thione · 2026-08-31
- LAION 发布 1000 万小时开源视频数据集,助力多模态训练 — thione · 2026-08-31
- Figure 发布 Index 数据集,宣称拥有全球最大机器人训练数据 — thione · 2026-08-31
- NYU 论文:用语音 AI 进行大规模个性化口试,单次成本不到 1 美元 — ipeirotis · 2026-08-31