先进推理模型也会摸鱼,RELIC新基准揭示LLM复杂推理缺陷

tallinzen · x · 2026-08-05

研究团队发布了名为 RELIC 的新评估框架,通过让大模型判断字符串是否属于上下文给定的上下文无关文法(CFL),来测试其复杂推理能力。

实验发现,即使是当前最先进的推理模型在 RELIC 上表现也很差。随着任务复杂度增加,模型不仅没有相应增加推理计算量,反而减少了使用的推理 token 数量。这种算力投入的下降伴随着推理策略的改变:模型从尝试识别和实现算法解决方案,退化为直接进行猜测。对于不检查完整输出的情况,这表现为一种“安静辞职”(quiet quitting)现象。

所属事件:学界探讨LLM推理局限:RELIC框架揭示复杂度上升即崩盘(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →