RELIC 框架评估大模型推理:复杂度越高,模型越爱“瞎猜”

tallinzen · x · 2026-08-05

纽约大学等机构的研究者提出了名为 RELIC 的评估框架,通过判断字符串是否属于上下文文法(CFL)来测试大语言模型(LLM)的复杂推理能力。该框架可以通过调整文法大小和字符串长度来精确控制任务难度。

实验发现,即使是最先进的推理模型在 RELIC 上表现也很差。随着任务复杂度增加,模型非但没有增加推理 token 来应对,反而减少了计算量,推理策略从尝试实现算法退化为直接“瞎猜”。这种在未观察到的思维链中表现出的现象被研究者称为“安静辞职”(quiet quitting)。

所属事件:学界探讨LLM推理局限:RELIC框架揭示复杂度上升即崩盘(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →