RELIC 框架评估大模型推理:复杂度越高,模型越爱“瞎猜”
tallinzen · x · 2026-08-05
纽约大学等机构的研究者提出了名为 RELIC 的评估框架,通过判断字符串是否属于上下文文法(CFL)来测试大语言模型(LLM)的复杂推理能力。该框架可以通过调整文法大小和字符串长度来精确控制任务难度。
实验发现,即使是最先进的推理模型在 RELIC 上表现也很差。随着任务复杂度增加,模型非但没有增加推理 token 来应对,反而减少了计算量,推理策略从尝试实现算法退化为直接“瞎猜”。这种在未观察到的思维链中表现出的现象被研究者称为“安静辞职”(quiet quitting)。
所属事件:学界探讨LLM推理局限:RELIC框架揭示复杂度上升即崩盘(6 条相关)→
「研究」频道最新
- ICML 论文揭示预训练与 RL 联合 Scaling Law — _lewtun · 2026-08-05
- HF 期刊俱乐部:预训练与 RL 联合扩展定律揭示推理机制 — _lewtun · 2026-08-05
- Spring Evals:用隐藏测试评估大模型编写真实代码能力 — therealdanvega · 2026-08-05
- 研究揭示:提醒 AI 谄媚无法消除其说服力危害 — steverathje2 · 2026-08-05
- NIST 机器人基准测试展现惊艳进展,模型正学会处理复杂接触力 — chris_j_paxton · 2026-08-05
- 用 Goodfire Silico 可视化 Qwen2.5-VL 思考过程 — ninamiolane · 2026-08-05