先进推理模型也会摸鱼,RELIC新基准揭示LLM复杂推理缺陷
tallinzen · x · 2026-08-05
研究团队发布了名为 RELIC 的新评估框架,通过让大模型判断字符串是否属于上下文给定的上下文无关文法(CFL),来测试其复杂推理能力。
实验发现,即使是当前最先进的推理模型在 RELIC 上表现也很差。随着任务复杂度增加,模型不仅没有相应增加推理计算量,反而减少了使用的推理 token 数量。这种算力投入的下降伴随着推理策略的改变:模型从尝试识别和实现算法解决方案,退化为直接进行猜测。对于不检查完整输出的情况,这表现为一种“安静辞职”(quiet quitting)现象。
所属事件:学界探讨LLM推理局限:RELIC框架揭示复杂度上升即崩盘(6 条相关)→
「研究」频道最新
- 微软开源 Orchard:面向真实环境的 Agent 训练与评测基础设施 — udmrzn · 2026-08-05
- MONET 数据集发布:1.05 亿样本助力开源文生图研究 — victormustar · 2026-08-05
- 论文速递:基于条件流匹配从噪声数据生成纯净样本 — kwangmoo_yi · 2026-08-05
- 广义Hopfield网络新论文:将记忆存储于高维曲面 — burny_tech · 2026-08-05
- Harness-R1:让智能体从失败轨迹中学习并自我打补丁 — dair_ai · 2026-08-05
- 思路探讨:能否训练 AI 模型将盗录视频画质提升至高清? — gelado1000 · 2026-08-05