LLM长任务失败源于“认知惯性”,RL可修复

burny_tech · x · 2026-08-17

推文指出LLM在长时程任务中失败并非因为上下文不足,而是因为“认知惯性”——将第N步的推理格式带入第N+1步,而后者需要完全不同的技能。作者提出用强化学习(RL)来修复,并附有详细线程。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →