长周期 Agent 依赖记忆,15 大模型管理足球队 20 年测试
dair_ai · x · 2026-08-30
一项研究通过让 LLM Agent 管理一家足球俱乐部 20 个赛季(约 340-400 个决策点),来测试长期任务中的记忆与规划能力。
核心结论:
- 所有 15 个前沿模型都存活了整个周期,而基于脚本的基线大多失败。
- 模型规模、价格、厂商或 token 消耗量无法预测排名,排名在运行后期才稳定下来。
- 顶尖模型表现出特定的管理行为:在周期末减少回报慢的投资,并在截止日期前很久开启合同续约。
- 两个普遍失败点:没有模型能从数百次被拒绝的报价中学习市场价格隐藏信息;自我管理的记忆也会失效。
这项研究表明记忆/召回是打破长周期 Agent 任务瓶颈的关键。
「研究」频道最新
- 周末资源:从第一性原理推导位置编码 — zainhas · 2026-08-30
- COLM 论文用梯度归因揭示 LLM 能力来源 — ziv_ravid · 2026-08-30
- Toby Ord 论文指递归自我改进受物理限制 — Exponential View (Azeem Azhar) · 2026-08-30
- Fable 与 Sol 形式化验证文献,首次找出论文可修复错误 — Sauers_ · 2026-08-30
- Mark Schmidt 发布 ICML 教程视频:数值优化理论在 2026 年还重要吗 — MarkSchmidtUBC · 2026-08-30
- 46 行 Python 实现 SDF 甜甜圈渲染 — voooooogel · 2026-08-30