新基准显 Agent 难以通过显式技能库积累能力
rohanpaul_ai · x · 2026-08-24
ContinualSkillBench 基准测试显示,Agent 难以通过积累数百个技能而获得比例提升。论文发现,顺序执行任务带来的 16.9% 收益主要来自上下文和反馈的传递,而非 Agent 可靠地抽象出可复用的显式技能。在某些测试中,纯上下文学习的表现甚至优于维护显式技能库。
「研究」频道最新
- Transformer 探索 913 万种过渡金属团簇,AI 加速材料发现 — bravo_abad · 2026-08-24
- 数学家:Claude 帮助发现新的几何对象 S^6 — eldonredwards · 2026-08-24
- 摆脱聊天模板限制,LLM 后训练有新思路 — davidad · 2026-08-24
- 伦敦将举办 AI x Bio 黑客松,聚焦生物智能体 — ProfBuehlerMIT · 2026-08-24
- 审查者+批评家架构胜出,小团队代码审查新范式 — rohanpaul_ai · 2026-08-24
- 自适应路由思路:仅在信心不足时启用高算力路由器 — Comfortable_Peace175 · 2026-08-24