普林斯顿推 PAST-Bench:实测个人智能体经验积累能否带来自我改进
princetonu · hf · 2026-08-05
普林斯顿大学团队发布 PAST-Bench,专门用于评估个人 AI 智能体能否将积累的经验(如偏好、历史、技能)转化为更好的未来表现。
- 测试设计:涵盖 26 个场景和 204 个任务序列,通过在相同条件下开启或关闭经验保留机制来对比效果。
- 实验发现:在 7 个基础模型和 4 个智能体框架中,经验积累确实能带来提升,但不同能力维度表现极不均衡。部分智能体表面分数相近,但实际并未遵循预期的“保存-检索-更新”路径。
- 优化方案:研究团队提出 Hermes+,在智能体循环的各阶段进行 5 项针对性干预,有效提升了经验利用的平均增益,尤其是在需要更新过期状态的任务上表现突出。
「编程与Agent」频道最新
- LFM2.5-2.6B 实测:单次会话连续调用 10+ 工具不失忆 — helloiamleonie · 2026-08-05
- Qwen3.8-Max 实测:连续 10 天自主编码并完成自修复 — Scobleizer · 2026-08-05
- 单提示词生成1500+汽车零件:Opus模型硬核CAD实测 — mattshumer_ · 2026-08-05
- GitHub Copilot 新扩展:在 IDE 中直接控制 iOS 模拟器 — DanWahlin · 2026-08-05
- 企业级 NL2SQL 实践:如何构建语义层并提升 Agent 确定性? — Lumpy-Championship90 · 2026-08-05
- SIEVE新检索法:让深度研究Agent省下一半Token — _reachsumit · 2026-08-05