PAST-Bench:评估个人 AI 助手能否真正利用经验自我提升
rohanpaul_ai · x · 2026-08-05
研究团队推出 PAST-Bench,专门测试个人 AI 助手能否将积累的历史经验转化为更好的未来表现。
- 测试规模:覆盖 26 个场景和 204 个任务片段,评估记忆、程序复用、信息收集和更新 4 项核心能力。
- 实验设计:在相同条件下对比开启/关闭经验保留的效果,并追踪性能提升是否真正依赖于预期的“保存-检索-更新”路径。
- 核心发现:在 7 个基础模型和 4 个智能体框架中,经验保留确实能带来提升,但效果因能力、模型和框架而异。部分智能体即使表面成绩相近,底层依赖的机制也大不相同。
- 优化方案:提出 Hermes+,通过 5 项针对性干预措施优化智能体循环,有效提升了经验保留的增益和机制可解释性。
所属事件:普林斯顿推出PAST-Bench评估个人AI助手自我提升能力(2 条相关)→
「编程与Agent」频道最新
- MCP新工具:用自然语言管理Namecheap域名 — modelcontextprotocol · 2026-08-05
- Twinmotion MCP:通过自然语言控制建筑渲染与视频导出 — modelcontextprotocol · 2026-08-05
- deep-research-mcp 支持 Gemini 等多家深度研究后端 — PMinervini · 2026-08-05
- 环境记忆的暗角:日志堆砌不等于智能 — bfrench · 2026-08-05
- Agent擅自给客户报错价:自动回复的幻觉翻车教训 — Trusttive11 · 2026-08-05
- 开源工具 code-review-graph:为 AI 编程构建代码图谱省 Token — PrajwalTomar_ · 2026-08-05