第一人称语料设计:一个能告诉你「为什么错」的 Agent 记忆基准
LowDistribution3995 · reddit · 2026-08-28
作者不满现有 agent 记忆评测——它们基于第三方对话和严格事实回忆,而真实 agent 并不是这样工作的。于是做了一个第一人称视角的 benchmark(FP-AMB):
- 用真实语料 + 动态模拟来测试 agent 记忆能力
- 输出可读性强的记分卡,带可视化拆解
- 附 miss report 文本文件,能看出每道错题为什么错
- 语料和 agent 身份文件都在仓库里,用户可自行扩展覆盖面
作者仍在调整语料、题目和模拟,并希望更多人使用、分享记分卡,以便持续校准题目集,保证每次通过/失误都有可辨识指标上的意义。项目开源于 GitHub。
「研究」频道最新
- TTPO:无需标签的测试时策略优化 — Aozhe Wang · 2026-08-28
- Aphanta:诊断多模态推理的图像编辑中间态 — Fudan-University · 2026-08-28
- HydroGym:含 60+ 环境的流体控制 AI 训练场 — ricardovinuesa · 2026-08-28
- Miles 支持 Qwen 与 GLM 模型的高效 RL 训练 — ying11231 · 2026-08-28
- Miles-diffusion 推出 LoRA SFT 快速微调扩散模型 — ying11231 · 2026-08-28
- SovietRxiv 新增 7000 篇苏联科学论文英译 — generativist · 2026-08-28