第一人称语料设计:一个能告诉你「为什么错」的 Agent 记忆基准

LowDistribution3995 · reddit · 2026-08-28

作者不满现有 agent 记忆评测——它们基于第三方对话和严格事实回忆,而真实 agent 并不是这样工作的。于是做了一个第一人称视角的 benchmark(FP-AMB):

作者仍在调整语料、题目和模拟,并希望更多人使用、分享记分卡,以便持续校准题目集,保证每次通过/失误都有可辨识指标上的意义。项目开源于 GitHub。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →