正在构建 Agent 长期记忆评测基准,你希望加什么?
True_Mongoose_7073 · reddit · 2026-09-01
作者正在构建 Agent 长期记忆的评测基准,目前已包含数月单人聊天记录、多语言、含图片问答、答案变更及未提及信息的场景,并记录了 Token 消耗。向社区征集需求,特别是实际落地场景中遇到的记忆盲点或评测指标。
「编程与Agent」频道最新
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01
- 整合 Posthog 与 Notion,Agent 自动化用户访谈与反馈闭环 — lennysan · 2026-09-01
- 用 Grok Bot 构建大学录取数据集清洗流 — lennysan · 2026-09-01
- 构想 Grok Bot 钱款漏洞猎人应用 — lennysan · 2026-09-01
- 从 Discord 机器人到多人共享 Agent 工作区:团队工作流升级记 — steipete · 2026-09-01
- OpenClaw把Agent放回你本机:933名志愿者对抗云端管家 — heyneighbor · 2026-09-01