为个人助手记忆系统自建评测,adebench 打出 93.7 分

Soft-Lie-434 · reddit · 2026-09-12

开发者为其个人助手 "Sofia" 的记忆服务(Brain:工作/情景/语义记忆 + 知识图谱 + 实体卡片,通过 MCP 暴露给 Claude、Codex 和语音客户端)自建了评测框架 adebench(MIT 开源、Python、零依赖)。

核心思路:不打分检索命中率,而是打分客户端实际收到的文本。检索到但落在第 3000 字符之外的事实对模型来说等于不存在。通过 "门"(door)测量:语音门截断在 2400 字符且实体卡片前置;agent 门是 MCP agent 任务开始时拿到的上下文。测量发现 agent 拿到的信息少于语音客户端(17/24 vs 21/24),修复组合检索后提升到 22/24。

8 个评分维度(0-100):door(25)、cards(15)、updates(10)、time(10)、livestate(10)、abstention(10)、filesearch(10)、graph(10),另有 lifecycle 健康度与延迟两个只报告不计分项。

v0.1 踩过的坑(已修复,值得借鉴):HTTP 500 被判为完美 abstention、空图谱得满分 10/10、'8766' 误匹配 '18766'、同分钟两次运行互相覆盖。现在所有检查分 PASS/FAIL/ERROR/SKIP,错误不得分,37 个 CI 测试守护这些边界。

他自己的 Brain 在 24 题黄金集上得 93.7/100,强调该分数只与自身纵向可比。其他记忆系统通过约 25 个方法的 adapter 接入,附两秒可跑的合成示例。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →