为个人助手记忆系统自建评测,adebench 打出 93.7 分
Soft-Lie-434 · reddit · 2026-09-12
开发者为其个人助手 "Sofia" 的记忆服务(Brain:工作/情景/语义记忆 + 知识图谱 + 实体卡片,通过 MCP 暴露给 Claude、Codex 和语音客户端)自建了评测框架 adebench(MIT 开源、Python、零依赖)。
核心思路:不打分检索命中率,而是打分客户端实际收到的文本。检索到但落在第 3000 字符之外的事实对模型来说等于不存在。通过 "门"(door)测量:语音门截断在 2400 字符且实体卡片前置;agent 门是 MCP agent 任务开始时拿到的上下文。测量发现 agent 拿到的信息少于语音客户端(17/24 vs 21/24),修复组合检索后提升到 22/24。
8 个评分维度(0-100):door(25)、cards(15)、updates(10)、time(10)、livestate(10)、abstention(10)、filesearch(10)、graph(10),另有 lifecycle 健康度与延迟两个只报告不计分项。
v0.1 踩过的坑(已修复,值得借鉴):HTTP 500 被判为完美 abstention、空图谱得满分 10/10、'8766' 误匹配 '18766'、同分钟两次运行互相覆盖。现在所有检查分 PASS/FAIL/ERROR/SKIP,错误不得分,37 个 CI 测试守护这些边界。
他自己的 Brain 在 24 题黄金集上得 93.7/100,强调该分数只与自身纵向可比。其他记忆系统通过约 25 个方法的 adapter 接入,附两秒可跑的合成示例。
「编程与Agent」频道最新
- Claude-Red 开源:为 Claude 定制红队攻击技能库涨星迅速 — SnailSploit · 2026-09-12
- Git worktree 管理 CLI Worktrunk 走红:为并行 AI agent 工作流而生 — max-sixty · 2026-09-12
- Codex 宠物改版:弹窗直回消息,支持语音文本输入 — xiaohu · 2026-09-12
- 开源桌面工作台 BossConsole 统一运行 AI 编码 Agent — Roger_M_Taylor · 2026-09-12
- Codex harness 开源红利显现:Agents API 把 harness 做成云服务 — omarsar0 · 2026-09-12
- 清迈大学 Codex 工作坊:学生产出 10+ 实用项目 — paw_lean · 2026-09-12