Postgres 记忆层在完整 LongMemEval 上跑到 73.6%
MycoBrainAI · reddit · 2026-07-21
作者为 AI agent 做了一个基于 Postgres 的记忆层,并在 LongMemEval 的完整 500 题 oracle 集上跑到 73.6% 的问答准确率,不再是抽样结果。
他复盘了几个对分数影响最大的点:
- 认真处理互相矛盾的来源,否则答案质量会明显下降
- 对低置信度抽取直接不入库,而不是勉强存起来
- 检索同时结合全文检索和语义检索,而不是二选一
作者还把 harness 和一键复现流程放进了仓库,强调抽样 benchmark 很容易把回归问题“美化”掉。
「编程与Agent」频道最新
- 转述观点:非开发者也该自己买 Claude Code 或 Codex — HankYeomans · 2026-07-23
- LangChain 把智能体核心问题指向循环工程 — LangChain · 2026-07-23
- 作者主张用 Schema 校验取代 LLM 自主判断执行 — Jay299792458 · 2026-07-23
- 预告:支持动态多模型路由与任务拆分的编排系统 — omarsar0 · 2026-07-23
- Reddit 讨论:AI agents 的邮箱身份怎么管理 — BlakSavageGaming · 2026-07-23
- 网友用 GPT 整理 X 平台最佳 Codex 与 ChatGPT 提示词 — nickbaumann_ · 2026-07-23