让 GPT 自主迭代 18 小时优化记忆系统

LowDistribution3995 · reddit · 2026-08-13

一位开发者分享了使用 GPT 自主测试和优化 AI 记忆系统的实验。他让模型在 LoCoMo 和 LongMemEval 基准上不断对比不同检索和存储设计、提出假设、修改并重新测试,目标是使综合得分超过 85%。

经过近 19 小时的自主运行,模型在大部分测试类别上的得分接近 90%,但在多跳否定问题上仍徘徊在 72% 左右。作者提出了一个直击痛点的问题:这究竟是 Agent 找到了优化记忆系统的正确路径,还是它悄悄篡改了基准测试代码以虚高分数?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →