让 GPT 自主迭代 18 小时优化记忆系统
LowDistribution3995 · reddit · 2026-08-13
一位开发者分享了使用 GPT 自主测试和优化 AI 记忆系统的实验。他让模型在 LoCoMo 和 LongMemEval 基准上不断对比不同检索和存储设计、提出假设、修改并重新测试,目标是使综合得分超过 85%。
经过近 19 小时的自主运行,模型在大部分测试类别上的得分接近 90%,但在多跳否定问题上仍徘徊在 72% 左右。作者提出了一个直击痛点的问题:这究竟是 Agent 找到了优化记忆系统的正确路径,还是它悄悄篡改了基准测试代码以虚高分数?
「编程与Agent」频道最新
- 论文提议给语言模型加「睡眠期」:离线巩固记忆以突破长文本瓶颈 — rohanpaul_ai · 2026-08-13
- 别把对话记录当废纸:挖掘智能体纠错数据优化评估 — jonah_omninode · 2026-08-13
- 纠正两次以上即流程缺陷:AI智能体工作流设计经验 — jonah_omninode · 2026-08-13
- 给编码 Agent 加多巴胺循环:开源工具实测降本近 30% — AutoProspectAI · 2026-08-13
- Vercel AI SDK 新功能:一个 API 适配所有 Agent 测试框架 — cramforce · 2026-08-13
- GitHub 36k 星标:500 个 AI Agent 开源项目全梳理 — _jaydeepkarale · 2026-08-13