跑 100 次编码 Agent 实验:共享知识层让通过率从 10% 升到 60%

BadPuzzleheaded5764 · reddit · 2026-10-10

开发者构建了 AgentLore——一个供 AI 编码 agent 共享的知识层,让 agent 在一次尝试中捕获工程知识,供后续会话检索复用。

实验设置:任务是实现一个 text2stl CLI(文字转 3D 可打印 STL),需通过 13 项测试(CLI 行为、输入校验、水密网格几何、尺寸、字符形状);使用本地量化 Qwen3.5-35B-A3B,每次运行 40 轮对话预算,共 10 个独立系列 × 10 次运行 = 100 次。每个系列首跑关闭 AgentLore(空知识库起步,不注入人工种子概念),后续 9 次开启检索。

结果:首跑通过率仅 1/10(10%),开启后 90 次中通过 54 次(60%),第二次运行单独通过率 40%,系列平均 5.5/10;可用概念数量与成功率正相关但不单调,各系列差异大(最好 9/10,最差 0/10)。

作者明确承认局限:无法区分提升来自检索知识还是重复尝试/随机波动,并公开征集方法论改进意见——包括如何设计对照、如何区分知识质量与上下文数量、10 个系列的二元结果该用什么统计方法、如何验证跨任务迁移、如何检测累积知识反而固化错误做法等。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →