跑 100 次编码 Agent 实验:共享知识层让通过率从 10% 升到 60%
BadPuzzleheaded5764 · reddit · 2026-10-10
开发者构建了 AgentLore——一个供 AI 编码 agent 共享的知识层,让 agent 在一次尝试中捕获工程知识,供后续会话检索复用。
实验设置:任务是实现一个 text2stl CLI(文字转 3D 可打印 STL),需通过 13 项测试(CLI 行为、输入校验、水密网格几何、尺寸、字符形状);使用本地量化 Qwen3.5-35B-A3B,每次运行 40 轮对话预算,共 10 个独立系列 × 10 次运行 = 100 次。每个系列首跑关闭 AgentLore(空知识库起步,不注入人工种子概念),后续 9 次开启检索。
结果:首跑通过率仅 1/10(10%),开启后 90 次中通过 54 次(60%),第二次运行单独通过率 40%,系列平均 5.5/10;可用概念数量与成功率正相关但不单调,各系列差异大(最好 9/10,最差 0/10)。
作者明确承认局限:无法区分提升来自检索知识还是重复尝试/随机波动,并公开征集方法论改进意见——包括如何设计对照、如何区分知识质量与上下文数量、10 个系列的二元结果该用什么统计方法、如何验证跨任务迁移、如何检测累积知识反而固化错误做法等。
「编程与Agent」频道最新
- Keyfleet 开放在即:无顶层编排的 AI agent 舰队实验 — seanwbren · 2026-10-10
- 用户赞 Grok bot 隐藏 subagent 机制秒回,称其他 LLM 体验被毁 — rudrank · 2026-10-10
- Alma 用 computer-use 全程无人操作 Premiere 剪出 a16z 风格视频 — itsOmSarraf_ · 2026-10-10
- Claude 通宵自主干活:在 Mac Mini 上自训分类器,全程离线无账号 — iannuttall · 2026-10-10
- loop-engineering 开源:11.4k 星的 AI 编程 Agent 循环编排工具集 — tom_doerr · 2026-10-10
- 别把 agent 塞进应用:应用本身就该是 agent 的外壳 — max_paperclips · 2026-10-10