给 Agent 配上 shell 后上下文格式差距不缩反扩:从 50 分拉大到 74 分

arch1v1sor · reddit · 2026-09-10

作者此前跑了一系列基准,测试 agent 的记忆表示方式(完整散文定义 vs 结构化记录)对回答准确率的影响,被质疑「有了 shell 和数据库差异就会消失」。于是重跑实验:把 5 张参考表移出 prompt 放到磁盘 CSV,给 agent 配 Bash/Read/Glob/Grep,40 题、6 种上下文条件、240 次调用(Haiku 4.5)。

结果:

作者公开了评测框架、全部调用日志与方法论,并邀请用不同模型家族复现对比。局限:单次重复、单一模型、合成语料。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →