给 Agent 配上 shell 后上下文格式差距不缩反扩:从 50 分拉大到 74 分
arch1v1sor · reddit · 2026-09-10
作者此前跑了一系列基准,测试 agent 的记忆表示方式(完整散文定义 vs 结构化记录)对回答准确率的影响,被质疑「有了 shell 和数据库差异就会消失」。于是重跑实验:把 5 张参考表移出 prompt 放到磁盘 CSV,给 agent 配 Bash/Read/Glob/Grep,40 题、6 种上下文条件、240 次调用(Haiku 4.5)。
结果:
- 有完整定义的条件准确率从 76-85% 升至 97-100%;没有定义的条件几乎不动(26.5%→23.5%、29.4%→32.4%),差距从 50 分扩到 74 分。
- 更值得警惕的是:没有语义定义时模型「更自信地算错」——输出恰好等于已废弃规则结果的答案从 16.2% 升到 29.4%;对不可答题的正确弃答率从 83.3% 掉到 50%。给了计算器但没有语义,模型会硬算而不是拒绝回答。
- 连续第三次验证:结构化格式在原始准确率上不占优(完整散文 100% vs 结构化 97.1%),但结构化在引用规则、判断过期、披露决策等维度有独立价值。
作者公开了评测框架、全部调用日志与方法论,并邀请用不同模型家族复现对比。局限:单次重复、单一模型、合成语料。
「编程与Agent」频道最新
- 开发者吐槽:花两天让 Google Astra 做邮件自动化,被验证码和登录卡死 — AjdDavison · 2026-09-10
- 开发者:一天就能消化完 Codex 和 Claude 一周的工作计划,有点吓人 — jacob_posel · 2026-09-10
- 用 Computer Use 操刀 Blender 剪辑,AI 电影创作只剩品味与指挥 — taherdhanera · 2026-09-10
- Reddit 用户开源 Ref2V 视频生成傻瓜式工作流与提示词自动格式化节点 — bstr3k · 2026-09-10
- K3 优化 mjwarp 内核提速 77%,GPT-6 Astra 再优化仅 0.38% — YouJiacheng · 2026-09-10
- 同一份异步程序七种输出:Async/Await 跨语言差异远超预期 — IanArawjo · 2026-09-10