开源 TrueForge 对比 Claude 管理代理:同模型同准确率省 63% token
Background-Job-862 · reddit · 2026-09-03
TrueFoundry 开源了模型无关的通用 agent harness TrueForge(MIT 协议,支持 OpenAI 兼容端点、MCP、子代理、审批与沙箱集成),并在 DevRev Enterprise-Bench 的 14 个任务上与 Claude Managed Agents 盲评对比:
- Claude Managed Agents + Opus 4.8:11/14 通过,$11.8/次,10M tokens/次
- TrueForge + Opus 4.8:11/14 通过,$8.6/次,3.7M tokens/次,工具调用 19 次 vs 32 次
- TrueForge + GLM-5.2:11.7/14 通过,$3.0/次,成本约为前者组合的 1/4
差异来自 agent 循环本身:更少的跨轮上下文、压缩、更少工具调用、大输出不进上下文。作者也坦承短板:尚无一等 tracing/eval、需自接代码沙箱、压缩是有损的,并开源了基准方法供复现。
「编程与Agent」频道最新
- Agent 跑到第 8 步明显变慢,开发者讨论性能排查思路 — NewBass7883 · 2026-09-03
- Google 研究:幻觉不是知识缺失而是「钥匙丢了」,CoT 可找回 65% 事实 — bendee983 · 2026-09-03
- 谁来决定 AI Agent 能访问什么数据?治理架构仍是空白 — AgileExcuse859 · 2026-09-03
- 被低估的 agent 设计:把任务「交还给人」才是关键 UX — iMaurice8888 · 2026-09-03
- 独立开发者日爬百亿条记录,为存在性安全研究打造分析型数据库 — AaronBergman18 · 2026-09-03
- Cursor 云 Agent 支持跑在自家机器上,内部超 60% PR 已由 Agent 创建 — dinasaur_404 · 2026-09-03