斯坦福新基准:同一模型换框架,Agent 成绩相差 27 个百分点
rohanpaul_ai · x · 2026-09-03
斯坦福等顶尖实验室发布论文 《DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows》,核心发现是:强 LLM 不等于强 Agent,围绕模型的框架能极大改变 Agent 表现。
关键信息:
- 基准包含 200 个从真实用户会话重建的任务,混合编码、网络调研、文档处理与内容创作
- 环境刻意包含缺失依赖、不稳定网络、干扰文件等真实混乱因素
- 最显著结果:同为 Opus-4.8,在 OpenClaw 框架下得分 0.5821,在 DuMate 框架下得分 0.8548,差距达 27.27 个百分点
论文地址:arxiv.org/abs/2608.26546
「编程与Agent」频道最新
- 开发者吐槽:LLM 被过度优化成一锤子买卖,不肯中途要反馈 — Elijah_Meeks · 2026-09-03
- Namespace 携手 Cursor,为云端 agent 原生提供 Mac/Linux 开发机 — dean_rie · 2026-09-03
- 开源 MCP 工具让编码 Agent 直观「看到」iOS 模拟器界面 — ivanzhaowy · 2026-09-03
- Meta 开源 CORAL:LLM 智能体闭环优化生产级推荐系统 — _reachsumit · 2026-09-03
- 写了 5 份设计文档的 allowlist 竟从未被运行时读取 — Thirumalaiboobathi · 2026-09-03
- 开发者弃用 --help:用 atuin ai 查不熟的命令行 — braelyn_ai · 2026-09-03