斯坦福新基准:同一模型换框架,Agent 成绩相差 27 个百分点

rohanpaul_ai · x · 2026-09-03

斯坦福等顶尖实验室发布论文 《DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows》,核心发现是:强 LLM 不等于强 Agent,围绕模型的框架能极大改变 Agent 表现。

关键信息:

论文地址:arxiv.org/abs/2608.26546

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →