MerchantBench 论文揭示长周期 Agent 性能崩盘
rohanpaul_ai · x · 2026-08-29
针对长周期 AI 的现实困境,新论文 MerchantBench 提供了残酷的数据验证。该研究在模拟一年的电商环境中测试了八个领先模型(包括 GPT-5.6 Sol 和 Claude Opus 4.8),结果显示表现最佳的 Qwen3.7-Max 最终赚取的金额也仅为人均水平的 27.3%。这暴露了当前 Agent 在处理长期连贯性、延迟反馈和复杂决策链时的严重短板。作者引用 Chamath 的观点强调,长期任务和复杂问题目前依然无法被有效解决,目前的系统远未达到可靠的长期执行水平。
「编程与Agent」频道最新
- AOS Nidus 发布:专有硬件托管自主 Agent 的工作流平台 — Roker_51 · 2026-08-29
- 一眼识别 AI 生成前端:它把系统知道的一切都摊给用户 — aryanXmahajan · 2026-08-29
- 开发者推荐集成 WebMCP 提升应用能力 — kieranklaassen · 2026-08-29
- 利用本地 MCP 接口构建可移植的 Agent 运行边界 — mostly_deterministic · 2026-08-29
- Hiten Shah 分享用本地 AI 做 QA 测试与修复 Bug 实战 — msg · 2026-08-29
- 播客预告:hnshah 的「图书管理员」bot 如何自动整理 GitHub 仓库 — msg · 2026-08-29