MerchantBench 论文揭示长周期 Agent 性能崩盘

rohanpaul_ai · x · 2026-08-29

针对长周期 AI 的现实困境,新论文 MerchantBench 提供了残酷的数据验证。该研究在模拟一年的电商环境中测试了八个领先模型(包括 GPT-5.6 Sol 和 Claude Opus 4.8),结果显示表现最佳的 Qwen3.7-Max 最终赚取的金额也仅为人均水平的 27.3%。这暴露了当前 Agent 在处理长期连贯性、延迟反馈和复杂决策链时的严重短板。作者引用 Chamath 的观点强调,长期任务和复杂问题目前依然无法被有效解决,目前的系统远未达到可靠的长期执行水平。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →