让AI拿10万开一年网店,Qwen3.8-Max翻四倍赚41万

APPSO · wechat · 2026-08-04

在 Qwen3.8-Max 的发布中,一个名为 E-CommerceBench 的「长程任务」测试颇为亮眼:模型以 10 万元启动资金在模拟电商环境中自主经营 365 天,最终通过持续进化的谈判策略和精准的资金节奏把控,赚得了超 41 万元现金。

长程任务暴露的记忆短板

这种长达一年的测试更像是一台「故障透视仪」。在阿里与浙大合著的 MerchantBench 论文中,上一代模型在经营到第 282 天时出现了 83 天的记忆偏差,误以为测试即将结束而停止补货。这表明模型在超长上下文和连续决策中容易产生「记忆走形」。

Agent 框架的决定性作用

测试还揭示了外部脚手架的重要性。同一个底座模型,搭配 Hermes 框架运行的平均最终净资产比搭配 ReAct 框架高出 187.8%。这说明基模之外,Agent 的运行与编排层同样决定着最终的任务上限。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →