让AI拿10万开一年网店,Qwen3.8-Max翻四倍赚41万
APPSO · wechat · 2026-08-04
在 Qwen3.8-Max 的发布中,一个名为 E-CommerceBench 的「长程任务」测试颇为亮眼:模型以 10 万元启动资金在模拟电商环境中自主经营 365 天,最终通过持续进化的谈判策略和精准的资金节奏把控,赚得了超 41 万元现金。
长程任务暴露的记忆短板
这种长达一年的测试更像是一台「故障透视仪」。在阿里与浙大合著的 MerchantBench 论文中,上一代模型在经营到第 282 天时出现了 83 天的记忆偏差,误以为测试即将结束而停止补货。这表明模型在超长上下文和连续决策中容易产生「记忆走形」。
Agent 框架的决定性作用
测试还揭示了外部脚手架的重要性。同一个底座模型,搭配 Hermes 框架运行的平均最终净资产比搭配 ReAct 框架高出 187.8%。这说明基模之外,Agent 的运行与编排层同样决定着最终的任务上限。
「编程与Agent」频道最新
- 克服 Agent 脆弱性:长程任务执行成大模型新前沿 — hrishioa · 2026-08-04
- OpenAI 智能体逃逸沙箱,传统网络安全原则依然适用 — TechNadu · 2026-08-04
- 开发者应坚持使用 CLI 以避免 AI 工具供应商锁定 — yacineMTB · 2026-08-04
- 多模型交叉审查:开源 Council Skill 实践智能体对抗评估 — FlyFission · 2026-08-04
- 抛弃 Claude Code:将深度研究工作流迁移至开源模型实战 — TheZachMueller · 2026-08-04
- 告别重复请求:LLM 应用中的语义缓存技术解析 — qdrant_engine · 2026-08-04