Qwen3.8-Max 实测:16天零干预写出CLI工具,长程任务大幅提升
socialwithaayan · x · 2026-08-06
作者详细评测了阿里巴巴最新发布的 Qwen3.8-Max(2.4万亿参数,激活950亿参数的 MoE 架构)模型。
- 长周期智能体能力:模型展现了极强的长程任务执行力。在测试中,它连续 16天 无需人类干预,自主完成了从规划、编写、测试到修复 Bug 的全流程,成功开发出一款名为 oh-my-cli 的命令行工具。
- 基准测试成绩:在多项前沿基准测试中表现亮眼,FrontierSWE 得分从上一代的 40.7 飙升至 73.5(长程任务能力近乎翻倍)。不过作者也坦诚,其在 SWE-bench Pro 上得分为 67.7,仍落后于 Fable 5(80.0)。
- 多模态与长上下文:支持 100万 token 上下文窗口,可一次性处理 200 页合同或整季剧集。视觉理解能力大幅增强,不再只是简单拼接图像编码器,而是能精准读取 UI 截图细节并转化为前端代码。
「编程与Agent」频道最新
- 金融 AI Agent 实测:架构优化比换更强模型更能提分 — rohanpaul_ai · 2026-08-06
- AI Agent 复现 2000 篇 ICML 论文,超三分之一被证伪 — Hugging Face · 2026-08-06
- MCP 安全扫描器各自为战?AVE 项目推统一漏洞 ID — SelectionBitter6821 · 2026-08-06
- 开源 AI 工作流:打通 CAD、机器人与硬件设计全流程 — mhdfaran · 2026-08-06
- CMU与Meta开源ACM框架:教Agent自主压缩上下文,显存占用降20% — aigclink · 2026-08-06
- 受够了ComfyUI繁琐操作,开发者花一年打造开源神器Stimma — stimma · 2026-08-06