Qwen 3.8 Max 评测高分遭疑,用户实际办公体验未达预期
DavidOrzc · reddit · 2026-08-10
一位 Reddit 网友发帖质疑 Qwen 3.8 Max 的实际表现与评测分数不符。该模型在 Artificial Intelligence Index 排第二,在 LM Arena 文本生成排名也极高,但发帖人在实际办公(解析文档、总结、起草文件)中觉得表现平平,远不及 Fable,也不如 GLM-5.2 和 Kimi K3。发帖人怀疑这是否属于“刷榜”现象,并希望听听社区的真实使用反馈。
「模型」频道最新
- 阿里巴巴拟发布Qwen3.8-Max开源权重版,加码施压美国同行 — emmanuelvivier · 2026-08-10
- Nous Research发布开源代码模型,主打本地执行与Agent工作流 — emmanuelvivier · 2026-08-10
- Claude 扩展思考被曝严重 Bug:静默消耗 67 万 Token — forchat4 · 2026-08-10
- 传谷歌已悄然取消 Gemini 3.5 Pro 研发 — Left-Hotel904 · 2026-08-10
- Grok Imagine 2.0发布,图像生成榜单跃居全球第二 — eyishazyer · 2026-08-10
- Anthropic API 严控模式遇 $ref 会输出自相矛盾结果 — Nearby_Yam286 · 2026-08-10