Qwen 3.8 Max 跑分高达 56 分?实际体验被指名不副实
ideaofsoul · reddit · 2026-08-06
一位用户发帖质疑 Qwen 3.8 Max 的评测分数存在虚高嫌疑。虽然网传该模型的跑分达到了 56 分,但发帖者在实际使用官方 App 进行资料检索时,发现其智能程度远不及预期。
这引发了关于当前新模型是否存在“刷榜”现象的讨论。作者质疑业界过度依赖 benchmark 来衡量模型智力,而这些分数往往无法真实反映模型在日常复杂任务中的实际表现。
「模型」频道最新
- Hark发布Handoff模型,宣称超越ChatGPT 5.4和Opus 4.8 — peterjliu · 2026-08-06
- 受限于额度与降智,开发者开始转向 Kimi K3 等开源模型 — casper_hansen_ · 2026-08-06
- DeepSeek Flash v4 恢复服务,编码与聊天体验大幅提升 — bindureddy · 2026-08-06
- 实测 ChatGPT-5.6-luna:日常文本处理成本仅为竞品三分之一 — zakkohane · 2026-08-06
- 通义千问 Qwen3.8-Max 发布,原生多模态推理 — FellMentKE · 2026-08-06
- 阿里发布 Qwen3.8-Max:2.4T 参数与百万上下文 — FellMentKE · 2026-08-06