重度实测后用户直言:基准跑分不仅误导更在摧毁信任

aziham · reddit · 2026-09-08

一位长期重度使用 Qwen 3.8 Max 的 Reddit 用户对比了 Gemini、GLM-5.3-Flash 和 Muse Spark 1.3,认为没有一个能接近 Qwen 3.8 Max,唯一有竞争力的是 GLM-5.3,后者在网络安全任务上表现明显更强。他的核心观点是:基准测试成绩与真实使用体验严重脱节,现在这些 benchmark 不仅误导,甚至有害于用户对模型的信任,不应再用来声称某模型优于另一个。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →