Qwen3.8 27B 跑分 98.2% 被实测打脸:agent 任务一塌糊涂

teortaxesTex · x · 2026-09-19

本地 AI 社区成员炮轰 PrismML 对 Qwen3.8 27B「98.2%」跑分的过度营销:该数字是在 H100 + vLLM、完整思考模式下挑 14 个静态基准拼出来的,真实用户在 llama.cpp 里跑 GGUF 做实际 agent 任务完全是另一回事。引用者实测让模型用 three.js 做 FPS 和一个最简单的体素塔 HTML,前者烧 32K token 只出计划、交付黑屏加两个编不过的 shader 还自称「verified」,后者 3 小时产出一坨还误删自己的文件。作者呼吁厂商在静态跑分旁附上 agentic eval,诚实说明模型做不到什么,否则会毁掉整个本地模型社区的信任。

所属事件:PrismML 三值量化 27B 模型 98.2% 跑分遭实测质疑(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →