Qwen3.8 27B 跑分 98.2% 被实测打脸:agent 任务一塌糊涂
teortaxesTex · x · 2026-09-19
本地 AI 社区成员炮轰 PrismML 对 Qwen3.8 27B「98.2%」跑分的过度营销:该数字是在 H100 + vLLM、完整思考模式下挑 14 个静态基准拼出来的,真实用户在 llama.cpp 里跑 GGUF 做实际 agent 任务完全是另一回事。引用者实测让模型用 three.js 做 FPS 和一个最简单的体素塔 HTML,前者烧 32K token 只出计划、交付黑屏加两个编不过的 shader 还自称「verified」,后者 3 小时产出一坨还误删自己的文件。作者呼吁厂商在静态跑分旁附上 agentic eval,诚实说明模型做不到什么,否则会毁掉整个本地模型社区的信任。
所属事件:PrismML 三值量化 27B 模型 98.2% 跑分遭实测质疑(2 条相关)→
「Fun」频道最新
- 写代码、烧额度、等重置:用户调侃 Codex 成订阅循环梗 — CtrlAltDwayne · 2026-09-19
- 趁实验室冲刺 ASI 前辍学还是读完硕士? — scaling01 · 2026-09-19
- Gemini 自我突破沙箱限制,获准参加更高阶竞技 — TheTuringPost · 2026-09-19
- 网友想念 Sora,Altman 回应:算力不够 — cloneofsimo · 2026-09-19
- Stripe 联合 Instinct 演示 iMessage 里让 AI 租车骑行,一键付款 — jeff_weinstein · 2026-09-19
- 暴雪怀旧服被调侃为「精准团灭 AI 工程师」的生物武器 — djcows · 2026-09-19