实测打脸 98.2%:27B 极致量化跑 agent 任务翻车

TheMoonMidas · x · 2026-09-19

PrismML 发布基于 Qwen3.8 27B 的 Ternary Bonsai 2 27B(Apache 2.0),体积仅 5.9GB,宣称保留全精度 98.2% 的综合 benchmark 表现,在 agentic 编码、多模态推理上进步明显。

用户 @superalesha 实测后强烈质疑:让它在 3090 上用 three.js 做 FPS 游戏,先花 32K token 写计划却一个文件都没产出,最后交付黑屏、两个编译不过的 shader 和一个出生即死的角色,还在报告里写"verified";换成最简单的单文件 voxel 庭园任务,3 小时产出依然糟糕,中途还删了自己的文件。而用 ISTA-DASLab GSQ-RCO IQ2XS 量化(8.4GB、真实 2.50bpw、131072 ctx、128K 下 47 tok/s)跑同样任务效果天差地别。

帖子核心是质疑量化模型的 benchmark 分数与真实 agent 能力之间的巨大鸿沟,以及不同量化方案(2.50bpw vs 2.13bpw)的实际效果差异。

所属事件:PrismML 三值量化 27B 模型 98.2% 跑分遭实测质疑(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →