实测打脸 98.2%:27B 极致量化跑 agent 任务翻车
TheMoonMidas · x · 2026-09-19
PrismML 发布基于 Qwen3.8 27B 的 Ternary Bonsai 2 27B(Apache 2.0),体积仅 5.9GB,宣称保留全精度 98.2% 的综合 benchmark 表现,在 agentic 编码、多模态推理上进步明显。
用户 @superalesha 实测后强烈质疑:让它在 3090 上用 three.js 做 FPS 游戏,先花 32K token 写计划却一个文件都没产出,最后交付黑屏、两个编译不过的 shader 和一个出生即死的角色,还在报告里写"verified";换成最简单的单文件 voxel 庭园任务,3 小时产出依然糟糕,中途还删了自己的文件。而用 ISTA-DASLab GSQ-RCO IQ2XS 量化(8.4GB、真实 2.50bpw、131072 ctx、128K 下 47 tok/s)跑同样任务效果天差地别。
帖子核心是质疑量化模型的 benchmark 分数与真实 agent 能力之间的巨大鸿沟,以及不同量化方案(2.50bpw vs 2.13bpw)的实际效果差异。
所属事件:PrismML 三值量化 27B 模型 98.2% 跑分遭实测质疑(2 条相关)→
「模型」频道最新
- 神秘模型 Jev 发布:宣称快 200 倍便宜 400 倍,网友实测叫好 — multiply_matrix · 2026-09-19
- GLM/DeepSeek/Qwen 开源小模型横评:质量看 GLM,速度选 Qwen — HankYeomans · 2026-09-19
- Ternary Bonsai 2 27B 压到 7GB 单文件,8GB 显存可跑 — cephaloform · 2026-09-19
- 研究者反驳Jev定位:语言本质是System 2,拿它做System 1说不通 — emax · 2026-09-19
- 闭源模型怎么被蒸馏?Reddit 热议 Anthropic 指控背后的技术机制 — LaughLegit7275 · 2026-09-19
- OpenAI 员工回应语音语言争议:英文音色也适用于多语言 — juberti · 2026-09-19