RTX 3060 实测:ByteShape 超低比特量化远逊 GSQ
zyxciss · reddit · 2026-09-23
作者在 RTX 3060 12GB + 16GB 单通道 DDR4(CachyOS、llama.cpp)上对比了 Qwen 3.8 27B 的两种超低比特量化:
- ISTA-DASLab GSQ-RCO-IQ3-XXS(10.4GB,约 2.5 BPW,开 MTP):满上下文约 29 tok/s,低上下文 34-40 tok/s;
- ByteShape IQ3-XXS:小约 500MB,宣传称基于 KL 散度的 BF16 相似度极高,纸面很有吸引力。
实测结果却差距明显:GSQ 一次生成(<55k token)完成 3D 体素立体图任务,ByteShape 花了约三次尝试、超 98k token 仍未完成;网页开发表现同样不如宣传。作者提醒低比特量化的纸面相似度指标不能代表真实任务表现,并征求适合 RTX 3060 的新模型建议。
「Infra」频道最新
- 去中心化推理平台 Chutes 换帅,公开展示 8B MoE 预训练全程 — markjeffrey · 2026-09-23
- 后训练框架 Halo 宣称吞吐达 TRL 2.8 倍,遭质疑选择性跑分 — _ScottCondron · 2026-09-23
- OpenAI 解释 GPT-6 降价:缓存与推理优化省下的钱直接让利 — OpenAIDevs · 2026-09-23
- OpenAI 工程师详解 GPT-Live 实时语音系统如何构建 — juberti · 2026-09-23
- 2030 年中美数据中心耗电量预测:中国 774 TWh、美国 649 TWh — teortaxesTex · 2026-09-23
- DiffusionGemma 成 DGX Spark 上的黑马:单机跑「快速 agent」任务 — bodonoghue85 · 2026-09-23