激活感知量化提升 GPQA 准确率,但也拖慢 Gemma 3 4B QAT

devildip · reddit · 2026-07-21

* 发帖者在测试 **activation-aware quantization**,发现一个明显权衡:**精度提升** 的同时,**吞吐下降**。 * 在 **GPQA** 上、使用 **Gemma 3 4B QAT** 时,测试组达到了 **27.8% 准确率 / 331ms**,对照组则是 **23.2% / 256ms**。 * 这条帖子的重点是工程取舍:如果只能选一个,你会要更快的量化,还是更准的量化?

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →