Gemma 3 27B QAT量化精度回退:注意力层为何不该用Q4_0?

dampflokfreund · reddit · 2026-08-07

开发者深入对比了 Gemma 3 27B 的 QAT(量化感知训练)版本与传统 Q4KL 量化版本的表现,发现 QAT 虽然降低了显存,但在代码和长上下文创意写作等需要高精度的任务上出现了性能回退。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →