HyQuant:混合精度量化注意力,低比特下守住关键 token 精度

SJTU · hf · 2026-09-11

上海交大团队提出 HyQuant,针对 LLM 注意力层的低比特量化问题:保留关键的垂直线 token 与局部窗口的高精度,只量化其余部分,在低开销下维持模型精度。推理栈优化方向的实用工作。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →