腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度

_akhaliq · x · 2026-10-09

腾讯研究团队在 Hugging Face 上发布了 STEPQuant,一个针对 Delta-rule 循环状态的空间-时间后训练量化框架。

核心结果:将递归状态量化到 6-bit 仍能匹配 FP32 精度,同时把总服务内存最多降低 68.7%,对线性注意力/递归状态模型的部署成本是实质性优化。

所属事件:腾讯开源STEPQuant:6-bit量化省近七成推理内存(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →