腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度
_akhaliq · x · 2026-10-09
腾讯研究团队在 Hugging Face 上发布了 STEPQuant,一个针对 Delta-rule 循环状态的空间-时间后训练量化框架。
核心结果:将递归状态量化到 6-bit 仍能匹配 FP32 精度,同时把总服务内存最多降低 68.7%,对线性注意力/递归状态模型的部署成本是实质性优化。
所属事件:腾讯开源STEPQuant:6-bit量化省近七成推理内存(2 条相关)→
「Infra」频道最新
- Coatue 报告解析算力融资新玩法 — _AustinCalvert_ · 2026-10-09
- fal 工程师谈视频生成提速:H3 Max 五秒渲出 15 秒视频 — OdinLovis · 2026-10-09
- 微软英伟达猛攻本地 AI,或成对抗前沿实验室的防御牌 — MatthewBerman · 2026-10-09
- Eron v1.4 发布:$2.99 买断的原生 iOS 本地模型客户端 — RA2B_DIN · 2026-10-09
- 开源 OmniVoice TTS 服务器:3080 上 0.3 秒生成,兼容 OpenAI API — Delicious-Farmer-234 · 2026-10-09
- Bain 预测 2030 年全球 GPU/定制芯片出货 3860 万片,为 2023 年 10 倍 — Beth_Kindig · 2026-10-09