极致压缩:1.58bit量化让视觉超分模型仅668KB且跑在浏览器
Any_Tie_1861 · reddit · 2026-07-31
开发者将常用于大语言模型的 BitNet 风格三值量化(1.58-bit)应用到了视觉 Transformer(Swin2SR 轻量级超分模型)上。量化后每个权重仅为 -1、0 或 +1,使得整个模型压缩后体积仅为 668 KB,甚至比它要处理的很多图片还要小。
该模型可以在浏览器端通过 ONNX Runtime Web 直接运行,无需上传任何数据,同时也提供 safetensors 格式。在 Set5 ×2 数据集上测试,其 RGB PSNR 达到了 34.44 dB,比双三次插值(Bicubic)高出 2.66 dB。
作者也坦诚了该方案的局限性:目前仅支持干净的 2 倍放大,无法拯救画质极差的重度压缩图;属于非生成式超分,只增强现有细节而不凭空生成;为了换取极小的体积牺牲了部分峰值保真度。
「多模态」频道最新
- DeepSeek-V4-Flash多模态实测:生成3D模型不敌Gemini 3.6 — teortaxesTex · 2026-07-31
- 粉丝用 AI 为热门游戏制作真人电影预告片 — imjm · 2026-07-31
- 海螺AI新视频模型实测:人物参考生成慢动作效果惊艳 — LudovicCreator · 2026-07-31
- 实测 MiniMax H3 动作控制:效果比肩 Kling 3.0 — OneTrueTreasure · 2026-07-31
- See2Think:多模态模型真的会用中间视觉状态推理吗? — Siyu Yan · 2026-07-31
- Higgsfield 推出 Seedance 2.0 无限试用,2.5 版本即将上线 — eyishazyer · 2026-07-31