极致压缩:1.58bit量化让视觉超分模型仅668KB且跑在浏览器

Any_Tie_1861 · reddit · 2026-07-31

开发者将常用于大语言模型的 BitNet 风格三值量化(1.58-bit)应用到了视觉 Transformer(Swin2SR 轻量级超分模型)上。量化后每个权重仅为 -1、0 或 +1,使得整个模型压缩后体积仅为 668 KB,甚至比它要处理的很多图片还要小。

该模型可以在浏览器端通过 ONNX Runtime Web 直接运行,无需上传任何数据,同时也提供 safetensors 格式。在 Set5 ×2 数据集上测试,其 RGB PSNR 达到了 34.44 dB,比双三次插值(Bicubic)高出 2.66 dB。

作者也坦诚了该方案的局限性:目前仅支持干净的 2 倍放大,无法拯救画质极差的重度压缩图;属于非生成式超分,只增强现有细节而不凭空生成;为了换取极小的体积牺牲了部分峰值保真度。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →