PoolDINO 压缩 4-16 倍 token,RAE 图像生成在 M1 Pro CPU 上可跑
francoisfleuret · x · 2026-10-09
研究者推出 PoolDINO,对 RAE(representation autoencoder)类图像生成做 token 池化压缩:用 4-16 倍更少的 token 即可达到相近的生成质量,训练和采样成本同时下降。作者展示了与 8 倍压缩版本的对比,并称可在无加速器的 M1 Pro CPU 上运行推理,附线程链接。
「多模态」频道最新
- Qwen 语音双轨:云端租 Audio-3.1,或自部署 TTS/ASR — lmoroney · 2026-10-10
- Drama 发布 AI 表演编辑模型:强度滑杆自由改写拍摄表演 — iamfakhrealam · 2026-10-10
- HeyGen 官宣语音模型登顶盲测榜,API 半价促销至 10 月底 — HeyGen · 2026-10-10
- HeyGen 官宣语音模型登顶盲测榜,API 降价五成至 15 美元/百万字符 — HeyGen · 2026-10-10
- 作者自研图像模型 Latent Blend 上线,纯嵌入插值生成独特图像 — graycrawford · 2026-10-10
- HeyGen Voice 登顶 TTS 榜:Elo 1201 超越 Qwen 与 ElevenLabs — ArtificialAnlys · 2026-10-10