HiRAE:分层残差预算的表示自编码器,ImageNet-256 重建 FID 降至 0.209
Xuanyu Zhu · hf · 2026-09-30
HiRAE 是一种分层表示自编码器,旨在提升预训练视觉表示用于图像生成时的重建保真度:
- 按深度对编码器层分组,在深层表示上学习残差修正;分组范数上限约束修正幅度,越浅层预算越紧,避免难以建模的隐分布;
- HiRAE-24 保持隐 token 数与通道维度不变。
效果:ImageNet-256 上重建 FID 从 RAEv2 的 0.299 降至 0.209,引导生成质量保持竞争力;文生图方面,微调后 GenEval 从 84.86 提升至 87.70,DPG-Bench 与 GenAI-Bench 上对齐度同样提升。
「多模态」频道最新
- Midjourney v8.2 新玩法:4 个虚构 token 玩出记忆残影与骨骼回声 — LudovicCreator · 2026-09-30
- 开发者直言超个性化音乐是伪命题:音乐本质是社交文化 — jordiponsdotme · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- 本地生图一年:从 Civitai 到 ComfyUI,体验为何都烂 — BenDLH · 2026-09-30
- 用 Opus 50 分钟做出 Violetto 1B 宣传片,几乎零媒体关注 — tensorqt · 2026-09-30
- 蒸馏视频模型频现伪影,作者长文剖析 LoRA 失配根源 — burkov · 2026-09-30