LiFT 循环Transformer:参数省60%,FID 反降3.34点
VISLab-Amsterdam · hf · 2026-10-06
VISLab Amsterdam 提出 Loop Flow Transformers(LiFT),一类通过反复应用共享 DiT 核心来扩展计算量的循环生成模型:
- 训练时每个循环步骤只用单一回归目标:从模型初始估计到 flow-matching 目标直线路径上的一个点,并以连续深度坐标索引,因此模型可循环到远超训练深度而无需重训或早退。
- 更长的 rollout 能持续改善生成质量,即推理计算可增长而不增参数。
- ImageNet 256×256 上,LiFT-L/2 比 dense DiT-XL/2 基线 FID 低 3.34,同时参数少约 60%、训练 FLOPs 少 32%、推理 FLOPs 少 52%。
「多模态」频道最新
- 用 Seedance 2.5 拍吸血鬼短剧:黎明前拯救母亲玫瑰 — azed_ai · 2026-10-06
- AI 生成「 superheroes 不如茶和饼干」爆笑短视频 — umesh_ai · 2026-10-06
- 非洲语音创业 YarnGPT 新进展:语音翻译已达皮钦英语 — saheedniyi_02 · 2026-10-06
- 豆包与 Qwen 语音模型:10 秒语音即可低成本复刻音色 — AlchainHust · 2026-10-06
- Kling 4.0 Flash 对话表演大幅进步:停顿与眼神交流像真演员 — LudovicCreator · 2026-10-06
- 用 MiniMax H3 一次生成 15 秒动画打斗,作者求解画质优化 — lajonquillebleu · 2026-10-06