Foveated Diffusion:仿人眼视觉的高效图像视频生成
CSProfKGD · x · 2026-08-26
介绍了一种名为 Foveated Diffusion 的新方法,旨在解决高分辨率图像和视频生成中注意力机制计算量随 token 数量二次扩展的问题。该方法受人类视觉系统启发,仅在视觉关注的区域分配高算力生成高分辨率像素,而在周边区域降低算力,从而显著提升生成效率。
「多模态」频道最新
- Grok Imagine 将星舰基地渲染图转为动漫风格 — XFreeze · 2026-08-26
- Img2Three.js:用代码生成参考图对应的程序化 Three.js 模型 — tom_doerr · 2026-08-26
- MiniMax 视频生成时长计算误差排查与修正公式 — Creative_aidumpster · 2026-08-26
- Kyutai 开源 Pocket TTS 训练栈,成本低于 200 美元 — syhw · 2026-08-26
- Jib Mix Krea 2 模型发布:专注照片级写实与奇幻风格 — jib_reddit · 2026-08-26
- 诗人用 AI 探索语言边界,创作“被遗忘”词汇 — Merzmensch · 2026-08-26