MiniMax-H3 RefMod 实战:打包 JPEG 缓存提速,角色串扰近乎消除
acedelgado · reddit · 2026-09-30
开发者更新了其开源的 Fantastic MiniMax-H3 Prompt Builder(ComfyUI 节点),核心改进围绕 RefMod(参考素材)的编码与缓存:
- 原理:原生 RefMod 只把媒体存为 latents 直接喂给 DiT,文本编码器看不到参考;作者此前让部分帧进入文本编码器做条件锚定,但每次生成都要重复编码,很慢。
- 提速技巧:利用 .safetensors 只是容器这一特性,把参考图以 JPEG 数据与 latents 打包存进同一文件(类比视频内嵌字幕),JPEG 直接喂文本编码器、跳过 VAE,且条件可跨次缓存——只要不改变 RefMod 顺序和强度,重复处理全部跳过。
- 新增 stackpictures 模式:every 4th(默认,最轻)、up to 8(跨数据集采样 8 帧单独喂,细节更好)、all(全部帧进 TE,最慢但细节最大、几乎无角色串扰)。
- 实测:每角色 6 张图+几秒音频,3 个 RefMod 共约 14,900 tokens,5090 上约 32s/it(0.98mp),配合 8 步 HyperFlow 与音频精修套件。另为视频编辑加了 edit masking。数据集与多个配套仓库(HyperFlow、AudioRefine)均已开源。
「多模态」频道最新
- 等生成间隙弹吉他,AI 视频团队拍出人机即兴合奏短片 — mrjonfinger · 2026-09-30
- Meta LSRM 获 ECCV 2026 最佳论文提名,稀疏注意力扩展 3D 重建 — rsasaki0109 · 2026-09-30
- Meta 实验室 LSRM 获 ECCV 2026 荣誉提名,3D 重建精度大幅超越 SOTA — rsasaki0109 · 2026-09-30
- NVIDIA 推出 LongLive-Plug:蒸馏一次即可复用于 54 个下游视频模型 — nvidia · 2026-09-30
- Adobe 研究:对抗训练后处理修复像素扩散模型的高频细节缺失 — adobe-research · 2026-09-30
- UCSD 提出 LIFT:用末帧布局控制未来画面,解决大视角变化视频生成 — UCSanDiego · 2026-09-30