Krea2 图像编辑 LoRA 开源求接力
molbal · reddit · 2026-07-14
有人在做 Krea2 图像编辑 LoRA 训练,但 GPU 预算已经用完,于是把项目、数据集和训练细节都开源出来,希望别人接着做。
帖子里给了不少技术信息:
- 采用 Ostris ai-toolkit 里的 indextimestepzero 思路,让参考图 token 在 timestep=0 参与调制
- 通过把参考 token 放在目标图右侧的 RoPE 2D 网格里,避免单独轴导致的网格伪影
- 文本编码器要求固定的参考标签格式:<referenceN><|visionstart|><|imagepad|><|visionend|></referenceN>
- 训练时还需要把 VLM 像素预算从 384x384 改到 512x512
同时他公开了两个 Hugging Face 数据集:一个约 2 万条真实语义编辑对,用于教模型“编辑”的概念;另一个是算法生成的 身份保持/像素级保持 数据,强调未被提示词提到的区域应尽量精确复制参考图。
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11