SDXL LoRA 六个特征只学不会垂尾:conv 层还是标注问题?
Relevant_Meat_9418 · reddit · 2026-08-23
作者用 kohya sd-scripts 训练 Bf 109 G 的 SDXL LoRA(dim 32/alpha 16、1024 分辨率、约 2700 步、RealVisXL V5.0 底模),座舱盖等五个特征 20/20 命中,唯独垂尾始终回退成底模的圆润形状,方向舵铰链线从未出现,最差时垂尾解析成四五片辐射桨叶。
已排除三个方向:LoRA 强度 0.4–0.6 扫描无差异;数据集从 80 加到 97 张加垂尾特写无变化;垂尾裁剪增强到每 epoch 24% 反而更差。
剩余两个假设:A. conv 层——默认 LierLa 只给 Linear 和 1x1 conv 加 adapter,ResNet 的 3x3 conv 完全未被训练;若部件轮廓存在空间滤波器中,垂尾三轮都不可训,而注意力承载的座舱框、涂装学得很好,这个不对称高度吻合。修法是 networkargs convdim=16 convalpha=8(注意:只传 convdim 时 convalpha 会静默默认 1.0)。B. 标注——现有 caption 仅 15 词且零部件名;Civitai 上有 Mig-29 案例报告相同症状(平尾变两条烟迹),修法是第二轮用 90+ 词的 caption 显式标注每个部件,包括被遮挡的。作者纠结点在于「标注可分离项」的常规规则与该报告结论相反。文末征集 LoCon vs LoRA 在硬表面部件回退上的 A/B 经验、机械体穷举部件标注是否有效、以及 mask loss 是否优于裁剪。
「多模态」频道最新
- NeurIPS 2026 将举办 BabyVLM 研讨会 — LChoshen · 2026-08-23
- LTX v2v 测评:精细几何崩塌与平面幻觉现象分析 — Relevant_Meat_9418 · 2026-08-23
- 提升 AI 音乐质量:Udio 与 Suno 的 70/30 混合工作流 — Ok_pettech · 2026-08-23
- 用 Minimax 制作的短片:含大量后期处理 — Disastrous-Agency675 · 2026-08-23
- AI演示:当梦境与来世呈现为8-bit像素风格 — pickover · 2026-08-23
- Boson AI 推出 Higgs 实时语音模型,支持百种语言 — smolix · 2026-08-23