照片级真实感有三条独立轴线,大多数工作流只修了两条
24Latents · reddit · 2026-08-26
作者基于 Krea 2 + 角色 LoRA 的长期实践,提出 AI 生成图像的「照片级真实感」有三条相互独立的轴线:光学(对抗过于完美的镜头感,用颗粒/光晕/欠曝/倾斜修复)、场景(对抗样板间式布景,用杂物/磨损/偏轴家具修复)和主体姿态——最后这条几乎没人处理,是图像「技术上正确却仍像假」的关键。
核心论点:candid documentary photo 等风格 token 只改变渲染风格,不改变姿态。当主体没有动机性动作时,模型会退回其训练数据中最常见的目录式摆拍:正面、居中、对称、眼睛看镜头;角色 LoRA 反而叠加肖像先验让问题更糟。
五个修正杠杆(按强度排序):
- 面向世界的动作:写具体的物理动作标记(如 caught mid-stride, one foot planted ahead),而非光秃秃的动词或状态描述——「状态」堆砌会让模型无从而建,只能回退到目录姿态。
- 自我触碰手势:仅限单手、疲惫语域(揉脖子、手臂贴肋)。明令禁止双手上头(写真先验)、双臂紧抱胸前(棚拍式自我拥抱)、任何背部反弓。
- 几何相容的锚定视线:转头必须给眼睛一个位于头部朝向锥内的具体目标,否则模型会静默和解——保住转头、丢掉视线锚点,眼睛落回默认目标即镜头。
- 打破身体:重心塌向单侧髋、肩部下塌、不对称站姿;静止人物写「双脚大开」会读作纪念碑式对称雕塑。
- 抓拍式构图:明确偏心、轻微侧裁、主体部分没入阴影。
「多模态」频道最新
- 单图转海报:AI 生成非重复感励志海报 — aziz4ai · 2026-08-26
- 赛博朋克射手:末日一击 — Deepdun888 · 2026-08-26
- Midjourney 技巧:利用负空间营造电影感 — tisch_eins · 2026-08-26
- LichtFeld Studio展示完整开源3D高斯泼溅工作流 — janusch_patas · 2026-08-26
- 商汤开源 SenseNova U1.5 Lite:8B 参数原生 4K 生成与精准编辑 — HeyNayeem · 2026-08-26
- 小红书 FireRedTTS3:统一语音生成与编辑模型 — jiqizhixin · 2026-08-26