Strand-based Hairstyle Generation via Large Reconstruction and Multimodal Models
Conghui Hao, Tao Huang, Yuefan Shen, Tongtong Wang, Zhongtian Zheng, Kui Wu
cs.GR
2026-08-14
论文用现成大重建模型建头发网格、大多模态模型判方向与分区、经典扩散传播方向场,不训练任何网络,单图 20 分钟出发丝,IoU 达 0.75,明显超过此前最好方法的 0.64。
逐发丝级(strand-based)三维头发建模,是数字人、影视和游戏管线里既昂贵又难自动化的一环,目前主要还靠美术师手工画发丝走向,耗时且难以规模化。已有的学习式方法能从单张图片重建头发,但普遍要靠大规模标注数据训练一个体积朝向场预测网络,再从预测的场里描出发丝。这类方法对辫子、丸子头、马尾这类结构复杂但训练数据里稀少的发型泛化很差,不少方法输出的还是隐式表示(神经场、VAE 隐向量),不能直接拿去做发丝级的编辑和物理仿真。这篇论文绕开「训练一个头发生成网络」这条路,直接用现成的大重建模型(LRM)和大多模态模型(LMM)拼出一条不需要任务专属训练、不需要采集数据的重建流水线。
流水线分五步。先用现成 LRM(论文用 Tripo 3D)把单张肖像图重建成粗糙三维网格,和一个带头皮遮罩的模板头模对齐,减去头模部分得到一个完整闭合的头发网格。接着把网格从六个视角(正面、背面、左右、左右俯视)渲染成无纹理灰度图,用 LMM(论文用 Nano Banana 2)在每张渲染图上生成一张强调发丝走向的灰度引导图,再用图像结构张量在这些引导图上估计逐像素的局部方向,投影回三维网格表面。第三步同样交给 LMM:在渲染图上识别分缝线和扎起来的区域(马尾、丸子头),据此把头发表面切成松散、汇聚、约束、头皮四类语义分区,这一步的作用不是描出具体发丝,是给后面的方向扩散提供全局结构约束。
拿到表面方向和语义分区后,论文用一个三阶段的扩散-修正-扩散流程,把方向场从可见表面传播进整个头发体积:第一阶段在表面上用张量场平滑填补被遮挡区域缺失的方向;第二阶段解决方向的符号歧义(表面张量只知道走向不知道朝哪个方向),依据语义分区先验(汇聚区朝约束区流、约束区背离约束区流、松散区顺重力流)给每个方向定号;第三阶段把定好号的表面方向,以头皮法线为边界条件,扩散进头发体积内部,解出体积朝向场。最后按体积朝向场做双向追踪生成发丝,对追踪后仍稀疏的区域补种发丝提高覆盖率。整个过程不训练任何网络,LRM 和 LMM 都是现成模型,论文强调可以直接换成其他基础模型。
论文在 NeuralHDHair、HairStep、DiffLocks、Im2Haircut 四个开源基线上做了定量对比,用输入视角渲染后与原图的轮廓 IoU、和 HairStep 方向估计误差(Ori-Err)两个指标衡量:
| 方法 | IoU↑ | Ori-Err↓ |
| NeuralHDHair | 0.52 | 68.4° |
| HairStep | 0.64 | 55.5° |
| DiffLocks | 0.61 | 55.6° |
| Im2Haircut | 0.64 | 45.1° |
| 本文方法 | 0.75 | 32.6° |
对未开源的最新方法 HairLRM、HairGPT,论文用它们论文里的同一张输入图直接对比渲染结果,定性上头发整体形状和局部细节保留得更好。消融实验显示,去掉三阶段方向扩散、改用 HairStep 预测朝向后接体积扩散,在训练集里没见过的发型上明显失效,尤其汇聚区和分缝区方向紊乱;跳过符号消歧直接扩散无向方向场,会让发丝在体积内部打卷缠向头皮。采样密度消融显示 5000 个体积采样点会导致追踪失败,10 万个采样点相比默认的 1 万个没有明显提升。整条流水线单个人像约 20 分钟(LRM 建网格 3 分钟、LMM 多视角查询 3 分钟、语义处理 3 分钟、方向扩散 3 分钟、5 万根发丝追踪 8 分钟),比 Im2Haircut 小时级的可微渲染优化快得多。
这篇论文验证的是一条工程路线:不训练头发专用网络,靠拼装现成的通用 LRM、LMM 和经典几何处理,也能在发丝级重建上超过专门训练的方法,尤其是在训练数据稀缺的复杂发型上优势明显。对做数字人管线的团队,这意味着可以省掉采集头发数据集、训练专用网络这一整条链路,用现成的图像生成或重建 API 拼一个可用的发丝重建工具;论文也验证了输出可以直接导入 Unreal Engine 做仿真渲染,兼容标准的美术梳理工作流。代价是重建质量强依赖 LRM 和 LMM 两个黑盒模型的能力,论文没有单独量化替换成更弱或更强的基础模型会带来多大的效果波动。
论文明确写了两条局限:一是高度复杂的卷曲或纠结发型,因为发丝互相缠绕的拓扑结构很难从单张图片可靠推断,重建会出现走向错误、细节缺失、局部不连贯,论文附了失败案例图;二是重建表面上表现较弱的细粒度发丝细节难以完整恢复。作者提出的后续方向是支持辫子等更复杂拓扑、把几何重建和语义理解结合得更紧、加交互式编辑工具。此外,论文的语义分区流程(拼接分缝线、合并相近多段线)依赖若干手调阈值,只说「在展示的样例上稳健」,没有给出对阈值敏感度的量化评估;定量对比也只在四个开源基线上做,HairLRM、HairGPT 因未开源只能做单图定性对比,不构成严格的数字对照。