GNM Head: A Generative aNthropometric Model of the human head
Stylianos Ploumpis, Jan Bednarik, Gaspard Zoss, Ruslan Guseinov, Luca Prasso, Prashanth Chandran, Oliver Boyne, Vasileios Choutas, Timo Bolkart, Daoye Wang, Menglei Chai, Di Qiu, Sebastian Winberg, Gilles Rainer, Lewis Bridgeman, Delio Vicini, Jérémy Riviere, Yannick Boetzel, Alexander Koumis, Jay Busch, Cynthia Herrera, Jacob Still, Scott Ysebert, Peter Lincoln, Sergio Orts Escolano, Christoph Rhemann, Erroll Wood, Thabo Beeler, Stefanos Zafeiriou
cs.CV, cs.GR
2026-07-26
Google 开源 GNM(Generative aNthropometric Model),把人脸、眼球、牙齿、舌头、脖子统一进一个 3D 可形变模型(3DMM)的统计空间,弥补 FLAME 只建外壳、缺口腔和眼部结构的短板;在 2000 张合成图的单图重建上平均误差 1.683 mm,低于 FLAME 的 2.172 mm。
3D 可形变模型(3DMM)是计算机视觉和图形学的老工具:把人头三维形状和外观压进一个低维、可控的潜空间。这两年它重新变得关键,因为生成式视觉大模型(扩散模型)需要它做几何先验来精确定位生成内容,神经渲染(3D Gaussian Splatting、NeRF)也靠它锚定物理上合理的表面。
但现成的开源头部模型(FLAME、BFM、LSFM)有个根本短板:它们把人头当成一个空心壳,几乎不建口腔内部(牙、舌)和精细眼部结构。生成模型缺这些几何约束,合成张嘴镜头时质量明显掉,也失去对唇舌协同这类非语言信号的精细控制。Google 这篇就是要补上这块。
GNM(取名自人类基因组 genome 的谐音)是一个整体的参数化头部框架,把面部皮肤、眼睛、牙齿、舌头、脖子统一在同一个统计空间里。三个关键设计:
模型建在高分辨率网格拓扑上,用大规模高保真 3D 扫描数据加艺术家制作的专用资产训练。为了把统计系数变成直觉可控的滑块,作者做了一个 Semantic Sampler(双 CVAE 架构),把人口统计学和表情属性映射到平滑流形上,不产生不自然的几何扭曲。配套的拟合管线带专门的碰撞约束、舌头凸包检测和正则项,能从单图或多视图基于密集 2D 面部关键点重建 GNM 网格。
和 FLAME 在同一套管线下做单视图重建对比,数据是 2000 张合成图、7000 个真值密集 2D 关键点(用合成图是为了排除 2D 关键点检测的噪声):
| 方法 | 平均误差 (mm) | 中位数 (mm) |
| FLAME | 2.172 | 2.086 |
| GNM | 1.683 | 1.589 |
GNM 平均误差低约 22%。质的一面更重要:在自然场景(in-the-wild)单图重建里,GNM 能恢复张口、吐舌等极端口内形变甚至单颗牙齿,这是没有口腔内部模型的 FLAME 做不到的。多视图视频和极端表情的拟合也稳定。
对做数字人、面部动捕、神经渲染、以及用 3DMM 给扩散模型做几何控制的团队,GNM 是一个比 FLAME 解剖范围更全、质量更高的开源先验(学术和商用都开放,github.com/google/GNM)。牙齿、舌头、瞳孔这些以前要单独拼的资产,现在在一个可微、可控的模型里,对说话头(talking head)、唇形同步、隐私安全的合成人脸数据生成都直接有用。
重建误差的定量对比只在合成图上做,作者的理由(排除关键点检测噪声)成立,但合成图的分布和人脸真实分布有差距,真实图像上的优势幅度可能不同。文中把 GNM 和 FLAME 比,没有和更新的神经参数化头部模型(NPHM、imHead 等)在统一协议下做定量对比,后者在拓扑变化和高频细节上各有强项。Semantic Sampler 和拟合管线的很多权重是经验调的,迁移到新场景需要重新调。