Human-Centric Intelligence in the Era of Foundation Models: A Survey
Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo
cs.CV
2026-08-18
综述把人体智能分成外貌、几何、运动、交互、世界模拟、具身六层,并整理数据与架构。缺口在跨层迁移、物理约束和可部署性。
人体相关工作长期按任务切片:姿态估计一篇综述、动作识别一篇、运动生成一篇、人–物交互再一篇。任务内部写得很细,层与层怎么接上,很少有人画。基础模型来了之后,可复用骨干、多模态接口、跨任务迁移成了主旋律,人体智能并没有同步走完这条路。已有的人体基础模型综述仍主要盯「人本身」,覆盖面窄。港理工牵头、北大、阿里、南洋理工等参与的这篇,要给基础模型时代的人体智能一张全谱地图。
范围划得很干净:收「把人当可观察对象、动态行动者、处境中的智能体」的方法,排除人机交互、面向人的语言模型、人体中心AI的政策讨论。
分类法按表征范围递进,六层、三种视角。
可观察对象。视觉外貌问看起来像什么,含通才感知、身份识别、可控生成。Sapiens在3亿张人体图上训ViT;Sapiens2扩到10亿张、0.4B–5B参数。空间几何问身体在三维里怎么占位,含姿态和网格恢复、可渲染数字人。
动态行动者。运动学动态抓身体状态随时间怎么变,含运动理解生成、人体视频动画。交互建模把物体、场景、其他人当成问题的一部分,接触、可供性、社交协调是人体特有的接地条件。
处境中的智能体。世界模拟让人的动作和世界状态一起演化,自我中心视频是接口。具身行动把人体经验变成可执行控制,含人形控制、人到机器人的技能迁移。
方法底座拆成三块。数据五族:视觉成像、空间结构、感觉运动、无线测距、语言声学。架构四类:单步映射、序列分解(自回归)、迭代生成(扩散或流)、混合。训练有七种机制,从从头训到LoRA、指令微调、奖励微调、蒸馏、任务头;推理侧是语义增强、引导采样、迭代修正、偏好选择、检索增强。跨多层的方法按主要建模目标和评测目标归一层,不互相排斥。
这是综述,没有新的对照实验。能当结论用的是组织结果,不是刷分。
六层任务在基础模型时代的共同走向,是从专用估计器变成可复用先验加统一接口。外貌侧,Instruct-ReID把多种重识别设定收成指令检索,ChatReID让视觉语言模型做细粒度匹配。几何侧,前馈重建和可缩放人体先验把多功能收进一个系统。运动和动画被大规模语料、语言对齐接口和预训练生成骨干接到一起。世界模型从被动未来合成往动作条件模拟器走。具身侧,通用人形策略和潜在动作预训练给出跨形体迁移路径,形体差距仍在。
评测被整理成数据集、基准和指标表。作者的判断很明确:现在缺的不是指标数量,是把它们连起来的协议。单任务高分不能说明模型能跨人体语境迁移,也不能说明同一过程里几项能力能一起工作。
开放问题列了六条:可扩展且可追溯的人体数据(合成数据会放大生成器的伪影和偏见)、统一人体基础模型、把物理约束写进表征而不是生成后再罚、人体世界模型加闭环行动智能、面向泛化和组合能力的基准套件、模块化可部署系统。
对人做人体相关产品的团队,这篇的用处是一张索引和一张坐标系。新论文可以先问落在六层的哪一层、用了哪类数据、走的是单步映射还是扩散,再决定该不该跟。Sapiens那种人体专用大规模预训练、指令式检索、以及「视觉像真但物理不成立」的警告,都能直接带进选型。
它不是一篇教你复现某个模型的论文。贡献是把碎片领域接成谱。从覆盖面和排除项看,「基础模型时代人体智能还没走完语言模型那条路」这个判断站得住。
作者把缺口写进了第8节。统一模型目前仍困在受限任务组或单一模态;视觉语言先验能生成说得通的人体行为,却经常不服从物理定律;自我中心视频规模很大,观察到的行为不能直接变成机器人控制。评测协议缺失意味着综述里罗列的方法很难横向比。
另外两处要打折。一是「第一篇全谱综述」是作者自述,HOI综述和人体基础模型综述已经被点名,边界取决于怎么定义全谱。二是方法表按主要目标归层,一篇既做网格恢复又做交互的工作会被压到一层,只看目录会漏掉交叉。GitHub资源页号称持续更新,论文正文是2026年8月的快照。