从「看见人」到「行动如人」:基础模型时代的Human-Centric AI全谱系综述

栏目:互联网 | 来源:机器之心Pro | 2026-09-06 16:10

在基础模型时代,以人为中心(Human-Centric)的智能 AI 技术正在快速发展,涵盖从人体感知、三维重建、运动生成与理解,到可交互数字人、世界模型、具身智能等多个主题。当前,围绕 “人” 的研究正在从单点人体视觉任务,逐渐走向更加通用和可迁移的具身智能系统。

但与此同时,这一领域的技术路线与研究范式也变得前所未有地分化与异构,不同方向往往关注不同的人类语境:有的工作关注人体外观结构和可见属性,有的工作刻画人体自身运动及其与周围环境的交互变化,也有的工作则进一步讨论人类行为如何参与世界动态,并转化为具身智能体的可执行能力。这种分化并非偶然,而是因为以人为中心的智能本身就是一个多面向问题。它们都围绕 “人” 展开,但却缺少清晰的方法连接和统一的人体概念建模框架。因此,这以人为中心的智能研究已不再是传统意义上的单一人体任务集合,而正在发展为一个更为完整的能力谱系:从可观察主体,到动态行动者,再到处于世界之中、能够影响环境并支撑行动的情境化智能体。尤其是在基础模型时代,如何系统理解这些能力之间的关系成为关键问题。

基于此,近日由香港理工大学郭径材助理教授团队牵头,联合多个海内外顶级学术和产业机构知名学者,发布了综述《Human-Centric Intelligence in the Era of Foundation Models: A Survey》。该综述重新梳理基础模型时代的人类中心智能,基于三个视角和六个层次提出全谱系人类语境分类,并系统组织相关概念、方法、资源、评测与未来方向。借此希望为社区提供一份清晰、可持续更新的领域地图,帮助不同阶段的研究者快速进入该方向、跟进前沿进展并开展后续研究。此外,作者团队也同时发布了一个全面的 Human-Centric AI 的 GitHub 资源库,诚邀对 Human-Centric AI 感兴趣的研究者和学习者一起参与建设,共建开放学习平台,推动该领域的持续发展。

  • 论文标题:Human-Centric Intelligence in the Era of Foundation Models: A Survey
  • 论文地址:https://arxiv.org/abs/2608.18184
  • 网站地址:https://cseeyangchen.github.io/Human-Centric-AI/homepage/
  • Hugging Face 地址:https://huggingface.co/papers/2608.18184
  • GitHub 资源库地址:https://github.com/cseeyangchen/Human-Centric-AI

全谱系核心框架:从可观察主体,到动态行动者,再到情境化智能体

作者团队按照表征范围逐步扩展的逻辑来组织人类中心智能:从感知和生成人体视觉属性,到恢复和理解人体空间结构,再到捕捉和生成人体运动变化、推理和生成人与周围实体的交互,进一步预测以人为中心的世界动态规律,并最终将人类经验迁移到物理执行和智能体能力之中。这六个层次彼此关联、并非互斥,共同构成了三个视角下的人类中心智能全谱系框架。

可观察主体:先让模型真正 “看懂人”

视觉外观是人类中心智能的入口,关注图像和视频中的可见人体属性,包括构建可复用视觉先验以支持多种感知任务,基于大模型查询不同条件下的人物身份,并支持多条件人体外观生成。其趋势是从以任务为中心的共享走向面向人的专用通用性,在扩展任务覆盖的同时保持性能。

空间几何关注人体在二维和三维空间中的结构组织,涵盖姿态与网格恢复、参数化人体建模、可渲染数字人和可动画化化身等任务。其趋势是从固定的人体几何预测,走向可迁移、可交互的几何建模,但语义或视觉合理性并不等于度量准确、空间一致和物理有效,未来仍需将这些考虑纳入基础模型的使用与构建中。

动态行动者:人不是静止的目标

当模型从静态人体走向连续行为,问题就从 “人是什么样” 变成 “人如何随时间运动”。

运动动力学刻画人体状态随时间的连续变化,涵盖了大规模数据驱动的多条件运动生成建模,运动理解与生成统一模型,以人为中心的音视频生成,以及人体视频动画大模型等。它的趋势不是用更多的数据去驱动人体运动表征学习,而是统一且共享化的模型是否能在不同目标和观测条件下保持连续运动、物理有效性和细粒度人体变化。

更进一步,人类行为很少孤立发生。交互建模将物体、场景和他人纳入人类行为语境,涵盖大模型驱动的数字人以及统一多场景条件的人物生成等。其趋势是从封闭、单一的场景走向更开放的关系建模,并借助基础模型带来的开放语义,进一步迈向更加真实、可泛化的人类交互理解与生成。

情境化智能体:从预测世界到执行行动

当人被放入不断变化的世界中,问题会进一步变成:如果人这样行动,世界会怎样变化?世界模型主要关注人和世界状态如何共同演化,涵盖第一视角下的世界场景生成以及可用于规划和预测人类行为和环境变化的世界模型。其趋势是从通用视频先验走向以人为条件的世界演化,不只追求生成结果逼真,更强调世界状态的持续一致、因果响应和长时可控。

具身行动则把人类中心智能推向执行端。它主要关注如何用大模型驱动虚拟人或人形机器人产生动作智能,同时如何把人类视频行为经验迁移至不同类型的机器人上。其趋势是从孤立技能走向可复用的运动先验与控制基础,关键在于跨越不同身体和控制空间之间的差异,让人类行为经验真正转化为稳定、可泛化的行动能力。

数据、基准与评价指标:支撑系统化研究的基础设施

方法进展离不开资源体系。作者团队按照人类语境分类,将相关数据集和基准组织为人类主体、人类动态、人类交互和人类具身四类,并整理了重建、语义、生成、交互和效率等多类评价指标。当前,数据集、基准和评价指标已在基础模型时代被广泛使用,但仍缺乏能够连接多种能力的评测协议,也有待进一步走向更综合、更结构化的人类中心智能评价标准。

未来挑战:从 “看起来合理” 到 “真正可用”

人类中心智能的下一步,不能只依赖更大的模型或更多的数据。作者团队在综述中总结了六个方向:可信且可扩展的人体数据,跨六层语境迁移的人类中心基础模型,符合物理规律的人体动态表征,人类中心世界模型与具身行动智能,面向综合能力的评测协议,以及高效、模块化、可部署的系统。这些问题背后是一条共同主线:模型不能只追求视觉真实,还要在结构上可信、物理上可行、行动上有用。只有这样,人类中心智能才能从感知、生成和重建,真正走向世界模拟和可执行行动。

结语:从 “看见人” 到 “行动如人”

基础模型时代的人类中心智能,不只是更大的模型和更多的数据,而是更系统地将人体先验、模态接口与任务能力统一起来。我们希望这篇综述和持续更新的资源库,能够为社区提供一份清晰的领域地图,并推动更可扩展、可信、物理一致且可部署的人类中心智能研究。

作者信息:

本文由香港理工大学、北京大学、南昆士兰大学、同济大学、理研 RIKEN AIP、北京理工大学、悉尼大学、特伦托大学、阿里巴巴、南洋理工大学、香港科技大学的研究者联合共同完成。第一作者为香港理工大学电子计算学系博士研究生陈扬,其研究方向为 Human-Centric AI,通讯作者香港理工大学电子计算学系助理教授郭径材。

了解更多

猜你想看

← 返回首页