Ant Research(蚂蚁)发布的数字人 4D 生成模型:"Create Anyone in 4D from a Casual Monocular Video"——把一段随手拍的单人视频转成多视角视频,再交由下游 4D Gaussian Splatting 重建出可自由转视角的动态人体。核心能力围绕人体先验、预处理链全家桶展开。

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/AntResearch/4DAnyone |
| 类型 | Model |
| 热度分 trendingScore | 74(截至 2026-08-26) |
| 许可证 | multiple-licenses(按资产分项授权,详见 LICENSE 文件与 licenses/ 目录) |
| 榜单 | HuggingFace 热榜 L4 第42名 |
Ant Research(蚂蚁)发布的数字人 4D 生成模型:"Create Anyone in 4D from a Casual Monocular Video"——把一段随手拍的单人视频转成多视角视频,再交由下游 4D Gaussian Splatting 重建出可自由转视角的动态人体。
论文 arXiv:2608.20335 上线一周即收获 76 个点赞并登上热榜 Model 榜第 42 名;配套权重全量开源并挂出 3 个在线 Demo Space。"casual monocular(普通单机位拍摄)"的输入设定砍掉了棚拍相机阵列的专业门槛,把动态数字人制作的成本下探到手机视频级别,正好踩中虚拟人内容生产的爆发期需求。
模型卡未附推理脚本,标准路径是克隆代码仓库后按 README 摆放权重:
git clone https://github.com/ant-research/4DAnyone
# 将 HF 权重放入 assets 对应目录 → 输入 mp4 → 产出 multiview 视频 → 4DGS 训练
不想配环境可直接体验 hugging-apps/4danyone-multiview-demo 等 Space,上传短视频即时查看多视角结果。
视频扩散生成环节建议 24GB 以上显存(A100/4090 级最佳);GVHMR、ViTPose 等预处理模块对显存要求低,可与生成段解耦在 CPU/轻 GPU 上排队执行;注意到未被 Inference Provider 托管,公网调用需自行封装 API。商用前务必逐项核对 licenses/ 目录中各底层资产(Wan、umT5 等)的分项条款。
对比 Cat4D、ReconFusion 等通用场景 4D 方法:以 SMPLX 人体先验换取人物形态稳定性,专精赛道不贪广度;对比 DNA-rendering 类需相机阵列的摄影棚方案:输入从专业设备降为普通手机视频,成本跨代差但保真上限亦相应让步。
项目页:4danyone.github.io|论文:arXiv:2608.20335(Jin et al., 2026)|代码:github.com/ant-research/4DAnyone|在线演示:3 个 Demo Spaces。