DeepMotion

关注
义项:AI动作捕捉工具

DeepMotion 是由美国公司 DeepMotion, Inc. 开发的 AI 动作捕捉与三维动画平台,能够从普通视频中提取人体动作并转化为三维骨骼动画,再自动重定向到用户指定的虚拟角色上。[1][2] 它属于无标记动作捕捉,不依赖动捕服装、标记点或专用摄像机,在浏览器中即可使用,降低了三维动画制作的设备门槛。[3] 其视频动捕服务 Animate 3D 是核心产品,2023 年起又加入以文本提示生成动作的生成式工具 SayMotion。[4]

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

DeepMotion 是一套以人工智能为驱动的动作捕捉与三维动画生成平台,由美国公司 DeepMotion, Inc. 开发。它的输入是普通二维视频,输出是可导入外部软件的三维骨骼动画,中间的人体姿态解算与角色绑定由平台自动完成。[1][2] 由于省去了动捕服装和专用摄像机,原本只属于专业工作室的动作捕捉环节向个人创作者开放。[3]

按输入方式划分,该平台有两条产品线。Animate 3D 以视频为输入,2023 年 10 月更新到 5.0.0 版本后支持在同一段视频中追踪多人;SayMotion 原名 MotionGPT,以文字提示为输入,可生成并编辑三维动作。[5][6] 两者均可输出 FBX、BVH、GLB 与 MP4 等格式,便于接入外部三维软件与游戏引擎。[4]

原理

Animate 3D 的流程从上传视频开始。平台接受 MP4、MOV、AVI 等常见格式,视频送入后台后由计算机视觉算法逐帧估计人体关节位置,得到姿态序列,再由物理模拟做后处理。[7][8] 可选的修正项包括足部锁定、手部接地、动作平滑与脚部滑动处理,用来减轻脚底打滑、肢体互相穿插等解算瑕疵。[1] 解算得到的骨架还经过重定向(retargeting),把动画关节映射到目标角色的关节上,这一步在平台内自动完成。[9]

在多人场景中,平台可同时追踪最多 8 个人,并为每个人分别指定角色模型。[5] 手部追踪与面部追踪属于可选功能,开启后处理时间会增加;面部追踪要求角色模型带有对应的混合形状(blend shape)。[8][1] 平台还提供转描姿态编辑器(Rotoscope Pose Editor),允许用户直接在输入视频上描摹动作,以提高输出动画的准确度。[1]

SayMotion 走的是另一条技术路线。用户输入按主体、动作、细节组织的文本提示后,平台调用自有生成式模型给出多个动作候选,每段最长约 10 秒,供用户挑选。 其核心是针对人体运动微调的大语言模型和一个大型动作模型(Large Motion Model,LMM),前者把用户的口语描述改写为模型更易理解的动作提示词,后者负责动作生成。 生成结果还能按时间段或身体部位进行动作修补(Inpainting),或由 AI 生成过渡片段把多段动作合并(Merge)为连续序列,并使用细化(Refine)、循环(Loop)等工具加工。[10]

发展历程

DeepMotion, Inc. 成立于 2014 年,总部位于美国加利福尼亚州圣马特奥,创始人为 Kevin He。[11] 他在创办公司前已在游戏行业工作十余年,曾参与魔兽世界的引擎开发,并担任过 Roblox 的技术总监和迪士尼手游工作室的首席技术官。[12] 公司团队来自暴雪、皮克斯、迪士尼、Roblox、微软、育碧等企业,早期方向是以物理模拟与机器学习实现数字角色的运动智能。[13]

2019 年 3 月,公司完成 220 万美元融资,由三星风投与 Scrum Ventures 领投。[14] 此后公司推出基于人工智能的云端动作捕捉服务 Animate 3D,把二维视频转换为三维动画,并提供免费账户与多种付费方案。[3][7]

2023 年 10 月 5 日,Animate 3D 发布 5.0.0 版本,新增多人追踪测试功能与移动端浏览器支持。[5] 同年 11 月 2 日,公司公布生成式三维动画工具 MotionGPT。[6] 12 月 14 日,该工具更名为 SayMotion,公司称改名是为避免与 OpenAI 的 GPT 系列命名混淆,并强调相关技术为自有。[15] SayMotion 于 2024 年 1 月进入封闭测试,同年 3 月 19 日开放公测。[4]

应用

DeepMotion 面向游戏开发、影视制作、扩展现实与动画教育等场景,用单机位视频快速积累动作素材库。 官方教程演示了把动捕结果导入虚幻引擎并重定向到 MetaHuman 角色的流程,也有第三方工作流把输出动画用于 Blender、Daz Studio 等软件。[16][17]

平台提供网页端、REST API 与实时 SDK 三种接入方式,开发者可将动作捕捉能力嵌入自己的应用或游戏。[8][1] 角色来源上,用户既能上传自建的 FBX 或 GLB 角色,也能使用平台内置角色,或通过 Ready Player Me、Avaturn 生成头像。[9]

SayMotion 的定位是文本到三维动作的生成,被用于游戏、扩展现实、影视、教育以及交互式媒体中的角色动画,并支持通过 REST API 在应用中动态生成动作。

局限

在公测阶段,SayMotion 只支持全身动画,手部与面部动画尚未包含在内,且仅支持桌面浏览器,移动端支持当时仍在开发中。[10]

文本生成动作还面临语言与人体运动之间的模态差异,用户较难用文字精确描述想要的动作,平台因此引入针对运动模态微调的语言模型来改写提示词;单段文本生成的动作时长上限约 10 秒,较长的叙事需要依靠修补、合并、外推等编辑功能拼接。

一篇针对 AI 视频动捕工具的比较研究以单摄像机拍摄的旋转、行走、下蹲、跳跃和手部动作 5 类动作进行测评,认为 DeepMotion 在上肢与手势还原上表现较强,Meshcapade 生成的全身动作在解剖学一致性上更好,Rokoko Vision 则以可及性与稳定的基础追踪见长;研究同时指出,不同工具适合的工作流并不相同。[18]

自定义角色还有明确的格式与骨骼要求:平台只接受带骨骼绑定的人形模型,上传文件仅支持 FBX 与 GLB,模型需以 T-pose 导出并保持单一根关节,否则会导入失败或在处理时报错。[9]

参见

  • 动作捕捉 —— DeepMotion 属于无标记动作捕捉工具。

  • 计算机视觉 —— 其视频到动作的解算依赖这一技术方向。

  • 生成式人工智能 —— SayMotion 的文本生成动作基于该方向的方法。

  • 大语言模型 —— SayMotion 用微调后的大语言模型改写用户的动作提示词。

  • 虚幻引擎 —— Animate 3D 输出的动画可导入其中驱动虚拟角色。

参考资料

  1. Animate 3D by DeepMotion | AI Motion Capture . deepmotion.com [引用日期2026-09-29]
  2. Video to 3D Animation . deepmotion.com [引用日期2026-09-29]
  3. DeepMotion Launches ‘Animate 3D’ AI-Powered Platform . awn.com [引用日期2026-09-29]
  4. deepmotion-launches-saymotion-open-beta . deepmotion.com [引用日期2026-09-29]
  5. multi-person-tracking . deepmotion.com [引用日期2026-09-29]
  6. deepmotion-launches-motiongpt . deepmotion.com [引用日期2026-09-29]
  7. animationmagazine.net 上的文件 . animationmagazine.net [引用日期2026-09-29]
  8. Animate 3D API by DeepMotion . animate-3d.com [引用日期2026-09-29]
  9. Custom Characters . animate-3d.com [引用日期2026-09-29]
  10. deepmotion.com 上的网页 . deepmotion.com [引用日期2026-09-29]
  11. DeepMotion - AI Motion Capture & Body Tracking . deepmotion.com [引用日期2026-09-29]
  12. Kevin-He . nasdaq.com [引用日期2026-09-29]
  13. DeepMotion: AI Driven Motion for Games . 80.lv [引用日期2026-09-29]
  14. DeepMotion Secures $2.2M in Funding . finsmes.com [引用日期2026-09-29]
  15. motiongpt-to-saymotion . deepmotion.com [引用日期2026-09-29]
  16. Animate a MetaHuman with Just a Video! . deepmotion.com [引用日期2026-09-29]
  17. how-to-do-motion-capture-in-blender-quick-guide . rebusfarm.net [引用日期2026-09-29]
  18. ciSereArtiView . kci.go.kr [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T08:58:00Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
动作捕捉 计算机视觉 魔兽世界 OpenAI 虚幻引擎 MetaHuman Blender Meshcapade Rokoko Vision 动作捕捉 计算机视觉 生成式人工智能 大语言模型 虚幻引擎
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。