Text to 3D Motion:用一句话生成 3D 角色动画

2026/10/01

Text to 3D motion(文本生成 3D 动作)把一句自然语言变成骨骼动作数据:你描述一个动作,AI 动作模型在已绑定骨骼的默认角色上生成这段动作,然后你导出一个能直接在 Blender、Unity、Unreal 中打开的动画 FBX。整个过程不需要动捕服、不需要参考视频、不需要打关键帧,也不需要上传模型。提示词是唯一的输入。

这让它成为"从一个想法到一个会动的角色"之间最快的路径。动捕需要设备,预设库需要运气,而 text to 3D motion 只需要一句写清楚的话。本指南讲清这项技术到底产出什么、流程如何运作、怎样写出能生成好动作的提示词,以及如何把结果带进你自己的项目。

要点

  • Text to 3D motion 根据文字描述生成骨骼动作,并在已绑骨、已蒙皮的默认角色上播放;导出的是动画 FBX,不是渲染好的视频。
  • 可靠的动作提示词遵循"角色、动作、细节"的模式,上限 128 个字符。简单英文或中文都可以。
  • 时长固定为 3、5、8、12 秒四档,或选 Auto 由工具按动作匹配合适长度。每次生成 20 积分,与时长无关。
  • 提示词增强默认开启:AI 会先改写并补充细节再生成。需要字面精确(比如确切出拳次数)时可以关闭。
  • 想把动作用到自己的角色上,可以把 FBX 重定向到已绑骨的模型,或使用包含自动绑骨、一步到位的完整动画流程。

Text to 3D motion 是什么?

Text to 3D motion 是一种把自然语言描述的动作转换成 3D 角色动作的生成技术。你写出要做的事,比如"一个人向前走并用右手挥手",系统就会生成执行这个动作的骨骼动画。产出物是动作数据,与一次动捕录制或动画师的手工关键帧属于同一类资产。

这一点比听起来更重要,因为"文本生成动画"的搜索结果里混着两种完全不同的产品。一类工具生成带说话头像的渲染视频,面向社交内容;text to 3D motion 生成的是包含蒙皮角色的动画 FBX 文件,面向游戏引擎和 3D 软件。如果你的目标是在 Blender、Unity、Unreal 里得到一个会动的角色,你要的是第二种;如果目标是零 3D 工作量的成片视频,第一种更合适。

以关卡设计师 Tomás 为例。他在给一个潜行关卡做灰盒验证,需要一段守卫巡逻循环:走、停、环顾、继续走。他没有动捕服,没有素材,也没有时间给占位动画打关键帧。他把动作输入 text to 3D motion 工具,选了 5 秒时长,几分钟后就在默认角色上预览到了生成的片段。这段动画不是最终成品,也不需要是。它让场景变得可评审,"守卫动作感觉太慢"这条意见因此提前两周出现。

Text to 3D motion 是如何工作的?

流程一共三步。你提供句子,其余全部由系统提供,包括角色。

1. 写动作提示词

用日常语言描述动作,上限 128 个字符。一个稳定生效的结构:先说角色,再说动作,最后补细节。"一个人向前走并用右手挥手"完全符合这个结构。用简单的英文描述效果最可预测,也支持中文。一条连贯的动作链胜过一堆不相关的动词,而 128 字符的限制恰好逼你遵守这条规则。

2. 生成动作(含增强)

动作模型读取提示词并生成匹配的动作。生成之前,提示词增强会先改写你的句子、补充细节:一个只有两个词的提示词会以更完整的描述进入模型,通常生成更自然的动作。增强默认开启,费用已包含在内。当需要字面精确时,确切的动作次数、确切的方向、精确的顺序,可以在高级设置里关闭它,让模型严格按你的原文执行。

时长也在这一步选择:3、5、8、12 秒四档,或 Auto(按描述的动作选择合适的长度)。每次生成 20 积分,无论选哪档时长、开不开增强都一样。底层由腾讯混元 3D(Tencent Hunyuan 3D)的动作生成能力驱动。

3. 预览并导出动画 FBX

确认前先在浏览器里播放结果。如果动作读起来不对,修复方式通常是改提示词,而不是重跑整个流程。预览满意后导出动画 FBX。文件包含蒙皮好的默认角色,无需组装就能进入标准 3D 工具:不用连骨骼,不用刷权重。

如果这条流程符合你的工作,text to 3D motion 工具就在浏览器里运行。

文本提示词、动捕、预设库、关键帧:该选哪条路

通往角色动作的每条路解决的是同一个问题的不同侧面。正确的问法不是"哪个工具最好",而是"你手里已经有什么"。

动作来源你需要提供你得到的东西适合场景注意点
动捕服录制硬件、演员、一次录制高保真动作数据关键镜头级的真实动作成本与档期
视频动捕动作的参考视频从视频中提取的动捕你能拍出来的动作必须先有一段视频
预设库已绑骨的角色固定列表里的片段走、跑、待机等标准循环你要的动作未必存在
文本提示词一句话按需生成的动作定制动作、快速迭代提示词模糊则动作模糊
手动关键帧技能与时间你摆出来的任何东西最终精修、标志性镜头最慢的一条路

预设库是大多数创作者最熟悉的路线。Adobe 的 Mixamo 把它变成了默认选项:给人形自动绑骨、浏览动捕库、免费导出 FBX。对标准走跑循环它至今仍是可靠答案,局限在于"只能选"。当守卫需要把"走、停、环顾"作为一条连续动作完成时,三个独立片段需要剪辑和混合,前提还是三个片段都存在。

Text to 3D motion 把交易反了过来:动作是按你的句子生成的,不是在目录里找的。迭代靠改词完成,比重录素材或拖时间线都快。代价是控制力。你在用语言驾驶一个生成模型,结果匹配的是你的意图,而不是你的逐帧规格。

手动关键帧仍是最终质量的路。Cascadeur 这类工具在桌面动画套件里加入了 AI 辅助摆姿和物理修正,关键镜头值得那种精细度。许多团队落地的分工是:用生成动作做预演和迭代,再给最重要的镜头打关键帧或做清理。

怎样写出有效的动作提示词

动作提示词是舞台调度指令,不是搜索关键词。模型执行的是词语所指定的内容,所以词语得真的指定了内容。

三样东西让提示词变得可靠:

  1. 角色: 谁在动。"一个人"就够了,工具动画的是它自带的默认角色。
  2. 动作链: 一条连贯序列,不是许愿清单。"向前走、停下、环顾四周"是一条链;"又跳舞又打架又跳跃"是三个提示词硬挤成一个。
  3. 细节: 方向、用手、速度、结尾。"用右手缓慢地挥手"告诉了模型它猜不出来的东西。

对比弱提示词和更好的版本:

弱提示词更好的提示词为什么更好
"跳舞""拍两下手,向左转一圈,然后鞠躬"有计数、有方向、有结尾
"打架""两记快速直拳,接一记回旋踢"顺序和速度都说清楚了
"走路""缓慢向前走,停下,环顾四周"有节奏的动作链,不是单个动词
"锻炼""做三个开合跳,然后双臂向上伸展"具体、可计数、有终点

128 字符的限制是个设计上的优点。它大约就是一条描述清楚的动作链的篇幅,逼你决定这个片段到底是什么。当你的想法塞不进去时,它多半本来就是两个片段。

简单动作的生成结果最稳定:走、跑、跳、挥手、短舞蹈。体操级别的组合可能出现四肢交叉处的轻微穿模,所以把极端动作当作实验来做,并在预览里仔细检查。

时长也值得有意选择,因为同一句提示词在不同长度下读起来完全不同:

时长适合例子
3 秒单个姿态或单一动作挥手打招呼、转身
5 秒一条有结尾的动作链向前走、停下、环顾四周
8 秒组合动作或短序列跑步急停、拳击连招
12 秒一小段表演一段短舞蹈
Auto不确定时;按动作匹配长度以上任意一种

短片预演师 Aisha 用一个下午学会了这条限制。她的第一句提示词想在 128 个字符里排进四个动作:走近、坐下、起立、挥手。生成的动作是一团糊,每个动作都被采样到、没有一个被完成。拆成两句提示词,"走到椅子前坐下"和"站起来挥手",得到了两段干净的片段,剪辑起来正好按分镜走。128 字符不是约束,"一个片段装四个动作"才是。

提示词增强:什么时候开,什么时候关

提示词增强是个名字不起眼、实际影响很大的功能。开启时,AI 会在生成前改写你的提示词,补上句子没写的身体细节:重心转移、动作跟随、自然的起始姿态。像"一个人跳舞"这样的提示词会以完整得多的描述进入动作模型,而更完整的描述通常生成更饱满的动作。

因为它自动运行、不额外计费,大多数工作都值得保持默认开启:

场景增强原因
提示词很短或很笼统保持开启改写会补上你省略的细节
想要自然、有表现力的动作保持开启跟随和重心的观感更好
在乎确切的动作次数关闭"两拳"就应该还是两拳
在乎精确的方向和顺序关闭左就是左,顺序由你说了算

关闭开关在高级设置里。经验法则:增强是在"解释",所以想要解释时开着,想要服从时关掉。

从导出的 FBX 到你的制作流程

导出物是一个动画 FBX,同时包含动作和执行动作的蒙皮默认角色。对 Blender、Unity、Unreal 和大多数 3D 工具来说,这是一次标准的 FBX 导入:进来时检查缩放和向上轴,确认动画数据随网格一起到位。Blender 的 FBX 导入文档 讲清了导入角色过大、旋转或丢动画时最该检查的设置。

从那里出发,有两条路通向你自己的角色。

第一条是重定向(retargeting)。动作数据在骨骼之间迁移的效果很好,每个主流 DCC 和引擎都有为此准备的重定向工具。前提是目标已绑骨:你的角色需要先有一副骨骼才能接收动作。如果模型还是静态网格,可以先用 AI 自动绑骨工具 生成骨骼和蒙皮权重,重定向就有了落点。

第二条路省去组装步骤。AI 3D 角色动画生成器 在一个流程里对你上传的 FBX 或 GLB 完成自动绑骨和动作生成,动作直接落在你的角色而不是默认角色上。当目标角色已经存在、而动作本身比打草稿的速度更重要时,它是更合适的工具。

独立开发者 Ken 走的第一条路带了个插曲。他在默认角色上生成了一段拳击连招,想重定向到自己游戏里的低模格斗家,结果发现没有重定向的落点:模型没有骨骼。一次自动绑骨之后,重定向顺利完成,这趟弯路花的时间仍比手工给连招打关键帧少。教训不是重定向难,而是"骨骼是前提"这件事没人提前告诉你。

常见错误

一句提示词塞进太多动作。 128 字符不是要用满的配额。一条链一个片段、剪辑台上拼接,永远好过一个拥挤的片段。

只写一个词。 "跳舞"给模型的是一个类别,不是指令。有计数、有方向、有结尾的动作才能生成可用的结果。

期待逐帧级别的编排。 Text to 3D motion 匹配的是意图,不是关键帧编号。当时间必须精确到帧时,那个镜头属于关键帧,可能还要关掉增强再做一轮清理。

跳过预览。 浏览器预览存在的意义,就是让穿模、手腕折叠、滑步在导入往返之前被发现。看两分钟,省一小时。

把 Auto 时长当赌博。 Auto 读取描述的动作并匹配长度。当你真的不知道一条链要 5 秒还是 8 秒时,Auto 是有依据的默认值,不是抛硬币。

常见问题

Text to 3D motion 是什么?

Text to 3D motion 是把动作的文字描述转换成 3D 角色动作数据的技术。你写一句"一个人向前走并挥手",AI 动作模型就在已绑骨的默认角色上生成这段动作,并导出为面向 3D 软件和游戏引擎的动画 FBX。

文本生成的动作能有多长?

时长有 3、5、8、12 秒四档,另有 Auto 选项按描述的动作匹配合适长度。需要更长的序列时,分段生成再剪辑拼接。

用 text to 3D motion 需要先准备绑好骨的角色吗?

不需要。工具动画的是自带的默认角色,已绑骨、已蒙皮。你只需要写提示词,没有上传这一步。

可以把动作用到我自己的角色上吗?

可以,两种方式。把导出的 FBX 重定向到你的角色上,前提是你的角色已有骨骼;或者使用完整动画流程,直接在你上传的模型上绑骨并生成动作。

导出的文件包含什么?

一个动画 FBX 文件,同时包含动作和执行动作的蒙皮默认角色。可直接导入 Blender、Unity、Unreal 以及其它支持 FBX 动画的工具,无需额外组装。

Text to 3D motion 要花多少积分?

每次生成 20 积分,与时长和提示词增强设置无关。

从一句话到一个会动的角色

Text to 3D motion 把"描述一个动作"和"看到它被演出来"之间的距离压缩到最短。写一句包含角色、动作链和一两个细节的清楚的话,选一个时长或交给 Auto,带着挑剔的眼光预览,然后导出一个在所有支持 FBX 的地方都能用的动画 FBX。探索时开着增强,求精确时关掉,并记住:想让动作上自己的角色,骨骼就是那张门票。

当下一个动作想法还只是一句在你脑子里的话,去用文本生成 3D 动作,看它动起来。用赠送积分开始,提示词写得具体些,让第一个片段替你的项目开个头。

Image3D AI Team

Image3D AI Team

ImageToSTL

Text to 3D Motion:用一句话生成 3D 角色动画 | 博客