很多人第一次生成 AI 舞蹈视频,会把全部要求压缩成一句话:

让这个人物跟着音乐跳舞,动作自然,镜头高级,电影感。

这句话看起来没有问题,但模型仍要自行猜测很多事情:

  • “这个人物”需要保持哪些外观特征;
  • 舞蹈动作参考什么节奏和幅度;
  • 镜头应该固定、跟随还是环绕;
  • 音乐中的哪个节拍对应哪个动作;
  • 服装、背景和光线是否允许变化;
  • 视频应该怎样开始和结束。

要求越含糊,生成结果越像抽奖。人物可能中途换脸,手脚出现异常,动作与音乐各走各的,镜头也可能为了追求“动感”而不断晃动。

这篇文章不比较模型排行榜,也不堆砌“8K、史诗级、电影感”等形容词,而是分享一条可以重复使用的工作流:

明确成片目标
→ 生成或整理首帧
→ 给不同参考素材分工
→ 编写动作与镜头提示词
→ 小步生成和修改
→ 剪辑、字幕与声音后期

AI 舞蹈视频视觉案例

图:AI 舞蹈视频视觉案例。首帧已经确定人物、服装、场景、构图和主色调,视频阶段只需要重点解决动作与镜头。

一、先定义“要交付什么”,再选择模型

开始生成前,建议先写一张简短的任务卡,而不是立即写长提示词。

例如:

用途:运动品牌竖屏短视频
平台:抖音、Reels、Shorts
画幅:9:16
时长:8 秒
人物:一名女性舞者
主动作:转身后完成一次有力量的定点动作
镜头:低机位小幅推进
声音:动作落点与鼓点同步
结尾:人物和商品保持清晰,方便接品牌字幕

这张任务卡有两个作用。

第一,它迫使我们减少不必要的动作。8 秒视频不适合同时安排进场、跳跃、换装、转场和产品展示。

第二,它可以帮助我们判断需要什么素材。如果只需要一个氛围镜头,文字就够了;如果要固定人物和服装,需要首帧;如果要复现特定动作或节奏,就应该加入参考视频和音频。

二、为什么复杂视频最好先做首帧

文生视频需要同时决定人物、服装、场景、构图、光线和动作。任何一个环节理解偏差,都可能让整次生成无法使用。

更稳妥的方法,是先使用 GPT Image 2 或 Nano Banana 生成一张符合要求的首帧,再交给视频模型增加运动。

首帧至少应满足以下条件:

  • 人物面部、发型和服装已经确定;
  • 做全身动作时,双手和双脚不要被裁出画面;
  • 人物周围留出足够运动空间;
  • 背景层次清楚,但不要堆放太多小物件;
  • 光线方向和主色调符合最终成片;
  • 画面比例与发布平台一致;
  • 品牌文字和字幕尽量留到后期添加。

下面是一段可以直接修改的首帧提示词:

9:16 竖屏商业短片首帧,一名短发女性舞者完整站在潮湿的城市天台中央,
穿银灰色轻质运动外套、黑色长裤和白色运动鞋,人物正面对镜头,
双手自然放松,双脚完整可见,身体周围留出舞蹈动作空间。

雨后地面形成柔和倒影,远处城市灯光呈蓝绿色散景,
一束冷色轮廓光从人物左后方照射,面部保持清晰自然。
低机位中远景,35mm 镜头,构图稳定,商业运动广告质感。

不要文字,不要 Logo,不要额外人物,不要裁切手脚,
服装结构清楚,身体比例自然。

GPT Image 2 和 Nano Banana 都可以承担首帧生成或参考图修改。与其纠结哪个模型名称更强,不如以结果为准:哪一张图的人物、构图和服装最接近最终要求,就使用哪一张。

AI 产品视觉参考

图:产品类视觉参考。先在静态画面中确定商品位置、色彩和留白,通常比让视频模型同时设计画面和运动更容易控制。

三、四种创作方式应该怎样选择

Seedance 2.0 多模态视频生成器 中,可以根据素材和目标选择不同创作方式。简单判断如下:

创作方式 适合情况 最需要写清楚的内容
文生视频 没有现成素材,只想快速验证创意 主体、动作、镜头和场景
首帧图生视频 人物、商品或构图必须保持一致 首帧中哪些内容不能改变
首尾帧图生视频 开始和结束画面都有明确要求 两帧之间怎样连续变化
多模态参考 需要同时参考人物、动作、镜头、音乐或风格 每份素材分别负责什么

不要为了“给模型更多信息”而一次上传大量参考素材。参考之间可能互相冲突:一张图片要求银色服装,另一张要求红色服装;动作视频是固定机位,文字却要求高速环绕。

第一次测试时,建议只使用:

1 张人物或商品参考图
+ 1 段动作参考视频
+ 1 段节奏参考音频

结果基本正确后,再增加场景、风格或尾帧素材。

四、给每一种参考素材明确分工

多模态参考真正有用的地方,不是上传素材本身,而是能够在提示词中说明素材之间的关系。

可以使用下面的分工方法:

@Image1:只负责人物身份、发型和服装
@Video1:只负责动作顺序、身体重心和运动速度
@Audio1:只负责节拍、动作落点和整体情绪
文字提示词:负责场景、运镜、光线、限制条件和结尾

提示词中要把这种分工写出来。例如:

保持 @Image1 中人物的面部、短发、银灰色外套、黑色长裤和白色运动鞋不变。
参考 @Video1 的动作顺序、身体重心和动作幅度,但不要复制参考视频中的人物、服装和背景。
动作速度跟随 @Audio1 的节奏,在主要鼓点处完成转身后的定点动作。

这比“参考这些素材生成一个视频”明确得多。

如果希望参考视频只提供镜头,而不提供人物动作,也要直接说明:

仅参考 @Video1 的低机位跟随方式和镜头速度,
不要复制其中的人物动作、场景、服装和色彩。

同时需要注意素材授权。真人肖像、舞蹈视频、音乐和品牌素材都应由自己拥有,或已经取得使用许可。参考动作不等于可以复制他人的角色、表演和商业作品。

五、多模态视频提示词的实用结构

一段便于检查和修改的提示词,可以拆成七个部分:

参考素材分工
+ 主体一致性
+ 主要动作
+ 节奏或时间安排
+ 镜头运动
+ 环境动态
+ 结尾与限制条件

1. 主体一致性

不要只写“人物保持一致”,而要列出最重要的识别点:

保持人物面部、短发长度、银灰色外套结构、黑色长裤、
白色运动鞋和身体比例一致,不改变服装颜色,不增加饰品。

2. 主要动作

短视频最好只安排一条完整动作链:

人物先保持稳定站姿,随后向右转身半圈,
右脚落地后身体重心下沉,双臂向两侧打开,
最后面向镜头完成一次有力量的定点动作。

3. 节奏

“跟随音乐跳舞”仍然过于模糊。可以把节奏和事件绑定:

前两个弱拍只做肩部和手臂的小幅预备动作,
第一个重鼓点开始转身,第二个重鼓点右脚落地,
最后一个鼓点完成定点并保持到结尾。

4. 镜头

只保留一种主要运镜:

镜头保持低机位中远景,从正面缓慢推进,
仅做小幅稳定跟随,不旋转,不突然变焦,不切换机位。

5. 环境动态

除了人物,场景中最好还有轻微运动:

外套下摆和头发受到微风影响,产生轻微自然摆动;
地面倒影随人物动作发生连续变化,远处薄雾缓慢横向移动。

环境动态应该服务主体,不能抢走注意力。

六、完整案例:生成一条 8 秒竖屏舞蹈短片

下面把前面的内容组合起来。

准备素材

@Image1:使用前文提示词生成的 9:16 人物首帧
@Video1:一段拥有使用许可的转身舞蹈动作
@Audio1:一段拥有使用许可、重拍清楚的 8 秒音乐

完整视频提示词

生成一条 8 秒、9:16 竖屏商业运动短片。

【参考素材分工】
保持 @Image1 中人物的面部、短发、银灰色外套、黑色长裤、
白色运动鞋、身体比例和天台构图不变。
参考 @Video1 的转身动作顺序、身体重心和动作幅度,
但不要复制参考视频中的人物、服装、背景和镜头。
动作速度与 @Audio1 的鼓点同步。

【动作】
0—2 秒:人物保持稳定站姿,只进行轻微肩部和手臂预备动作。
2—5 秒:第一个重鼓点开始向右转身半圈,动作流畅,双脚接触地面自然。
5—7 秒:第二个重鼓点右脚落地,身体重心下沉,双臂向两侧打开。
7—8 秒:人物重新面向镜头完成有力量的定点动作,并稳定保持到结尾。

【镜头】
低机位中远景,从正面缓慢推进,仅进行小幅稳定跟随。
人物始终完整出现在画面中,不裁切双手和双脚,
不旋转镜头,不突然变焦,不切换视角。

【环境与光线】
外套下摆和头发随动作产生轻微自然摆动,
雨后地面倒影连续变化,远处蓝绿色灯光和薄雾缓慢流动。
保持冷色轮廓光方向不变,人物面部始终清晰。

【限制】
不改变人物身份、发型、服装、鞋子、身体比例和场景结构;
不增加人物、文字、Logo 或额外道具;
手部和脚部结构自然,动作连续,不突然跳帧。

这段提示词很长,但每一段都有明确职责。需要修改时,也能快速找到对应位置。

例如动作不够有力,只调整“动作”部分;镜头太晃,只调整“镜头”部分;人物换脸,则强化“主体一致性”,而不是把整段提示词推倒重写。

竖屏场景构图参考

图:竖屏构图参考。为主体预留运动路径和上下空间,比生成后再强行裁切横屏视频更稳妥。

七、用“小步修改”代替反复抽卡

第一次生成的目标,不应该是直接得到最终成片,而是确认方向是否正确。

建议按下面的顺序检查:

  1. 人物身份和服装是否稳定;
  2. 主要动作是否完整;
  3. 手脚和身体重心是否自然;
  4. 镜头有没有抢走主体;
  5. 动作落点是否接近音乐重拍;
  6. 场景、光线和倒影是否连续;
  7. 结尾是否方便添加字幕或接下一个镜头。

每轮只修改一个主要变量。

如果同时更换人物图片、动作视频、音乐、运镜和提示词,我们无法判断究竟是哪项修改带来了改善。

一个比较省时间的迭代方法是:

第一轮:确认人物与构图
第二轮:确认主要动作
第三轮:调整节奏落点
第四轮:增加环境动态和光线细节
第五轮:生成备选版本并进入剪辑

先用较短时长验证动作,也能减少等待和无效尝试。方向确定后,再增加时长、画质或复杂场景。

八、常见失败结果及修改方法

问题 常见原因 优先修改方法
人物中途换脸或换装 参考图过多、特征描述含糊 减少参考图,列出必须保持的面部、发型和服装特征
手脚或身体姿势异常 动作过快、首帧裁切、连续动作太多 使用完整全身首帧,降低动作幅度,只保留一条动作链
动作与音乐不同步 只写“跟随音乐” 把重拍与转身、落地、定点等动作事件绑定
镜头随机晃动 同时要求推进、旋转、跟随和变焦 只保留一种主要运镜,明确“不切换机位”
视频像静态图片缩放 只有镜头运动,没有主体和环境动态 增加衣服、头发、倒影、薄雾或灯光的轻微运动
场景突然跳变 没写空间锚点或过渡过程 固定背景结构,写清楚变化顺序或使用遮挡物转场
文字和 Logo 变形 要求视频模型持续重绘细小文字 视频中预留位置,在剪辑软件中添加准确文字
参考素材互相冲突 每份素材都包含不同人物、镜头和风格 明确每份素材只负责一项内容,并写出不需要复制的部分

如果多次生成仍然失败,优先做减法:

  • 减少动作;
  • 减少参考素材;
  • 固定镜头;
  • 缩短时长;
  • 删除互相矛盾的形容词;
  • 把复杂故事拆成多个镜头。

复杂并不等于专业。越清楚的动作和约束,越容易得到可编辑、可交付的素材。

九、怎样从案例中学习,而不是机械复制 Prompt

不知道某种舞蹈、运镜或节奏该怎样描述时,可以先在 Seedance 提示词库 中寻找接近的结果。页面当前收录约 1900 条 Seedance 2.0 提示词案例,数量仍会更新。

建议先看结果,再拆解提示词:

它用了几个镜头?
每个时间段只有一个主要事件吗?
人物一致性写在哪里?
动作和音乐通过什么词发生联系?
镜头是主体,还是只负责辅助主体?
结尾有没有明确停留或转场?

例如,站内的节奏型霓虹洗衣店案例把音乐节奏拆成了手指敲击、抬头、起身、转身和最终定点等视觉事件。真正值得学习的不是洗衣店场景,而是“一个声音节点对应一个视觉动作”的写法。

复制提示词后,至少要重新检查四项内容:

  • 原案例时长是否与自己的时长一致;
  • 原动作是否适合新人物和服装;
  • 原运镜是否会裁切主体;
  • 原提示词中的一致性约束是否适用于新素材。

案例适合用来学习结构,而不是一键更换人物名称。

AI 社交短片视觉参考

图:创意场景可以很复杂,但提示词仍应区分主体、动作、空间、镜头和变化过程。

十、关于注册、积分和平台关系

C Dance AI 是一个独立的 AI 图片与视频创作工具,并不是字节跳动或 Seedance 的官方网站。

提示词案例可以直接浏览;提交图片或视频生成任务需要注册并登录,生成时会根据所选模型和设置消耗积分。本文不提供套餐推荐,实际规则以创作页面显示为准。

使用真人、音乐、品牌和参考视频时,请确认拥有相应授权;最终用于广告或商业发布前,也应人工检查人物、文字、商标、声音和内容合规性。

总结

多模态视频并不是“参考素材越多越好”,而是要让每一种素材各司其职:

图片负责人物、商品和构图;
视频负责动作、镜头或节奏参考;
音频负责声音与动作落点;
文字负责组织关系、补充环境并限制错误变化。

先用 GPT Image 2 或 Nano Banana 把首帧做对,再用 Seedance 2.0 解决运动;先完成一条主要动作,再增加镜头和场景变化;每轮只调整一个变量。

当任务、素材分工、动作、镜头和限制条件都足够清楚时,生成过程才会从“反复抽卡”变成可以分析和改进的创作流程。

更多推荐