图生视频实操:让静态图片动起来的方法

图生视频是当前 AI 视频中最可控、性价比最高的用法,这篇文章讲清楚从选图到出片的完整操作路径。

为什么图生视频比文生视频更实用

文生视频的最大问题是"开盲盒"——你写了一大段提示词,生成的画面可能跟你想象的完全不一样。图生视频把这个问题解决了:你先确定一帧画面,再让 AI 在这帧的基础上生成运动。

这带来的好处很直接:

选图:不是什么图都适合动起来

图生视频对源图有几个隐性要求:

分辨率要够。 大多数图生视频工具要求源图至少 1024×1024,低于这个分辨率会被放大,动态后糊感明显。如果你用 Midjourney 生成图片,建议用 --ar 16:9 直接出横版。

构图要留运动空间。 如果主体占满整个画面,AI 没有"施展"的余地。好的做法是主体偏一侧,留出背景空间让镜头或物体运动。比如人物在画面左侧,右侧留出一条路,AI 就可以生成"人物向右走"的效果。

避免复杂文字和精细细节。 手指、文字、小纹路在动态过程中最容易崩。选图时尽量避开需要清晰展示这些元素的画面。

光影明确。 光源方向清晰的图片,AI 在生成运动时阴影更合理。反之,光源混乱的图动起来会出现"影子乱跑"的问题。

提示词:描述运动,而不是描述画面

图生视频的提示词有一个常见误区:很多人在提示词里重新描述图片内容。实际上 AI 已经能看到你的图,提示词应该聚焦在怎么动上。

好的提示词结构:

[运动主体] + [运动方式] + [镜头运动] + [氛围/速度]

举例:

要避免的写法:

常用工具实操对比

工具 单次时长 运动控制 适合场景
可灵 5-10秒 中等,支持运动笔刷 通用,中文友好
Runway Gen-3 5-10秒 较强,支持相机控制 需要运镜效果
即梦 3-5秒 基础 快速出片、社交平台
Stable Video 2-4秒 批量生成、技术实验

实用技巧:链式生成延长时长

大多数图生视频工具单次生成 5 秒左右。如果你需要更长的视频,可以用"链式生成":

  1. 用图片 A 生成 5 秒视频
  2. 取视频最后一帧作为新的起始图
  3. 用这张图再生成 5 秒
  4. 在剪辑软件里拼接

注意每一段的提示词要保持运动方向一致,否则拼接处会出现明显的"跳变"。如果用剪辑软件在拼接处加一个 0.3 秒的溶解转场,可以掩盖大部分不一致。

与配音的配合

图生视频生成的片段通常没有声音,需要后期配音。在配音魔方里,你可以先用 TTS 生成旁白音频,再根据音频时长决定需要生成几段视频来匹配。建议先把音频定下来再去做视频——调整视频长度比调整语音节奏容易得多。

小结

图生视频的核心操作思路是:好图→精准运动描述→链式延长→配音合成。把每一步都控制住,你就能稳定地产出可用的动态素材,而不是反复靠运气抽奖。