图生视频是当前 AI 视频中最可控、性价比最高的用法,这篇文章讲清楚从选图到出片的完整操作路径。
文生视频的最大问题是"开盲盒"——你写了一大段提示词,生成的画面可能跟你想象的完全不一样。图生视频把这个问题解决了:你先确定一帧画面,再让 AI 在这帧的基础上生成运动。
这带来的好处很直接:
图生视频对源图有几个隐性要求:
分辨率要够。 大多数图生视频工具要求源图至少 1024×1024,低于这个分辨率会被放大,动态后糊感明显。如果你用 Midjourney 生成图片,建议用 --ar 16:9 直接出横版。
构图要留运动空间。 如果主体占满整个画面,AI 没有"施展"的余地。好的做法是主体偏一侧,留出背景空间让镜头或物体运动。比如人物在画面左侧,右侧留出一条路,AI 就可以生成"人物向右走"的效果。
避免复杂文字和精细细节。 手指、文字、小纹路在动态过程中最容易崩。选图时尽量避开需要清晰展示这些元素的画面。
光影明确。 光源方向清晰的图片,AI 在生成运动时阴影更合理。反之,光源混乱的图动起来会出现"影子乱跑"的问题。
图生视频的提示词有一个常见误区:很多人在提示词里重新描述图片内容。实际上 AI 已经能看到你的图,提示词应该聚焦在怎么动上。
好的提示词结构:
[运动主体] + [运动方式] + [镜头运动] + [氛围/速度]
举例:
要避免的写法:
| 工具 | 单次时长 | 运动控制 | 适合场景 |
|---|---|---|---|
| 可灵 | 5-10秒 | 中等,支持运动笔刷 | 通用,中文友好 |
| Runway Gen-3 | 5-10秒 | 较强,支持相机控制 | 需要运镜效果 |
| 即梦 | 3-5秒 | 基础 | 快速出片、社交平台 |
| Stable Video | 2-4秒 | 弱 | 批量生成、技术实验 |
大多数图生视频工具单次生成 5 秒左右。如果你需要更长的视频,可以用"链式生成":
注意每一段的提示词要保持运动方向一致,否则拼接处会出现明显的"跳变"。如果用剪辑软件在拼接处加一个 0.3 秒的溶解转场,可以掩盖大部分不一致。
图生视频生成的片段通常没有声音,需要后期配音。在配音魔方里,你可以先用 TTS 生成旁白音频,再根据音频时长决定需要生成几段视频来匹配。建议先把音频定下来再去做视频——调整视频长度比调整语音节奏容易得多。
图生视频的核心操作思路是:好图→精准运动描述→链式延长→配音合成。把每一步都控制住,你就能稳定地产出可用的动态素材,而不是反复靠运气抽奖。