L2-C5 视频生成基础:文生视频、图生视频、镜头语言与核心参数

保姆级教程 · 面向纯小白与自媒体人

项目 信息
课程系列 AI 创作入门 · L1-C 图片/视频
课程编号 L1C-05
难度等级 ★★☆☆☆
适用人群 想把 AI 图片做成动态素材,或第一次尝试生成视频的创作者
预计学时 75-100 分钟
前置课程 L1C-01、L1C-02,建议读完 L1C-03
更新日期 2026 年 8 月
内容声明 视频模型、时长、额度和参数名称更新很快,具体能力以当前平台页面为准。本文讲通用方法论,不绑定特定工具

学习目标

学完本教程后,你将能够:

  1. 分清文生视频、图生视频和视频生视频三种模式的适用场景与难点。
  2. 运用"主体 + 动作 + 环境 + 镜头 + 时长"五块结构写出可执行的视频提示词。
  3. 选择时长、比例、分辨率、运动幅度等参数,知道每个参数管什么。
  4. 识别主流视频生成工具(可灵、即梦、Runway、Sora、海螺)的特点和适用场景。
  5. 诊断画面闪烁、主体变形、动作不完整和镜头失控等常见问题。
  6. 生成可供剪辑使用的短镜头素材,而不是期待一次得到完整成片。

前置准备

你需要什么

你不需要什么


一、视频生成到底生成什么

1.1 从"一张画面"到"连续画面"

图像生成只需要判断"一张画面是什么样"。视频生成还要判断"下一帧怎样变化"——这就引入了时间维度的挑战。

打个比方:图像生成像拍一张照片,视频生成像拍一段视频。照片只需要构图和光影好看;视频还需要人物动作连贯、背景不闪烁、镜头运动平滑。难度完全不同。

新手最关键的认知转变:

一次 AI 视频生成 = 一个镜头素材,不是一条完整短视频。

不要期待输入"做一个 30 秒的早餐教程视频"就能得到一条可以发布的成片。正确的用法是:一次生成一个 5 秒的镜头,多个镜头拼接成一条完整视频。

1.2 三种生成模式

模式 输入 适合场景 难点 新手建议
文生视频 纯文字 从零探索空镜、氛围和动作 主体与画面稳定性难控 先用来做风景空镜
图生视频 一张图片 + 文字 让封面、产品或角色动起来 首帧结构与运动强度 第一次练习首选
视频生视频 原视频 + 文字/参考 改风格、改服装或做视觉变化 时序一致、版权与算力 有经验后再尝试

第一次练习建议选择图生视频,因为首帧已经确定(你提供的那张图),更容易判断运动是否符合预期,出问题时也更容易定位是"图的问题"还是"提示词的问题"。


二、主流工具速览

2026 年视频生成领域工具更新很快,以下是在中文创作场景中使用者较多的几款。本教程不绑定任何特定工具,你掌握的提示词结构和参数逻辑在所有工具间通用。

工具 特色 中文支持 适合场景 新手友好度
可灵 国产,中文提示词直接可用,运动控制较稳 ✅ 原生 短视频素材、产品展示、空镜 ★★★★
即梦 字节系,与抖音生态近,图生视频方便 ✅ 原生 抖音/小红书素材、封面动起来 ★★★★
Runway 海外老牌,功能丰富,风格化强 🟡 部分 创意视频、风格变换、实验性内容 ★★★
Sora OpenAI 出品,物理理解强,长视频能力突出 🟡 部分 复杂场景、多镜头叙事 ★★★
海螺 AI 视频助手,操作门槛低 ✅ 原生 快速生成、新手入门 ★★★★★

选工具的建议:纯小白先用可灵或海螺的免费额度跑通"图生视频"流程。工具会迭代,但"先图生视频、短时长、单一动作"的方法论不变。以当前官方能力为准。


三、镜头语言:把"好看"写成动作

3.1 五块提示词结构

视频提示词比图像提示词多了"动作"和"时长"两个维度。建议按下面五块来组织:

主体 + 动作 + 环境变化 + 镜头运动 + 画面风格/时长

完整示例:

一只圆滚滚的橘猫吉祥物站在窗边,轻轻抬头看向窗外,窗帘被微风吹动,
镜头缓慢向前推近,柔和晨光,稳定自然的 5 秒 3D 卡通短镜头,主体保持完整

逐块拆解:

板块 内容 作用
主体 圆滚滚的橘猫吉祥物,站在窗边 画面里的主角和初始状态
动作 轻轻抬头看向窗外 主体要做什么(只一个)
环境变化 窗帘被微风吹动 背景有什么微妙变化
镜头运动 镜头缓慢向前推近 摄影机怎么动
风格/时长 柔和晨光,5 秒 3D 卡通短镜头,主体保持完整 画面基调和时间长度

核心原则:"轻轻抬头""缓慢推近"比"动起来""很有活力"更容易执行。一次只安排一个主要动作,避免让主体同时跑、转身、挥手、跳跃和讲话。

3.2 常见镜头运动

镜头运动是视频提示词的核心。以下是五种基础运镜,按稳定性从高到低排列:

运镜 描述 适合场景 稳定性
固定镜头 摄影机不动,主体动 人物微表情、产品展示、风景空镜 ★★★★★
推近/拉远 摄影机向前推或向后拉 突出主体或交代环境 ★★★★
横向摇移 摄影机左右移动 展示空间或跟随主体 ★★★
跟拍 摄影机随主体移动 动作明确的场景 ★★★
环绕 摄影机绕主体旋转 展示产品或人物立体感 ★★

新手学习顺序:固定镜头 → 缓慢推近 → 简单摇移 → 跟拍 → 环绕。先控制运动,再追求复杂运镜。

3.3 运镜提示词模板

# 固定镜头
镜头固定不动,主体在画面中[动作],背景[环境变化]

# 推近
镜头缓慢向前推近,从[全景]逐渐过渡到[中景/特写]

# 拉远
镜头缓慢向后拉远,从[特写]逐渐展示[全景环境]

# 横向摇移
镜头从左向右缓慢移动,展示[场景内容]

# 跟拍
镜头跟随主体[移动方向],保持主体在画面中心

3.4 动作描述的注意事项

写法 效果 建议
"轻轻抬头" 明确、可执行 ✅ 推荐
"缓慢挥手" 明确、幅度小 ✅ 推荐
"动起来" 模型自由发挥,结果随机 ❌ 避免
"很有活力地运动" 模型不知道做什么 ❌ 避免
"同时走路、转身、挥手" 多动作叠加,容易变形 ❌ 避免,拆成多个镜头

经验法则:如果让你的同事照着这句话做动作,他能做出来,那模型大概率也能生成。如果他不知道做什么,模型也不知道。


四、参数怎么选

4.1 比例与时长

比例 适用场景 注意事项
9:16 短视频、手机全屏 抖音/快手/小红书首选
16:9 横版视频、课程、长视频 B站/YouTube/公众号
1:1 社交媒体方形素材 Instagram/朋友圈
3:4 图文平台视觉内容 小红书图文/竖版配图

时长选择:

为什么不要直接生成 30 秒? 因为视频模型的时序错误会随时间累积。5 秒的镜头可能很好,10 秒开始闪烁,30 秒可能面目全非。短镜头 + 剪辑拼接是 AI 视频生产的标准做法。

4.2 运动幅度

运动幅度可以理解为画面变化的激进程度。不同工具叫法不同(运动强度、创意度、动态值等),但原理一致:

幅度级别 适合场景 风险 新手建议
产品展示、人物微表情、风景空镜 画面可能显得不够动 静态主体首选
轻微走动、镜头推近、风吹物体 变形风险低 新手首选
跑跳、旋转、快速运镜 变形、闪烁和穿帮明显增多 有经验后再用

使用建议:若工具只有"创意度""运动强度"等名称,先用默认值,第二轮只调这一项并记录结果。不要同时调运动幅度和其他参数。

4.3 分辨率与帧率

参数 作用 新手建议
分辨率 画面清晰度 低分辨率适合测试动作和构图,最终交付再选更高分辨率或放大
帧率 播放流畅度 先保证动作连贯,再考虑帧率。帧率不能修复主体每帧变形

不要迷信高分辨率:如果动作和连续性不对,4K 分辨率只是"更清晰的错误"。先生成低分辨率验证构图和动作,确认满意后再做高清版本。

4.4 参数速查表

参数 一句话作用 新手建议
比例 决定画面宽高 按发布平台先定
时长 单次生成的秒数 先用 5 秒,够短够稳
运动幅度 画面变化的激进程度 先用中或低
分辨率 画面清晰度 先低分辨率测试,满意再高清
帧率 播放流畅度 用默认值,不是优先调的参数

五、图生视频实操

图生视频是新手最推荐的首选模式。首帧已确定,更容易判断运动是否符合预期。

5.1 标准流程

  1. 选择一张好的起始图:主体完整、背景干净、构图稳定。
  2. 按发布平台选择竖版或横版画布
  3. 提示词只描述"要发生的变化",不要重新描述一套互相冲突的画面。
  4. 先写一个动作和一个镜头运动
  5. 使用中等运动幅度生成 3-4 个候选
  6. 先看首帧和末帧,再看中间是否闪烁、变形或突然换场。
  7. 选可剪辑的一段,记录图片、提示词、时长、比例和版本。

5.2 产品展示示例

起始图:L1C-03 生成的白色无线耳机产品图。

保持无线耳机的外形、颜色和位置不变,镜头缓慢从左向右移动,
耳机表面出现柔和高光,背景保持干净,自然阴影稳定,
5 秒产品展示镜头,不要新增文字和配件

关键:开头写"保持...不变",这是图生视频最重要的提示词模式——告诉模型什么不能变。

5.3 人物/IP 示例

起始图:L1C-04 生成的橘猫吉祥物正面图。

保持橘猫吉祥物的脸部、绿色围巾和比例不变,它缓慢挥手并眨一次眼,
镜头固定,窗帘轻微摆动,柔和晨光,动作自然,
5 秒短镜头

关键:镜头固定 + 单一动作(挥手),最大化稳定性。

5.4 图生视频的验收标准


六、常见问题诊断

6.1 诊断速查表

问题 常见原因 处理顺序
主体变形 动作过大、运动强度高、首帧不清 换更清楚的首帧 → 降低动作和强度
画面闪烁 背景细节复杂、镜头变化太快 简化背景 → 改固定镜头或慢推
手脚穿帮 人物动作过复杂 改为半身或单一动作 → 减少时长
产品结构改变 没有强调保持外形 使用真实参考图 → 局部运动 → 加"保持不变"
镜头不按要求走 镜头词抽象或要求过多 只保留一个明确运镜 → 用具体动词
末尾突然结束 动作超出时长 提前描述"动作缓慢完成并停住"
整体颜色偏移 风格词与首帧冲突 去掉多余风格描述 → 只写变化部分

6.2 不要用负向词解决所有问题

视频质量首先取决于首帧质量、动作复杂度和时序连续性。负向提示只做辅助,不能修复根本问题。

# 不好的做法:堆一堆负向词
不要变形,不要闪烁,不要穿帮,不要变色,不要突然结束

# 好的做法:从源头控制
保持主体外形不变,单一轻微动作,镜头固定,5 秒短镜头,动作缓慢自然完成

七、第一次练习:三镜头小样片

主题:"橘猫开始一天的工作"。

镜头规划

镜头 运镜 画面 时长 提示词
1 固定 橘猫坐在桌前翻开笔记本 5 秒 橘猫吉祥物坐在木桌前,缓慢翻开一本笔记本,镜头固定,柔和晨光,5 秒
2 缓慢推近 橘猫抬头思考,窗帘轻微摆动 5 秒 橘猫吉祥物抬头看向斜上方,窗帘轻微摆动,镜头缓慢向前推近,柔和晨光,5 秒
3 横向摇移 桌面出现早餐和便签 5 秒 桌面上有一碗早餐和一张便签,镜头从左向右缓慢移动,柔和晨光,5 秒

操作步骤

  1. 三个镜头分别生成,不要在一个提示词里要求完整故事。
  2. 每个镜头生成 3-4 个候选,选最稳定的一段。
  3. 剪辑时保留每段最稳定的 2-4 秒(不一定用满 5 秒)。
  4. 用转场或环境音连接三个镜头。
  5. 记录每个镜头的:起始图(如有)、提示词、时长、比例、工具版本。

验收清单

做完这一步,你就完成了第一个 AI 视频项目。 虽然只有 15 秒,但它涵盖了"规划→生成→筛选→拼接"的完整流程,和做一条 5 分钟视频的流程本质相同。


FAQ:常见问题

Q1:为什么不直接生成 30 秒完整视频?

长时长会累积时序错误(画面越来越不稳定),生成成本也更高。5 秒的短镜头更容易控制,剪辑后反而更像真实内容生产。需要 30 秒的内容时,做 6 个 5 秒镜头拼接,效果远好于一次生成 30 秒。

Q2:静态图质量很高,为什么转视频后变差?

因为视频模型不只是"让图片动起来",它还要推断运动和连续帧。降低动作复杂度、简化背景、使用短时长,通常比继续堆质量词有效。另外,起始图的风格越简洁(干净背景、主体突出),转视频后越稳定。

Q3:能让人物准确说话吗?

普通图生视频不一定能稳定完成口型和台词。口播、数字人和口型同步属于专项流程,需要专门的数字人工具或口型同步工具,在后续剪辑与配音环节处理。L1C-06 会涉及口播视频的基本方法。

Q4:可灵、即梦、Runway、Sora、海螺该选哪个?

纯小白先用可灵或海螺(中文友好、免费额度够练手)。需要风格化效果时试 Runway。Sora 在复杂场景和多镜头叙事上表现突出,但以当前官方能力为准。建议:先用一个跑通流程,再做横评。不要同时学五个工具。

Q5:视频生成一次要花多少credits/额度?

不同工具计费方式不同。一般来说,5 秒视频的消耗远高于一张图片,所以先低分辨率测试、确认满意后再做高清版本,能有效控制成本。具体额度以当前平台说明为准。


进阶避坑指南

坑 1:一个提示词塞太多动作

现象:提示词写了"人物走进房间,坐下,拿起杯子,喝一口,放下杯子,转头看窗外",结果视频里人物扭曲变形,什么都做不好。

原因:视频模型一次只能稳定处理一个主要动作。多个动作叠加会导致模型在多个运动目标之间摇摆,产生变形。

处理:一个镜头只写一个动作。把"走进房间坐下"拆成两个镜头(走进 + 坐下),分别生成,剪辑拼接。

坑 2:运动幅度拉满追求"动感"

现象:为了让视频"更有活力",把运动幅度调到最高,结果画面剧烈晃动,主体变形,背景闪烁。

原因:高运动幅度让模型在每帧之间做大幅变化,时序一致性快速崩溃。

处理:从低或中运动幅度开始。如果觉得画面太静态,先尝试加环境变化(风吹窗帘、光线变化),而不是提高整体运动幅度。需要大幅运动时,用跟拍镜头配合明确的运动方向。

坑 3:用文生视频做产品展示

现象:用纯文字描述"一个白色耳机在桌上",生成的视频里耳机外形和实物对不上,品牌特征全丢了。

原因:文生视频没有真实产品参考,模型会根据训练数据"编造"一个看起来像但细节不对的产品。

处理:产品展示用图生视频,以真实产品照片为首帧,提示词写"保持产品外形、颜色、Logo 不变"。涉及商品商用时,确认授权和平台规则。

坑 4:不记录提示词和参数,好镜头无法复现

现象:上周生成了一个特别好的镜头,这周想再做同风格的,怎么都出不来了。

原因:没有记录起始图、提示词、时长、比例、运动幅度、工具版本。

处理:每个可用镜头都记录:日期、工具、起始图(如有)、提示词、时长、比例、运动幅度、版本。存成表格,下次直接复用。


最重要的三句话

  1. 把一次生成当作一个镜头,不要期待一键成片。
  2. 动作、运镜和时长越明确,结果越容易控制。
  3. 先保证连续性,再追求复杂运动和高分辨率。

下一站预告

你已经理解了视频生成的基本原理、三种模式、镜头语言和参数选择。接下来进入实战。

下一课《L2-C6 视频生成实战》会把多个 AI 镜头用于空镜、图生视频、口播视频、多镜头拼接叙事和视频后期(剪辑、配音对齐、字幕),完成一条可发布的短视频样片。


教程版本:v1.0 最后更新:2026-08 内容时效:视频模型、时长、额度和参数名称更新很快,具体能力以当前平台页面为准。本文的镜头语言方法论、参数选择逻辑和问题诊断流程长期通用。