L2-C6 视频生成实战:短视频素材、分镜、配音与字幕对齐

保姆级教程 · 面向纯小白与自媒体人

项目 信息
课程系列 AI 创作入门 · L1-C 图片/视频
课程编号 L1C-06
难度等级 ★★★☆☆
适用人群 想用 AI 素材完成一条可发布短视频的自媒体创作者
预计学时 100-130 分钟
前置课程 L1C-03、L1C-05,建议读完 L1B-05
更新日期 2026 年 8 月
内容声明 工具入口、模型能力和平台规则会变化,实操时以当前产品说明为准。本文讲通用方法论,不绑定特定工具

学习目标

学完本教程后,你将能够:

  1. 理解短视频的最小生产单元是"镜头"而非"提示词",掌握分镜表的标准写法。
  2. 运用四类镜头(空镜、产品展示、图生视频、人物镜头)的生成方法,为每类选择合适的提示词和参数。
  3. 掌握AI 生成镜头的工作顺序:从锁定成片规格到进入剪辑的完整流程。
  4. 独立完成剪辑组装:画面粗剪、配音与音乐、字幕对齐三个核心环节。
  5. 识别口播视频与数字人的能力边界和合规要求。
  6. 完成一条 30-60 秒的短视频样片,并通过发布前质检清单。

前置准备

你需要什么

你不需要什么


一、先写分镜,不要先点生成

1.1 为什么分镜表是第一步

新手做 AI 视频最常见的错误是:打开工具,直接写提示词生成,拿到素材后才开始想"这些镜头怎么拼成一条视频"。结果素材之间没有逻辑关系,剪出来像画面拼盘。

短视频的最小生产单元是**"镜头"**,不是"提示词"。先写一张分镜表,把一条视频拆成若干镜头,每个镜头只承担一个信息点。

1.2 分镜表模板

镜头 时长 画面 旁白/字幕 声音 镜头类型
1 3 秒 成品或结果特写 "早餐总是来不及做?" 轻提示音 图生视频
2 6 秒 食材与操作空镜 "先准备三样东西" 旁白 + 环境音 空镜
3 8 秒 过程画面 步骤 1-2 旁白 + 环境音 图生视频
4 8 秒 成品展示 "最后这样摆盘" 旁白 图生视频
5 5 秒 成品和行动号召 "收藏起来明天试试" 收尾音乐 图生视频

1.3 分镜表的设计原则

  1. 每个镜头只承担一个信息。不要让一个镜头同时展示"食材 + 操作 + 成品"。
  2. 镜头之间要有逻辑关系。用户看完一个镜头,要有"接下来看这个"的理由。
  3. 前 3 秒必须抓住注意力。第一个镜头放成品、结果或冲突,不要放缓慢的铺垫。
  4. 总时长 = 各镜头时长之和 + 转场。留出 0.5-1 秒的转场空间。

分镜表写完后,先读一遍:遮住画面列,只看旁白列,能不能读懂这条视频要讲什么?如果能,说明信息结构是通的。如果不能,先改分镜表,不要急着生成。


二、四类镜头怎么生产

2.1 空镜

用途:交代环境、节奏和转场。空镜不出现核心主体,但能营造氛围。

提示词重点:空间、光线和运动。不要写"一个人在厨房",空镜里不要有人。

清晨的中式厨房,蒸汽从锅中缓慢升起,阳光穿过窗户落在木质台面,
镜头固定,只有蒸汽和窗帘轻微运动,暖色生活方式纪录片风格,
5 秒,不要人物,不要文字

验收标准:

2.2 产品展示

用途:展示商品外观、材质和使用画面。

提示词重点:真实外观和稳定运动。适合慢推、轻微摇移、局部高光,不适合大幅旋转和复杂变形。

白色无线耳机放在浅灰色极简台面上,保持产品外形、颜色和 Logo 不变,
镜头缓慢从左向右移动,耳机表面出现柔和高光,背景保持干净,
自然阴影稳定,5 秒产品展示镜头,不要新增文字和配件

验收标准:

2.3 图生视频:把封面/配图动起来

用途:用 L1C-03 制作的封面、角色或商品底图作为起始帧,让静态画面产生微动作。

提示词重点:保持主体和背景结构,只写需要变化的部分。

保持橘猫吉祥物的脸部、绿色围巾和比例不变,它缓慢挥手并眨一次眼,
镜头固定,窗帘轻微摆动,柔和晨光,动作自然,5 秒短镜头

验收标准:

2.4 人物镜头

用途:需要人物出现的镜头(行走、转身、简单动作)。

提示词重点:先从半身、固定机位和简单动作开始。

复杂度 动作 出错率 建议
站立、微笑、眨眼 新手首选
缓慢转头、轻微抬手 推荐
走路、坐下 可尝试
同时行走 + 转身 + 拿物品 + 说话 避免拆分

关键:人物同时做多个动作时,错误率会明显上升。复杂表演拆成多个短镜头,每个镜头只做一个动作。

2.5 四类镜头的提示词对比

镜头类型 主体 动作幅度 运镜 时长 核心提示词模式
空镜 无人物 固定或慢推 5 秒 空间 + 光线 + 微变化
产品展示 产品 极低 慢摇或慢推 5 秒 保持外形不变 + 轻微运镜
图生视频 IP/角色 固定 5 秒 保持外观不变 + 单一微动作
人物镜头 人物 固定或跟拍 5 秒 半身 + 单一动作

三、用 AI 生成镜头的工作顺序

3.1 完整工作流

1. 锁定成片规格 → 2. 做视觉基准图 → 3. 按分镜逐个生成 →
4. 低成本初筛 → 5. 补生成缺口 → 6. 进入剪辑

3.2 每一步详解

第 1 步:锁定成片规格

第 2 步:做一张视觉基准图

用 L1C-01 到 L1C-04 的方法,先确定角色、商品或场景的"标准外观"。这张基准图是所有后续镜头的参照物。

第 3 步:按分镜逐个生成

每个镜头单独生成,单独保存提示词和版本。不要在一个提示词里要求多个镜头。

第 4 步:低成本初筛

先看主体、动作和连续性,不要先追求 4K。不合格的镜头标记"重做",不要花时间精修烂素材。

第 5 步:补生成缺口

只重做不合格的镜头,不要整条推倒重来。保留已通过的好镜头。

第 6 步:进入剪辑

把画面按分镜放到时间轴,再处理旁白和字幕。

3.3 文件命名规范

项目名_镜头编号_内容_工具_版本

例如:breakfast_S03_product_toolA_v2

同时保留一份表格记录:比例、时长、提示词、参考图、种子和授权信息。

文件名 镜头编号 提示词 时长 工具 状态
breakfast_S01_result_kling_v1 S01 ... 5s 可灵 ✅ 通过
breakfast_S02_ingredients_kling_v1 S02 ... 5s 可灵 ❌ 重做
breakfast_S03_process_kling_v2 S03 ... 5s 可灵 ✅ 通过

四、剪辑组装

4.1 先剪画面,后铺声音

把所有镜头放到时间轴后,先做无声粗剪:

  1. 删除问题片段:主体变形、闪烁和无效动作。
  2. 保留最稳定片段:每个镜头不一定用满 5 秒,保留最稳定的 2-4 秒。
  3. 第一个镜头快速交代:结果或冲突放第一个,不要缓慢铺垫。
  4. 镜头长度随信息量变化:信息密集的镜头可以短一点,展示性的镜头可以长一点。不要每段都一样长。
  5. 检查转场逻辑:画面之间是否有因果关系?必要时用动作匹配或相似构图衔接。

4.2 配音与音乐

旁白应先定稿再生成。按照 L1B 系列的方法处理断句、停顿、重音和语气,每个段落保留独立音频,便于重新生成。

声音层级检查清单:

层级 作用 音量关系 检查点
人声(旁白) 传递核心信息 最响亮 不能被音乐盖住
音乐(BGM) 营造氛围 低于人声 30%-50% 不和旁白抢节奏
环境音/音效 增强动作真实感 最低 不要持续制造噪声
片头/片尾 品牌辨识 独立于内容 留淡入淡出

合规提醒:使用他人音乐、音效或声音克隆时,必须确认授权和平台规则。AI 生成不等于自动拥有商用权。涉及人物声音或肖像时,需获得本人授权。

4.3 字幕对齐

字幕制作标准流程:

  1. 旁白定稿后生成字幕,不要先做字幕再反复改稿。
  2. 逐句检查断行,一屏不要放过多文字(建议一行不超过 14 字,一屏不超过 2 行)。
  3. 重要词用颜色或粗体突出,但不要每个字都强调。
  4. 字幕放在平台安全区内,避免被按钮或描述区遮挡。
  5. 数字、人名、地名和专业词必须逐字校对

4.4 字幕安全区示意

不同平台的安全区不同,但通用原则:

┌─────────────────────────┐
│  ⚠️ 顶部安全区(避开)    │  ← 平台顶部有搜索栏/标题
├─────────────────────────┤
│                         │
│    画面主体区域          │
│                         │
│  ┌───────────────────┐  │
│  │   字幕放这里       │  │  ← 字幕安全区:画面下方 1/4 处
│  └───────────────────┘  │
├─────────────────────────┤
│  ⚠️ 底部安全区(避开)    │  ← 平台底部有描述/点赞栏
└─────────────────────────┘

字幕不是旁白全文的机械复制。可以保留关键信息,让用户静音观看时也能理解主线。适当精简,不要每句话都上字幕。

4.5 音画同步检查

检查项 怎么查 常见问题
旁白与画面对应 旁白说"第一步"时,画面是不是在展示第一步? 画面滞后或超前于旁白
镜头切换节奏 镜头切换是否与旁白停顿对应? 画面切得太快或太慢
音乐进出点 音乐是否在合适的位置开始和结束? 音乐突兀开始或截断
字幕时间轴 字幕出现和消失的时间是否与语音对应? 字幕超前或滞后

五、口播视频与数字人边界

5.1 什么时候需要口播

普通 AI 镜头适合做背景、产品、空镜和转场。但有些内容需要一个"人"对着镜头说话——比如知识科普、产品推荐、观点分享。这时就需要口播视频。

5.2 口播视频的三种方案

方案 做法 优点 缺点 合规风险
真人拍摄 + AI 辅助 自己拍口播,用 AI 生成配图和空镜 最真实,最可控 需要出镜
数字人平台 使用合规的数字人平台生成口播 不用出镜 效果取决于平台 需确认授权和标识
AI 生成人物 + 口型同步 AI 生成虚拟人物,用口型工具同步 灵活 口型同步不稳定 高,需谨慎

5.3 数字人的合规要点

新手建议:先用虚拟角色或自有素材做练习。数字人不是"换一张脸"这么简单,还涉及授权、口型、表情、字幕、镜头和平台标识等多个环节。


六、实战:制作 45 秒教程短视频

主题:"3 步做一份早餐"。

第一步:准备素材清单

素材类型 数量 来源 备注
成品参考图 1 张 L1C-03 方法生成 用作第一个镜头的起始图
操作空镜 3 个 AI 视频生成 食材准备、搅拌、煎制
食材特写 1 个 AI 视频生成 食材摆放展示
收尾画面 1 个 图生视频 成品 + 行动号召
旁白音频 1 段 TTS 生成 45 秒以内
背景音乐 1 条 授权音乐库 有商用授权

第二步:写分镜表

镜头 时长 画面 旁白 类型
1 3 秒 成品特写 "3 步做一份早餐" 图生视频
2 6 秒 食材空镜 "准备鸡蛋、面包和牛奶" 空镜
3 8 秒 煎蛋过程 "第一步,煎一个鸡蛋" 图生视频
4 8 秒 烤面包 "第二步,烤两片面包" 图生视频
5 8 秒 倒牛奶 "第三步,倒一杯牛奶" 图生视频
6 5 秒 成品 + 行动号召 "收藏起来,明天试试" 图生视频
7 7 秒 留白/结尾 (音乐收尾) 空镜

第三步:生成镜头

每个镜头写清时长、主体、动作和镜头运动。先生成低成本候选(低分辨率),只为每个分镜选出一条最稳定素材。

第四步:粗剪

按"结果 → 方法 → 结果/行动号召"排列:

  1. 第一个镜头放成品特写,3 秒内让用户知道这条视频讲什么。
  2. 删除空白和重复信息。
  3. 每个操作镜头 6-8 秒,不要拖太长。
  4. 镜头之间用硬切或简单转场,不要花哨特效。

第五步:声音与字幕

  1. 导入旁白音频。
  2. 按旁白句子切分字幕,一屏一行。
  3. 根据人声节奏微调镜头长度(旁白说完了,画面也该切了)。
  4. 音乐音量保持在不影响人声的范围(约人声的 30%-50%)。
  5. 检查音画同步(参考 4.5 节)。

第六步:发布前质检

做完这一步,你就拥有了一条完全由 AI 素材组成的可发布短视频。 从分镜到发布,整个流程和做一条 5 分钟视频没有本质区别——只是镜头更多、时间更长。


FAQ:常见问题

Q1:生成素材看起来很电影,但剪起来不连贯?

因为单个镜头的画面语言没有统一。每个镜头的色调、画风、运动节奏都不一样,剪在一起就会割裂。解决:先锁定角色、色彩、镜头比例和运动节奏,再按分镜生成,最后用剪辑(色调统一、转场一致)解决衔接。

Q2:旁白和画面时长对不上怎么办?

优先改旁白和镜头长度,而不是强行把镜头拉长。长句拆成两段,短句可用空镜或动作停顿承接。原则:画面配合声音,不是声音配合画面。

Q3:必须每个镜头都用 AI 吗?

不需要。真实拍摄、素材库、截图、AI 图片和 AI 视频可以混合使用。稳定交付比工具纯度重要。比如"成品特写"用真实拍摄可能比 AI 生成更真实可靠。

Q4:剪映和 Premiere 该用哪个?

新手用剪映(手机版或电脑版均可)。它的字幕自动生成、音乐库和模板对新手上手最友好。等你需要更精细的多轨剪辑和调色时,再考虑 Premiere 或 DaVinci Resolve。

Q5:视频发布后被平台标注"AI 生成",影响流量吗?

2026 年多数主流平台已要求 AI 生成内容做标识,这是合规要求而非流量惩罚。关键在于内容质量本身——如果内容有价值,标识不会影响推荐。但若用 AI 生成误导性内容(冒充真人、虚假新闻等),则可能被限流或下架。


进阶避坑指南

坑 1:不分镜就直接生成

现象:打开工具一顿生成,拿到 10 段素材,剪的时候发现前后没有逻辑,拼不成一条完整的视频。

原因:没有分镜表,每段素材都是孤立的,缺乏叙事关系。

处理:先写分镜表(第一节模板),确定每个镜头的信息和顺序,再按分镜生成。分镜表是"视频的骨架",没有骨架的素材只是散落的画面。

坑 2:音乐和旁白打架

现象:音乐音量和旁白差不多,用户听不清旁白在说什么;或者音乐节奏太快,和旁白的慢节奏冲突。

原因:声音层级没有规划好,音乐和旁白在同一音量级别竞争。

处理:人声永远是最响的,音乐控制在人声的 30%-50%。旁白说话时音乐可以降低(做"闪避"效果),旁白停顿时音乐可以恢复。在剪辑软件中用关键帧或自动闪避功能调整。

坑 3:字幕超出安全区被平台遮挡

现象:发布后发现字幕被平台底部的描述栏、点赞按钮或顶部搜索栏遮住了,用户看不全字幕。

原因:剪辑时没有考虑平台 UI 的安全区,字幕放得太靠边。

处理:字幕放在画面下方 1/4 到 1/3 的区域,上下各留 10% 的边距。发布前在手机上预览,确认字幕不被平台 UI 遮挡。

坑 4:用未授权的数字人或音乐

现象:视频发布后被投诉下架,甚至收到律师函。

原因:使用了未授权的真人形象、声音,或使用了版权音乐。

处理:所有人物、声音、音乐和图片素材必须有明确授权来源。商用时使用有商用授权的素材库或自购授权。发布 AI 生成内容时按平台要求添加标识。保留所有素材的来源记录和授权文件。


最重要的三句话

  1. 先写分镜,再生成镜头,最后剪成视频。
  2. 声音、字幕和画面必须围绕同一条信息服务。
  3. 授权记录和发布前质检属于成片的一部分。

下一站预告

你已经能独立完成一条 AI 短视频了。但真正的自媒体创作不是"一条一条做",而是把文案、配图、视频、配音串成一条可复用的生产流程,让一个主题变成多种内容形态。

下一课《L2-C7 图片视频联动工作流》会把文案、配图、视频、配音和批量分发串成一条完整的生产线,教你建立内容母稿、视觉资产表和标准生产流水线。


教程版本:v1.0 最后更新:2026-08 内容时效:工具入口、模型能力和平台规则会变化,实操时以当前产品说明为准。本文的分镜方法论、剪辑流程和质检清单长期通用。