保姆级教程 · 面向纯小白与自媒体人
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-06 难度等级 ★★★☆☆ 适用人群 想用 AI 素材完成一条可发布短视频的自媒体创作者 预计学时 100-130 分钟 前置课程 L1C-03、L1C-05,建议读完 L1B-05 更新日期 2026 年 8 月 内容声明 工具入口、模型能力和平台规则会变化,实操时以当前产品说明为准。本文讲通用方法论,不绑定特定工具
学完本教程后,你将能够:
新手做 AI 视频最常见的错误是:打开工具,直接写提示词生成,拿到素材后才开始想"这些镜头怎么拼成一条视频"。结果素材之间没有逻辑关系,剪出来像画面拼盘。
短视频的最小生产单元是**"镜头"**,不是"提示词"。先写一张分镜表,把一条视频拆成若干镜头,每个镜头只承担一个信息点。
| 镜头 | 时长 | 画面 | 旁白/字幕 | 声音 | 镜头类型 |
|---|---|---|---|---|---|
| 1 | 3 秒 | 成品或结果特写 | "早餐总是来不及做?" | 轻提示音 | 图生视频 |
| 2 | 6 秒 | 食材与操作空镜 | "先准备三样东西" | 旁白 + 环境音 | 空镜 |
| 3 | 8 秒 | 过程画面 | 步骤 1-2 | 旁白 + 环境音 | 图生视频 |
| 4 | 8 秒 | 成品展示 | "最后这样摆盘" | 旁白 | 图生视频 |
| 5 | 5 秒 | 成品和行动号召 | "收藏起来明天试试" | 收尾音乐 | 图生视频 |
分镜表写完后,先读一遍:遮住画面列,只看旁白列,能不能读懂这条视频要讲什么?如果能,说明信息结构是通的。如果不能,先改分镜表,不要急着生成。
用途:交代环境、节奏和转场。空镜不出现核心主体,但能营造氛围。
提示词重点:空间、光线和运动。不要写"一个人在厨房",空镜里不要有人。
清晨的中式厨房,蒸汽从锅中缓慢升起,阳光穿过窗户落在木质台面,
镜头固定,只有蒸汽和窗帘轻微运动,暖色生活方式纪录片风格,
5 秒,不要人物,不要文字
验收标准:
用途:展示商品外观、材质和使用画面。
提示词重点:真实外观和稳定运动。适合慢推、轻微摇移、局部高光,不适合大幅旋转和复杂变形。
白色无线耳机放在浅灰色极简台面上,保持产品外形、颜色和 Logo 不变,
镜头缓慢从左向右移动,耳机表面出现柔和高光,背景保持干净,
自然阴影稳定,5 秒产品展示镜头,不要新增文字和配件
验收标准:
用途:用 L1C-03 制作的封面、角色或商品底图作为起始帧,让静态画面产生微动作。
提示词重点:保持主体和背景结构,只写需要变化的部分。
保持橘猫吉祥物的脸部、绿色围巾和比例不变,它缓慢挥手并眨一次眼,
镜头固定,窗帘轻微摆动,柔和晨光,动作自然,5 秒短镜头
验收标准:
用途:需要人物出现的镜头(行走、转身、简单动作)。
提示词重点:先从半身、固定机位和简单动作开始。
| 复杂度 | 动作 | 出错率 | 建议 |
|---|---|---|---|
| 低 | 站立、微笑、眨眼 | 低 | 新手首选 |
| 低 | 缓慢转头、轻微抬手 | 低 | 推荐 |
| 中 | 走路、坐下 | 中 | 可尝试 |
| 高 | 同时行走 + 转身 + 拿物品 + 说话 | 高 | 避免拆分 |
关键:人物同时做多个动作时,错误率会明显上升。复杂表演拆成多个短镜头,每个镜头只做一个动作。
| 镜头类型 | 主体 | 动作幅度 | 运镜 | 时长 | 核心提示词模式 |
|---|---|---|---|---|---|
| 空镜 | 无人物 | 低 | 固定或慢推 | 5 秒 | 空间 + 光线 + 微变化 |
| 产品展示 | 产品 | 极低 | 慢摇或慢推 | 5 秒 | 保持外形不变 + 轻微运镜 |
| 图生视频 | IP/角色 | 低 | 固定 | 5 秒 | 保持外观不变 + 单一微动作 |
| 人物镜头 | 人物 | 中 | 固定或跟拍 | 5 秒 | 半身 + 单一动作 |
1. 锁定成片规格 → 2. 做视觉基准图 → 3. 按分镜逐个生成 →
4. 低成本初筛 → 5. 补生成缺口 → 6. 进入剪辑
第 1 步:锁定成片规格
第 2 步:做一张视觉基准图
用 L1C-01 到 L1C-04 的方法,先确定角色、商品或场景的"标准外观"。这张基准图是所有后续镜头的参照物。
第 3 步:按分镜逐个生成
每个镜头单独生成,单独保存提示词和版本。不要在一个提示词里要求多个镜头。
第 4 步:低成本初筛
先看主体、动作和连续性,不要先追求 4K。不合格的镜头标记"重做",不要花时间精修烂素材。
第 5 步:补生成缺口
只重做不合格的镜头,不要整条推倒重来。保留已通过的好镜头。
第 6 步:进入剪辑
把画面按分镜放到时间轴,再处理旁白和字幕。
项目名_镜头编号_内容_工具_版本
例如:breakfast_S03_product_toolA_v2
同时保留一份表格记录:比例、时长、提示词、参考图、种子和授权信息。
| 文件名 | 镜头编号 | 提示词 | 时长 | 工具 | 状态 |
|---|---|---|---|---|---|
| breakfast_S01_result_kling_v1 | S01 | ... | 5s | 可灵 | ✅ 通过 |
| breakfast_S02_ingredients_kling_v1 | S02 | ... | 5s | 可灵 | ❌ 重做 |
| breakfast_S03_process_kling_v2 | S03 | ... | 5s | 可灵 | ✅ 通过 |
把所有镜头放到时间轴后,先做无声粗剪:
旁白应先定稿再生成。按照 L1B 系列的方法处理断句、停顿、重音和语气,每个段落保留独立音频,便于重新生成。
声音层级检查清单:
| 层级 | 作用 | 音量关系 | 检查点 |
|---|---|---|---|
| 人声(旁白) | 传递核心信息 | 最响亮 | 不能被音乐盖住 |
| 音乐(BGM) | 营造氛围 | 低于人声 30%-50% | 不和旁白抢节奏 |
| 环境音/音效 | 增强动作真实感 | 最低 | 不要持续制造噪声 |
| 片头/片尾 | 品牌辨识 | 独立于内容 | 留淡入淡出 |
合规提醒:使用他人音乐、音效或声音克隆时,必须确认授权和平台规则。AI 生成不等于自动拥有商用权。涉及人物声音或肖像时,需获得本人授权。
字幕制作标准流程:
不同平台的安全区不同,但通用原则:
┌─────────────────────────┐
│ ⚠️ 顶部安全区(避开) │ ← 平台顶部有搜索栏/标题
├─────────────────────────┤
│ │
│ 画面主体区域 │
│ │
│ ┌───────────────────┐ │
│ │ 字幕放这里 │ │ ← 字幕安全区:画面下方 1/4 处
│ └───────────────────┘ │
├─────────────────────────┤
│ ⚠️ 底部安全区(避开) │ ← 平台底部有描述/点赞栏
└─────────────────────────┘
字幕不是旁白全文的机械复制。可以保留关键信息,让用户静音观看时也能理解主线。适当精简,不要每句话都上字幕。
| 检查项 | 怎么查 | 常见问题 |
|---|---|---|
| 旁白与画面对应 | 旁白说"第一步"时,画面是不是在展示第一步? | 画面滞后或超前于旁白 |
| 镜头切换节奏 | 镜头切换是否与旁白停顿对应? | 画面切得太快或太慢 |
| 音乐进出点 | 音乐是否在合适的位置开始和结束? | 音乐突兀开始或截断 |
| 字幕时间轴 | 字幕出现和消失的时间是否与语音对应? | 字幕超前或滞后 |
普通 AI 镜头适合做背景、产品、空镜和转场。但有些内容需要一个"人"对着镜头说话——比如知识科普、产品推荐、观点分享。这时就需要口播视频。
| 方案 | 做法 | 优点 | 缺点 | 合规风险 |
|---|---|---|---|---|
| 真人拍摄 + AI 辅助 | 自己拍口播,用 AI 生成配图和空镜 | 最真实,最可控 | 需要出镜 | 低 |
| 数字人平台 | 使用合规的数字人平台生成口播 | 不用出镜 | 效果取决于平台 | 需确认授权和标识 |
| AI 生成人物 + 口型同步 | AI 生成虚拟人物,用口型工具同步 | 灵活 | 口型同步不稳定 | 高,需谨慎 |
新手建议:先用虚拟角色或自有素材做练习。数字人不是"换一张脸"这么简单,还涉及授权、口型、表情、字幕、镜头和平台标识等多个环节。
主题:"3 步做一份早餐"。
| 素材类型 | 数量 | 来源 | 备注 |
|---|---|---|---|
| 成品参考图 | 1 张 | L1C-03 方法生成 | 用作第一个镜头的起始图 |
| 操作空镜 | 3 个 | AI 视频生成 | 食材准备、搅拌、煎制 |
| 食材特写 | 1 个 | AI 视频生成 | 食材摆放展示 |
| 收尾画面 | 1 个 | 图生视频 | 成品 + 行动号召 |
| 旁白音频 | 1 段 | TTS 生成 | 45 秒以内 |
| 背景音乐 | 1 条 | 授权音乐库 | 有商用授权 |
| 镜头 | 时长 | 画面 | 旁白 | 类型 |
|---|---|---|---|---|
| 1 | 3 秒 | 成品特写 | "3 步做一份早餐" | 图生视频 |
| 2 | 6 秒 | 食材空镜 | "准备鸡蛋、面包和牛奶" | 空镜 |
| 3 | 8 秒 | 煎蛋过程 | "第一步,煎一个鸡蛋" | 图生视频 |
| 4 | 8 秒 | 烤面包 | "第二步,烤两片面包" | 图生视频 |
| 5 | 8 秒 | 倒牛奶 | "第三步,倒一杯牛奶" | 图生视频 |
| 6 | 5 秒 | 成品 + 行动号召 | "收藏起来,明天试试" | 图生视频 |
| 7 | 7 秒 | 留白/结尾 | (音乐收尾) | 空镜 |
每个镜头写清时长、主体、动作和镜头运动。先生成低成本候选(低分辨率),只为每个分镜选出一条最稳定素材。
按"结果 → 方法 → 结果/行动号召"排列:
做完这一步,你就拥有了一条完全由 AI 素材组成的可发布短视频。 从分镜到发布,整个流程和做一条 5 分钟视频没有本质区别——只是镜头更多、时间更长。
因为单个镜头的画面语言没有统一。每个镜头的色调、画风、运动节奏都不一样,剪在一起就会割裂。解决:先锁定角色、色彩、镜头比例和运动节奏,再按分镜生成,最后用剪辑(色调统一、转场一致)解决衔接。
优先改旁白和镜头长度,而不是强行把镜头拉长。长句拆成两段,短句可用空镜或动作停顿承接。原则:画面配合声音,不是声音配合画面。
不需要。真实拍摄、素材库、截图、AI 图片和 AI 视频可以混合使用。稳定交付比工具纯度重要。比如"成品特写"用真实拍摄可能比 AI 生成更真实可靠。
新手用剪映(手机版或电脑版均可)。它的字幕自动生成、音乐库和模板对新手上手最友好。等你需要更精细的多轨剪辑和调色时,再考虑 Premiere 或 DaVinci Resolve。
2026 年多数主流平台已要求 AI 生成内容做标识,这是合规要求而非流量惩罚。关键在于内容质量本身——如果内容有价值,标识不会影响推荐。但若用 AI 生成误导性内容(冒充真人、虚假新闻等),则可能被限流或下架。
现象:打开工具一顿生成,拿到 10 段素材,剪的时候发现前后没有逻辑,拼不成一条完整的视频。
原因:没有分镜表,每段素材都是孤立的,缺乏叙事关系。
处理:先写分镜表(第一节模板),确定每个镜头的信息和顺序,再按分镜生成。分镜表是"视频的骨架",没有骨架的素材只是散落的画面。
现象:音乐音量和旁白差不多,用户听不清旁白在说什么;或者音乐节奏太快,和旁白的慢节奏冲突。
原因:声音层级没有规划好,音乐和旁白在同一音量级别竞争。
处理:人声永远是最响的,音乐控制在人声的 30%-50%。旁白说话时音乐可以降低(做"闪避"效果),旁白停顿时音乐可以恢复。在剪辑软件中用关键帧或自动闪避功能调整。
现象:发布后发现字幕被平台底部的描述栏、点赞按钮或顶部搜索栏遮住了,用户看不全字幕。
原因:剪辑时没有考虑平台 UI 的安全区,字幕放得太靠边。
处理:字幕放在画面下方 1/4 到 1/3 的区域,上下各留 10% 的边距。发布前在手机上预览,确认字幕不被平台 UI 遮挡。
现象:视频发布后被投诉下架,甚至收到律师函。
原因:使用了未授权的真人形象、声音,或使用了版权音乐。
处理:所有人物、声音、音乐和图片素材必须有明确授权来源。商用时使用有商用授权的素材库或自购授权。发布 AI 生成内容时按平台要求添加标识。保留所有素材的来源记录和授权文件。
你已经能独立完成一条 AI 短视频了。但真正的自媒体创作不是"一条一条做",而是把文案、配图、视频、配音串成一条可复用的生产流程,让一个主题变成多种内容形态。
下一课《L2-C7 图片视频联动工作流》会把文案、配图、视频、配音和批量分发串成一条完整的生产线,教你建立内容母稿、视觉资产表和标准生产流水线。
教程版本:v1.0 最后更新:2026-08 内容时效:工具入口、模型能力和平台规则会变化,实操时以当前产品说明为准。本文的分镜方法论、剪辑流程和质检清单长期通用。