保姆级教程 · 面向纯小白与自媒体人
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-05 难度等级 ★★☆☆☆ 适用人群 想把 AI 图片做成动态素材,或第一次尝试生成视频的创作者 预计学时 75-100 分钟 前置课程 L1C-01、L1C-02,建议读完 L1C-03 更新日期 2026 年 8 月 内容声明 视频模型、时长、额度和参数名称更新很快,具体能力以当前平台页面为准。本文讲通用方法论,不绑定特定工具
学完本教程后,你将能够:
图像生成只需要判断"一张画面是什么样"。视频生成还要判断"下一帧怎样变化"——这就引入了时间维度的挑战。
打个比方:图像生成像拍一张照片,视频生成像拍一段视频。照片只需要构图和光影好看;视频还需要人物动作连贯、背景不闪烁、镜头运动平滑。难度完全不同。
新手最关键的认知转变:
一次 AI 视频生成 = 一个镜头素材,不是一条完整短视频。
不要期待输入"做一个 30 秒的早餐教程视频"就能得到一条可以发布的成片。正确的用法是:一次生成一个 5 秒的镜头,多个镜头拼接成一条完整视频。
| 模式 | 输入 | 适合场景 | 难点 | 新手建议 |
|---|---|---|---|---|
| 文生视频 | 纯文字 | 从零探索空镜、氛围和动作 | 主体与画面稳定性难控 | 先用来做风景空镜 |
| 图生视频 | 一张图片 + 文字 | 让封面、产品或角色动起来 | 首帧结构与运动强度 | 第一次练习首选 |
| 视频生视频 | 原视频 + 文字/参考 | 改风格、改服装或做视觉变化 | 时序一致、版权与算力 | 有经验后再尝试 |
第一次练习建议选择图生视频,因为首帧已经确定(你提供的那张图),更容易判断运动是否符合预期,出问题时也更容易定位是"图的问题"还是"提示词的问题"。
2026 年视频生成领域工具更新很快,以下是在中文创作场景中使用者较多的几款。本教程不绑定任何特定工具,你掌握的提示词结构和参数逻辑在所有工具间通用。
| 工具 | 特色 | 中文支持 | 适合场景 | 新手友好度 |
|---|---|---|---|---|
| 可灵 | 国产,中文提示词直接可用,运动控制较稳 | ✅ 原生 | 短视频素材、产品展示、空镜 | ★★★★ |
| 即梦 | 字节系,与抖音生态近,图生视频方便 | ✅ 原生 | 抖音/小红书素材、封面动起来 | ★★★★ |
| Runway | 海外老牌,功能丰富,风格化强 | 🟡 部分 | 创意视频、风格变换、实验性内容 | ★★★ |
| Sora | OpenAI 出品,物理理解强,长视频能力突出 | 🟡 部分 | 复杂场景、多镜头叙事 | ★★★ |
| 海螺 | AI 视频助手,操作门槛低 | ✅ 原生 | 快速生成、新手入门 | ★★★★★ |
选工具的建议:纯小白先用可灵或海螺的免费额度跑通"图生视频"流程。工具会迭代,但"先图生视频、短时长、单一动作"的方法论不变。以当前官方能力为准。
视频提示词比图像提示词多了"动作"和"时长"两个维度。建议按下面五块来组织:
主体 + 动作 + 环境变化 + 镜头运动 + 画面风格/时长
完整示例:
一只圆滚滚的橘猫吉祥物站在窗边,轻轻抬头看向窗外,窗帘被微风吹动,
镜头缓慢向前推近,柔和晨光,稳定自然的 5 秒 3D 卡通短镜头,主体保持完整
逐块拆解:
| 板块 | 内容 | 作用 |
|---|---|---|
| 主体 | 圆滚滚的橘猫吉祥物,站在窗边 | 画面里的主角和初始状态 |
| 动作 | 轻轻抬头看向窗外 | 主体要做什么(只一个) |
| 环境变化 | 窗帘被微风吹动 | 背景有什么微妙变化 |
| 镜头运动 | 镜头缓慢向前推近 | 摄影机怎么动 |
| 风格/时长 | 柔和晨光,5 秒 3D 卡通短镜头,主体保持完整 | 画面基调和时间长度 |
核心原则:"轻轻抬头""缓慢推近"比"动起来""很有活力"更容易执行。一次只安排一个主要动作,避免让主体同时跑、转身、挥手、跳跃和讲话。
镜头运动是视频提示词的核心。以下是五种基础运镜,按稳定性从高到低排列:
| 运镜 | 描述 | 适合场景 | 稳定性 |
|---|---|---|---|
| 固定镜头 | 摄影机不动,主体动 | 人物微表情、产品展示、风景空镜 | ★★★★★ |
| 推近/拉远 | 摄影机向前推或向后拉 | 突出主体或交代环境 | ★★★★ |
| 横向摇移 | 摄影机左右移动 | 展示空间或跟随主体 | ★★★ |
| 跟拍 | 摄影机随主体移动 | 动作明确的场景 | ★★★ |
| 环绕 | 摄影机绕主体旋转 | 展示产品或人物立体感 | ★★ |
新手学习顺序:固定镜头 → 缓慢推近 → 简单摇移 → 跟拍 → 环绕。先控制运动,再追求复杂运镜。
# 固定镜头
镜头固定不动,主体在画面中[动作],背景[环境变化]
# 推近
镜头缓慢向前推近,从[全景]逐渐过渡到[中景/特写]
# 拉远
镜头缓慢向后拉远,从[特写]逐渐展示[全景环境]
# 横向摇移
镜头从左向右缓慢移动,展示[场景内容]
# 跟拍
镜头跟随主体[移动方向],保持主体在画面中心
| 写法 | 效果 | 建议 |
|---|---|---|
| "轻轻抬头" | 明确、可执行 | ✅ 推荐 |
| "缓慢挥手" | 明确、幅度小 | ✅ 推荐 |
| "动起来" | 模型自由发挥,结果随机 | ❌ 避免 |
| "很有活力地运动" | 模型不知道做什么 | ❌ 避免 |
| "同时走路、转身、挥手" | 多动作叠加,容易变形 | ❌ 避免,拆成多个镜头 |
经验法则:如果让你的同事照着这句话做动作,他能做出来,那模型大概率也能生成。如果他不知道做什么,模型也不知道。
| 比例 | 适用场景 | 注意事项 |
|---|---|---|
9:16 |
短视频、手机全屏 | 抖音/快手/小红书首选 |
16:9 |
横版视频、课程、长视频 | B站/YouTube/公众号 |
1:1 |
社交媒体方形素材 | Instagram/朋友圈 |
3:4 |
图文平台视觉内容 | 小红书图文/竖版配图 |
时长选择:
为什么不要直接生成 30 秒? 因为视频模型的时序错误会随时间累积。5 秒的镜头可能很好,10 秒开始闪烁,30 秒可能面目全非。短镜头 + 剪辑拼接是 AI 视频生产的标准做法。
运动幅度可以理解为画面变化的激进程度。不同工具叫法不同(运动强度、创意度、动态值等),但原理一致:
| 幅度级别 | 适合场景 | 风险 | 新手建议 |
|---|---|---|---|
| 低 | 产品展示、人物微表情、风景空镜 | 画面可能显得不够动 | 静态主体首选 |
| 中 | 轻微走动、镜头推近、风吹物体 | 变形风险低 | 新手首选 |
| 高 | 跑跳、旋转、快速运镜 | 变形、闪烁和穿帮明显增多 | 有经验后再用 |
使用建议:若工具只有"创意度""运动强度"等名称,先用默认值,第二轮只调这一项并记录结果。不要同时调运动幅度和其他参数。
| 参数 | 作用 | 新手建议 |
|---|---|---|
| 分辨率 | 画面清晰度 | 低分辨率适合测试动作和构图,最终交付再选更高分辨率或放大 |
| 帧率 | 播放流畅度 | 先保证动作连贯,再考虑帧率。帧率不能修复主体每帧变形 |
不要迷信高分辨率:如果动作和连续性不对,4K 分辨率只是"更清晰的错误"。先生成低分辨率验证构图和动作,确认满意后再做高清版本。
| 参数 | 一句话作用 | 新手建议 |
|---|---|---|
| 比例 | 决定画面宽高 | 按发布平台先定 |
| 时长 | 单次生成的秒数 | 先用 5 秒,够短够稳 |
| 运动幅度 | 画面变化的激进程度 | 先用中或低 |
| 分辨率 | 画面清晰度 | 先低分辨率测试,满意再高清 |
| 帧率 | 播放流畅度 | 用默认值,不是优先调的参数 |
图生视频是新手最推荐的首选模式。首帧已确定,更容易判断运动是否符合预期。
起始图:L1C-03 生成的白色无线耳机产品图。
保持无线耳机的外形、颜色和位置不变,镜头缓慢从左向右移动,
耳机表面出现柔和高光,背景保持干净,自然阴影稳定,
5 秒产品展示镜头,不要新增文字和配件
关键:开头写"保持...不变",这是图生视频最重要的提示词模式——告诉模型什么不能变。
起始图:L1C-04 生成的橘猫吉祥物正面图。
保持橘猫吉祥物的脸部、绿色围巾和比例不变,它缓慢挥手并眨一次眼,
镜头固定,窗帘轻微摆动,柔和晨光,动作自然,
5 秒短镜头
关键:镜头固定 + 单一动作(挥手),最大化稳定性。
| 问题 | 常见原因 | 处理顺序 |
|---|---|---|
| 主体变形 | 动作过大、运动强度高、首帧不清 | 换更清楚的首帧 → 降低动作和强度 |
| 画面闪烁 | 背景细节复杂、镜头变化太快 | 简化背景 → 改固定镜头或慢推 |
| 手脚穿帮 | 人物动作过复杂 | 改为半身或单一动作 → 减少时长 |
| 产品结构改变 | 没有强调保持外形 | 使用真实参考图 → 局部运动 → 加"保持不变" |
| 镜头不按要求走 | 镜头词抽象或要求过多 | 只保留一个明确运镜 → 用具体动词 |
| 末尾突然结束 | 动作超出时长 | 提前描述"动作缓慢完成并停住" |
| 整体颜色偏移 | 风格词与首帧冲突 | 去掉多余风格描述 → 只写变化部分 |
视频质量首先取决于首帧质量、动作复杂度和时序连续性。负向提示只做辅助,不能修复根本问题。
# 不好的做法:堆一堆负向词
不要变形,不要闪烁,不要穿帮,不要变色,不要突然结束
# 好的做法:从源头控制
保持主体外形不变,单一轻微动作,镜头固定,5 秒短镜头,动作缓慢自然完成
主题:"橘猫开始一天的工作"。
| 镜头 | 运镜 | 画面 | 时长 | 提示词 |
|---|---|---|---|---|
| 1 | 固定 | 橘猫坐在桌前翻开笔记本 | 5 秒 | 橘猫吉祥物坐在木桌前,缓慢翻开一本笔记本,镜头固定,柔和晨光,5 秒 |
| 2 | 缓慢推近 | 橘猫抬头思考,窗帘轻微摆动 | 5 秒 | 橘猫吉祥物抬头看向斜上方,窗帘轻微摆动,镜头缓慢向前推近,柔和晨光,5 秒 |
| 3 | 横向摇移 | 桌面出现早餐和便签 | 5 秒 | 桌面上有一碗早餐和一张便签,镜头从左向右缓慢移动,柔和晨光,5 秒 |
做完这一步,你就完成了第一个 AI 视频项目。 虽然只有 15 秒,但它涵盖了"规划→生成→筛选→拼接"的完整流程,和做一条 5 分钟视频的流程本质相同。
长时长会累积时序错误(画面越来越不稳定),生成成本也更高。5 秒的短镜头更容易控制,剪辑后反而更像真实内容生产。需要 30 秒的内容时,做 6 个 5 秒镜头拼接,效果远好于一次生成 30 秒。
因为视频模型不只是"让图片动起来",它还要推断运动和连续帧。降低动作复杂度、简化背景、使用短时长,通常比继续堆质量词有效。另外,起始图的风格越简洁(干净背景、主体突出),转视频后越稳定。
普通图生视频不一定能稳定完成口型和台词。口播、数字人和口型同步属于专项流程,需要专门的数字人工具或口型同步工具,在后续剪辑与配音环节处理。L1C-06 会涉及口播视频的基本方法。
纯小白先用可灵或海螺(中文友好、免费额度够练手)。需要风格化效果时试 Runway。Sora 在复杂场景和多镜头叙事上表现突出,但以当前官方能力为准。建议:先用一个跑通流程,再做横评。不要同时学五个工具。
不同工具计费方式不同。一般来说,5 秒视频的消耗远高于一张图片,所以先低分辨率测试、确认满意后再做高清版本,能有效控制成本。具体额度以当前平台说明为准。
现象:提示词写了"人物走进房间,坐下,拿起杯子,喝一口,放下杯子,转头看窗外",结果视频里人物扭曲变形,什么都做不好。
原因:视频模型一次只能稳定处理一个主要动作。多个动作叠加会导致模型在多个运动目标之间摇摆,产生变形。
处理:一个镜头只写一个动作。把"走进房间坐下"拆成两个镜头(走进 + 坐下),分别生成,剪辑拼接。
现象:为了让视频"更有活力",把运动幅度调到最高,结果画面剧烈晃动,主体变形,背景闪烁。
原因:高运动幅度让模型在每帧之间做大幅变化,时序一致性快速崩溃。
处理:从低或中运动幅度开始。如果觉得画面太静态,先尝试加环境变化(风吹窗帘、光线变化),而不是提高整体运动幅度。需要大幅运动时,用跟拍镜头配合明确的运动方向。
现象:用纯文字描述"一个白色耳机在桌上",生成的视频里耳机外形和实物对不上,品牌特征全丢了。
原因:文生视频没有真实产品参考,模型会根据训练数据"编造"一个看起来像但细节不对的产品。
处理:产品展示用图生视频,以真实产品照片为首帧,提示词写"保持产品外形、颜色、Logo 不变"。涉及商品商用时,确认授权和平台规则。
现象:上周生成了一个特别好的镜头,这周想再做同风格的,怎么都出不来了。
原因:没有记录起始图、提示词、时长、比例、运动幅度、工具版本。
处理:每个可用镜头都记录:日期、工具、起始图(如有)、提示词、时长、比例、运动幅度、版本。存成表格,下次直接复用。
你已经理解了视频生成的基本原理、三种模式、镜头语言和参数选择。接下来进入实战。
下一课《L2-C6 视频生成实战》会把多个 AI 镜头用于空镜、图生视频、口播视频、多镜头拼接叙事和视频后期(剪辑、配音对齐、字幕),完成一条可发布的短视频样片。
教程版本:v1.0 最后更新:2026-08 内容时效:视频模型、时长、额度和参数名称更新很快,具体能力以当前平台页面为准。本文的镜头语言方法论、参数选择逻辑和问题诊断流程长期通用。