L2-C7 图片视频联动工作流:从文案到多形态内容生产

保姆级教程 · 面向希望稳定批量产出的自媒体人

项目 信息
课程系列 AI 创作入门 · L1-C 图片/视频
课程编号 L1C-07
难度等级 ★★★☆☆
适用人群 想把一篇内容拆成图文、短视频和音频多种版本的创作者
预计学时 100-130 分钟
前置课程 L1A、L1B 与 L1C 基础及实战课程
更新日期 2026 年 8 月
内容声明 平台功能、授权条款和模型能力会变化,上线前请按当前规则复核。本文讲通用工作流方法论,不绑定特定工具

学习目标

学完本教程后,你将能够:

  1. 理解联动工作流的核心:不是复制粘贴,而是从一份"内容母稿"派生多种形态。
  2. 独立建立内容母稿,让文案、图片、视频和配音共享同一个内容骨架。
  3. 设计IP、色彩、音色和文件命名的一致性规则,形成可复用的视觉与声音资产表。
  4. 运用"固定字段 + 变量字段"的模板设计,把单次创作拆成可复用流程。
  5. 识别人在环路中必须人工把关的节点,在自动化之前设置审核点。
  6. 完成"一稿三发"实战:一篇 800 字文章拆为图文帖和 45 秒短视频。

前置准备

你需要什么

你不需要什么


一、联动工作流的核心

1.1 联动不是复制粘贴

新手理解的"多平台分发"是:写一篇文章,复制到小红书、公众号、抖音。结果每个平台的用户都不满意——小红书嫌太长,公众号嫌太碎片,抖音根本没法用。

联动不是把同一句话复制到所有工具,而是先建立一份"内容母稿",再从母稿派生出适合不同平台的内容形态。

1.2 母稿是唯一源头

主题与受众 → 核心观点 → 事实素材 → 视觉关键词 → 分镜 → 旁白 → 多平台版本

母稿是整个生产流程中唯一需要人工确认的源头。图文、短视频、配音和标题都从它派生。这样做的好处:

1.3 联动工作流全景图

┌─────────────┐
│  内容母稿    │  ← 人工确认事实、观点、合规
└──────┬──────┘
       │
  ┌────┼────┬────────┐
  ▼    ▼    ▼        ▼
长文  图文  短视频   旁白音频
 │    │    │        │
 ▼    ▼    ▼        ▼
公众号 小红书 抖音/B站  播客/音频
 │    │    │        │
 └────┴────┴────────┘
            │
         归档复盘

二、建立内容母稿

2.1 母稿字段表

用下面的字段整理一个主题:

字段 说明 示例
主题 这条内容究竟讲什么 新手如何建立 AI 图片素材库
目标人群 谁看,他们已经知道什么 刚接触 AI 出图的自媒体小白
核心结论 用户看完记住的一句话 用"命名+标签+版本"三步管理素材,比堆文件夹有效
3 个要点 支撑结论的事实或步骤 ①统一命名规则 ②用标签分类 ③保留版本记录
证据来源 链接、原始资料或个人经验 个人实操经验、参考 XX 文章(附链接)
视觉主角 人物、商品、场景或图表 橘猫吉祥物 + 电脑桌面场景
行动号召 收藏、评论、咨询或购买 "收藏这篇,下次出图时照着做"
禁用内容 未授权素材、夸大承诺、敏感表达 不使用名人形象,不承诺"7 天涨粉 1 万"

2.2 母稿确认流程

  1. 人工写初稿:用 L1A 的提示词技巧让 AI 辅助整理,但事实、观点和合规判断必须人工确认。
  2. 核实事实:检查引用、数据、链接、价格、日期是否准确。
  3. 确认授权:确认涉及的图片、人物、声音、音乐都有授权来源。
  4. 冻结版本:母稿确认后标记版本号(如 v1),后续派生都基于这个版本。修改时更新版本号(如 v2)。

为什么母稿如此重要? 因为母稿错了,后面的图文、视频、音频全都会错。在源头花 10 分钟核实,能省掉下游 1 小时的返工。让 AI 辅助整理可以,但事实、观点和合规判断必须人工确认。


三、从母稿拆出五种产物

3.1 五种内容形态

以"新手如何建立 AI 图片素材库"为例:

形态 平台 特点 从母稿取什么
长文 公众号 1500-3000 字,逻辑完整 全部要点 + 证据 + 详细步骤
图文帖 小红书 6-8 张图,每张一个要点 3 个要点拆成 6-8 个卡片
短视频 抖音/B站 45-60 秒,问题→方法→行动 核心结论 + 3 个要点浓缩
旁白音频 播客/音频平台 2-3 分钟,口语化 短视频口播稿的扩展版
封面与缩略图 全平台 共用同一 IP、颜色和标题 视觉主角 + 核心结论

3.2 拆分原则

不要让不同形态各自重新发明观点。 变化的是时长、信息密度和表达方式,不是事实主线。

3.3 拆分检查清单


四、建立统一视觉与声音资产

4.1 视觉资产表

让你的每一条内容看起来都像同一个账号产出的,至少固定以下内容:

资产 内容 用途
IP 角色参考图 橘猫吉祥物正面/侧面/全身图 图文和视频统一角色
主色/辅助色/背景色 橙色 #FF8C42 + 米白 #F5F0E8 + 深灰 #333333 封面、标题、字幕统一色调
常用画布比例 小红书 3:4、视频 9:16、公众号 16:9 按平台准备模板
封面标题区 顶部居中,字号占画面 5%-8% 统一标题位置
字幕安全区 画面下方 1/4,避开平台 UI 统一字幕位置
常用风格词/负向词 固定提示词模板 系列内容风格一致
模型记录 工具名称、模型版本 便于复现
Logo/图标 品牌 Logo、系列图标 统一品牌标识
可商用素材来源 授权链接、购买记录 合规追溯

4.2 声音资产表

资产 内容 用途
旁白音色 音色名称/ID + 授权来源 视频和音频统一声音
语速/情绪/停顿 语速 1.0×,中性偏温暖,句间停顿 0.5 秒 统一听感
片头/片尾音乐 文件名 + 授权来源 品牌辨识
音效文件 转场音效、提示音 增强节奏
背景音乐授权 授权范围(商用/非商用)、有效期 合规
音频导出格式 MP3 44.1kHz / WAV 48kHz 按用途选
响度标准 短视频 -14 LUFS / 播客 -16 LUFS 平台规范

资产表的价值是让下一条内容能复用,不是堆一堆下载文件。每个资产都应有名称、来源、用途和版本。资产表建立一次,后续每条内容只需要更新"变量"部分。

4.3 一致性规则总表

把视觉和声音资产表合并成一张"一致性规则表",这是你账号的"品牌手册":

固定项:
- IP 角色:橘猫吉祥物(绿色围巾、圆耳朵、白色腹部)
- 主色:橙色 #FF8C42 + 米白 #F5F0E8
- 画风:软萌 3D 卡通,哑光材质
- 旁白音色:温暖女声,语速 1.0×
- 片头:3 秒橙色渐变 + Logo
- 片尾:"收藏起来" + 收尾音乐
- 字幕:画面下方 1/4,白色粗体,黑色描边

变量项(每期更新):
- 本期主题
- 3 个要点
- 案例和截图
- 镜头动作
- 标题和行动号召

五、标准生产流水线

阶段一:策划与校对

  1. 明确主题、受众和发布平台:这次做几个平台?每个平台用什么形态?
  2. 生成或整理母稿:用 AI 辅助,人工确认。
  3. 人工核实事实:检查引用、价格、日期和版权。
  4. 冻结母稿版本:标记 v1,后续派生基于此版本。
产出 格式 状态
内容母稿 v1 文档 ☐ 已确认
事实核查记录 表格 ☐ 已核实
授权确认记录 表格 ☐ 已确认

阶段二:文字派生

  1. 从母稿生成长文:展开 3 个要点,加入案例和细节。
  2. 生成图文帖文案:拆成 6-8 张卡片,每张一个要点。
  3. 生成口播稿:浓缩为 45-60 秒的短视频脚本。
  4. 检查三种版本的结论和数字一致:对比母稿逐条核对。
产出 平台 字数/时长 状态
长文 公众号 1500-3000 字 ☐ 已完成
图文文案 小红书 6-8 张卡片 ☐ 已完成
口播稿 短视频 150-200 字 ☐ 已完成

阶段三:图像与视频

  1. 先生成视觉基准图和封面:用 L1C-03/L1C-04 的方法,先出封面和基准图。
  2. 再按分镜生成配图和视频镜头:用 L1C-05/L1C-06 的分镜方法。
  3. 对角色、商品和色彩进行一致性检查:和视觉资产表对比。
  4. 只重做不合格的镜头:保留已通过素材,不要整条推倒。
产出 数量 状态
封面图(各平台) 3 张 ☐ 已完成
图文配图 6-8 张 ☐ 已完成
视频镜头 5-7 个 ☐ 已完成

阶段四:声音与剪辑

  1. 旁白定稿后生成音频:用 L1B 系列的方法生成 TTS 配音。
  2. 按旁白节奏调整镜头长度:画面配合声音。
  3. 添加字幕、音乐和音效:按 L1C-06 的标准流程。
  4. 导出平台需要的版本:分别检查静音观看和有声观看效果。

衔接提示:配音环节可对接本项目 vbox 的单/多角色配音能力,如果你已有角色音色库,可以直接复用。这里不展开,详见 L1B 系列教程。

产出 格式 状态
旁白音频 MP3/WAV ☐ 已完成
字幕文件 SRT/内置 ☐ 已完成
成片(各平台版) MP4 ☐ 已完成

阶段五:发布与归档

  1. 人工检查标题、封面、字幕、链接和行动号召:逐条对照母稿。
  2. 添加平台要求的 AI 标识或内容声明:按当前平台规则。
  3. 记录最终发布版本和素材来源:归档到项目目录。
  4. 保存复盘数据:把有效模板更新为下一版。
检查项 状态
标题与母稿结论一致
封面比例和文字正确
字幕在安全区内
AI 标识已添加
素材来源已记录
发布版本已归档

六、批量生产的模板设计

6.1 固定字段与变量字段

把每条内容拆成两类:

固定:账号定位、视觉风格、IP 外观、片头片尾、字幕样式、旁白音色
变量:本期主题、3 个要点、案例、镜头动作、标题和行动号召

批量生成时,固定项不动,只填变量项。这样每条内容都有统一的"品牌外壳",但内容各不相同。

6.2 批量生产策略:先草稿后精修

低成本探索 → 人工筛选 → 高质量生成 → 后期交付
  1. 批量做低成本草稿:先用低分辨率、短时长快速出一批候选。
  2. 人工筛选:从候选中选出有潜力的,淘汰不合格的。
  3. 只对入选内容做高清:对选中的素材做高清版本和视频化。
  4. 后期交付:加字幕、音乐、排版。

关键:不要对每个候选都使用最高分辨率和最长时长。这样能大幅减少无效消耗。

6.3 推荐目录结构

项目名/
  00-母稿/
    母稿_v1.md
    事实核查记录.md
  01-文案/
    长文_公众号.md
    图文_小红书.md
    口播稿_短视频.md
  02-提示词/
    封面提示词.md
    配图提示词.md
    视频镜头提示词.md
  03-图片/
    封面_小红书.png
    封面_公众号.png
    配图_01.png ~ 配图_08.png
  04-视频镜头/
    S01_开场_5s.mp4
    S02_要点1_8s.mp4
    S03_要点2_8s.mp4
  05-音频/
    旁白_完整.wav
    旁白_分段_01.wav ~ 旁白_分段_05.wav
  06-工程文件/
    剪映工程_短视频.draft
  07-发布版/
    小红书_图文_最终.png
    公众号_长文_最终.md
    抖音_短视频_最终.mp4
  08-授权与复盘/
    素材授权记录.md
    发布数据复盘.md

文件名包含日期、内容编号和版本,避免 最终版2真的最终版 这类无法追溯的名称。推荐格式:日期_内容编号_描述_版本


七、成本、质量与速度的取舍

三个目标不能同时无限提高。明确当前内容的优先级:

优先级 做法 适合场景
赶时效 在线工具、短镜头、默认参数、人工精选 热点追踪、日更内容
要稳定 固定模型、参考图、模板和版本记录 系列内容、品牌内容
要低成本 小尺寸初筛、缓存素材、只重做失败项 练习阶段、测试选题
要隐私 私有部署或确认数据条款的企业服务 客户项目、未公开产品
要批量 统一输入格式、队列、失败重试和质检清单 成熟流程的规模化

最实用的流程是"低成本探索 → 人工筛选 → 高质量生成 → 后期交付"。不要对每个候选都使用最高分辨率和最长时长。

7.1 成本控制技巧

技巧 节省什么 具体做法
先低分辨率测试 算力/credits 先用低分辨率验证构图和动作,满意再高清
缓存基准图 生成时间 基准图和参考图一次做好,后续复用
只重做失败项 生成成本 不整条推倒,只重做不合格的镜头
批量提交 时间成本 多个镜头同时提交,等待期间做其他事
固定提示词模板 试错成本 不要每次从头写提示词,用固定模板

八、人在环路:哪些地方不能全自动

8.1 必须人工确认的节点

以下节点必须人工确认,不能交给 AI 自动化:

节点 为什么必须人工 出错后果
事实、引用、价格、日期 AI 会编造(幻觉) 误导用户,损害信誉
人物、声音、品牌授权 AI 不懂法律 侵权风险
生成图中的文字、Logo、手指 AI 经常出错 发布后被发现错误
视频中的闪烁、穿帮、口型 AI 可能生成不自然画面 影响观感
平台 AI 标识、广告规范 规则会变化 违规被限流或下架
最终标题、缩略图和行动号召 影响点击和转化 流量损失

8.2 AI 可以加速的环节

环节 AI 能做什么 人工做什么
选题 批量生成选题候选 筛选和判断
文案 生成初稿 修改和确认
配图 生成底稿 筛选和排版
视频 生成镜头素材 剪辑和质检
配音 TTS 生成 试听和校对
字幕 自动生成 校对和排版

AI 可以加速草稿和重复操作,不能替你承担发布责任。 涉及客户项目或商业内容时,保留审核人和审核时间记录。


九、实战:一稿三发

目标:把一篇 800 字文章拆为一条图文帖和一条 45 秒短视频。

第 1 步:写母稿

主题:"新手如何建立 AI 图片素材库"。写出母稿和 3 个核心要点(统一命名、标签分类、版本记录),人工确认事实。

第 2 步:生成图文帖

  1. 从母稿拆出 6 张图文卡片文案,每张只放一个要点。
  2. 为卡片共用一套视觉模板(固定风格 + 变量主体)。
  3. 生成无文字背景后统一排版。
  4. 检查 6 张图放在一起是否像同一系列。

第 3 步:生成短视频

  1. 把 3 个要点改成 45 秒口播稿,标出停顿和强调。
  2. 写 5 个分镜:开场(成品)→ 要点 1 → 要点 2 → 要点 3 → 行动号召。
  3. 分别生成封面、空镜和动作镜头。
  4. 用同一 IP 和色彩规则连接图文与视频。

第 4 步:剪辑与配音

  1. 导入旁白(可用 TTS 生成),按声音节奏剪辑。
  2. 添加字幕和音乐。
  3. 检查音画同步和字幕安全区。

第 5 步:交叉验证

对长文、图文和视频逐条对照母稿,确认:

第 6 步:导出与归档

  1. 导出各平台版本。
  2. 归档提示词、工程文件、来源和复盘表。
  3. 添加平台要求的 AI 标识。
  4. 记录发布版本。

验收标准


FAQ:常见问题

Q1:一稿多发会不会变成重复内容?

机械复制才会重复。保留核心观点,根据平台用户习惯重写开头、信息密度和互动方式,并使用不同的画面节奏。比如:小红书图文用"问题 + 步骤 + 收藏",抖音短视频用"结果 + 方法 + 行动",公众号长文用"故事 + 分析 + 结论"。同样的事实,不同的表达方式,不算重复内容。

Q2:什么时候值得做自动化?

当输入格式稳定、重复次数足够多、人工审核点已经清楚时再自动化。流程仍不稳定时,自动化只会更快地产生错误。判断标准:你手动做了 10 条以上、每条流程基本一致、审核节点明确——这时自动化才有意义。L1D 系列会深入讲解自动化。

Q3:能不能一次生成一整套素材?

可以批量提交,但要分阶段质检。先筛选文案和基准图,再生成视频和高分辨率版本,不要跳过中间审核。一口气全部生成再统一筛选,看似省事,实际上错误会在流程中传递和放大,最终返工成本更高。

Q4:一个人能同时做几个平台?

建议新手先做一个平台,做到稳定产出(比如连续 4 周每周更新 2 条),再扩展第二个。同时铺太多平台,每个都做不好,反而分散精力。联动工作流的价值不在于"同时做很多平台",而在于"一个主题高效派生多种形态"。

Q5:每条内容都值得做联动吗?

不值得。日常内容按需选择一种形态即可。只有以下情况值得联动:① 选题有长期价值(常青内容);② 一个主题可以多角度展开;③ 你想在一个主题上多平台曝光。80% 的精力放在做好一种形态上,20% 的精力做联动扩展。


进阶避坑指南

坑 1:母稿没确认就批量派生

现象:母稿里有个数字写错了,长文、图文、视频全都用了错误数字,发现时已经发布了两个平台。

原因:母稿没有经过人工确认就直接派生,错误扩散到所有形态。

处理:母稿必须人工确认并冻结版本后再派生。派生前做一次事实核查(数字、引用、日期、授权)。发现母稿有误时,先改母稿版本号,再逐个平台同步更新,并记录哪些平台已发布、哪些需要修改。

坑 2:资产表建了一次就不更新

现象:用了三个月的视觉资产表,工具已经换了两个版本,音色库也更新了,但资产表还停在最初的版本。新做的内容和三个月前对不上。

原因:资产表只建不维护,没有随工具和风格的变化更新。

处理:每次工具升级或风格调整时,同步更新资产表。资产表也要有版本号。建议每月做一次资产审查:检查模型版本是否还有效、授权是否过期、音色是否漂移。

坑 3:为了联动而联动,忽视内容质量

现象:一条内容强行做了长文、图文、视频三种形态,但每种形态都不够好,反而不如集中精力做好一种。

原因:把"形态多"当成了目标,忘了内容质量才是根本。

处理:联动的前提是内容本身值得多形态分发。如果选题只在一种形态下有优势(比如纯文字分析不适合做视频),就只做那一种。联动工作流是提效工具,不是内容标准。

坑 4:跳过中间审核,一步到位

现象:一口气生成全部文案、图片和视频,最后统一筛选,发现底层文案有问题,所有上层素材全废了。

原因:没有分阶段质检,错误在流程中层层传递。

处理:每个阶段都有"通过/不通过"的审核点。文案确认了再出图,图确认了再做视频,视频确认了再配音。前一阶段不通过,不进入下一阶段。这样即使出错,也只影响当前阶段,不会浪费下游工作。


最重要的三句话

  1. 母稿是源头,所有形态都从同一份已校对内容派生。
  2. 固定资产和模板,变量只放在本期主题与表达。
  3. 自动化处理重复劳动,人工把住事实、授权和发布质量。

下一站预告

L1-C 图片/视频板块到这里完成了从静态出图到多形态生产的基础路径。你已经走过了"出一张图 → 交付一套素材 → 控制一致性 → 生成视频 → 剪辑成片 → 联动分发"的完整链路。

下一阶段可进入《L1D-01 智能体入门:从聊天到会执行的 AI 助手》,学习如何把选题、文案、图片、配音和发布流程接成可监控的工作流,让你的创作从"手动联动"进化到"流程自动化"。


教程版本:v1.0 最后更新:2026-08 内容时效:平台功能、授权条款和模型能力会变化,上线前请按当前规则复核。本文的工作流设计、资产表模板和质检流程长期通用。