保姆级教程 · 面向希望稳定批量产出的自媒体人
项目 信息 课程系列 AI 创作入门 · L1-C 图片/视频 课程编号 L1C-07 难度等级 ★★★☆☆ 适用人群 想把一篇内容拆成图文、短视频和音频多种版本的创作者 预计学时 100-130 分钟 前置课程 L1A、L1B 与 L1C 基础及实战课程 更新日期 2026 年 8 月 内容声明 平台功能、授权条款和模型能力会变化,上线前请按当前规则复核。本文讲通用工作流方法论,不绑定特定工具
学完本教程后,你将能够:
新手理解的"多平台分发"是:写一篇文章,复制到小红书、公众号、抖音。结果每个平台的用户都不满意——小红书嫌太长,公众号嫌太碎片,抖音根本没法用。
联动不是把同一句话复制到所有工具,而是先建立一份"内容母稿",再从母稿派生出适合不同平台的内容形态。
主题与受众 → 核心观点 → 事实素材 → 视觉关键词 → 分镜 → 旁白 → 多平台版本
母稿是整个生产流程中唯一需要人工确认的源头。图文、短视频、配音和标题都从它派生。这样做的好处:
┌─────────────┐
│ 内容母稿 │ ← 人工确认事实、观点、合规
└──────┬──────┘
│
┌────┼────┬────────┐
▼ ▼ ▼ ▼
长文 图文 短视频 旁白音频
│ │ │ │
▼ ▼ ▼ ▼
公众号 小红书 抖音/B站 播客/音频
│ │ │ │
└────┴────┴────────┘
│
归档复盘
用下面的字段整理一个主题:
| 字段 | 说明 | 示例 |
|---|---|---|
| 主题 | 这条内容究竟讲什么 | 新手如何建立 AI 图片素材库 |
| 目标人群 | 谁看,他们已经知道什么 | 刚接触 AI 出图的自媒体小白 |
| 核心结论 | 用户看完记住的一句话 | 用"命名+标签+版本"三步管理素材,比堆文件夹有效 |
| 3 个要点 | 支撑结论的事实或步骤 | ①统一命名规则 ②用标签分类 ③保留版本记录 |
| 证据来源 | 链接、原始资料或个人经验 | 个人实操经验、参考 XX 文章(附链接) |
| 视觉主角 | 人物、商品、场景或图表 | 橘猫吉祥物 + 电脑桌面场景 |
| 行动号召 | 收藏、评论、咨询或购买 | "收藏这篇,下次出图时照着做" |
| 禁用内容 | 未授权素材、夸大承诺、敏感表达 | 不使用名人形象,不承诺"7 天涨粉 1 万" |
v1),后续派生都基于这个版本。修改时更新版本号(如 v2)。为什么母稿如此重要? 因为母稿错了,后面的图文、视频、音频全都会错。在源头花 10 分钟核实,能省掉下游 1 小时的返工。让 AI 辅助整理可以,但事实、观点和合规判断必须人工确认。
以"新手如何建立 AI 图片素材库"为例:
| 形态 | 平台 | 特点 | 从母稿取什么 |
|---|---|---|---|
| 长文 | 公众号 | 1500-3000 字,逻辑完整 | 全部要点 + 证据 + 详细步骤 |
| 图文帖 | 小红书 | 6-8 张图,每张一个要点 | 3 个要点拆成 6-8 个卡片 |
| 短视频 | 抖音/B站 | 45-60 秒,问题→方法→行动 | 核心结论 + 3 个要点浓缩 |
| 旁白音频 | 播客/音频平台 | 2-3 分钟,口语化 | 短视频口播稿的扩展版 |
| 封面与缩略图 | 全平台 | 共用同一 IP、颜色和标题 | 视觉主角 + 核心结论 |
不要让不同形态各自重新发明观点。 变化的是时长、信息密度和表达方式,不是事实主线。
让你的每一条内容看起来都像同一个账号产出的,至少固定以下内容:
| 资产 | 内容 | 用途 |
|---|---|---|
| IP 角色参考图 | 橘猫吉祥物正面/侧面/全身图 | 图文和视频统一角色 |
| 主色/辅助色/背景色 | 橙色 #FF8C42 + 米白 #F5F0E8 + 深灰 #333333 | 封面、标题、字幕统一色调 |
| 常用画布比例 | 小红书 3:4、视频 9:16、公众号 16:9 | 按平台准备模板 |
| 封面标题区 | 顶部居中,字号占画面 5%-8% | 统一标题位置 |
| 字幕安全区 | 画面下方 1/4,避开平台 UI | 统一字幕位置 |
| 常用风格词/负向词 | 固定提示词模板 | 系列内容风格一致 |
| 模型记录 | 工具名称、模型版本 | 便于复现 |
| Logo/图标 | 品牌 Logo、系列图标 | 统一品牌标识 |
| 可商用素材来源 | 授权链接、购买记录 | 合规追溯 |
| 资产 | 内容 | 用途 |
|---|---|---|
| 旁白音色 | 音色名称/ID + 授权来源 | 视频和音频统一声音 |
| 语速/情绪/停顿 | 语速 1.0×,中性偏温暖,句间停顿 0.5 秒 | 统一听感 |
| 片头/片尾音乐 | 文件名 + 授权来源 | 品牌辨识 |
| 音效文件 | 转场音效、提示音 | 增强节奏 |
| 背景音乐授权 | 授权范围(商用/非商用)、有效期 | 合规 |
| 音频导出格式 | MP3 44.1kHz / WAV 48kHz | 按用途选 |
| 响度标准 | 短视频 -14 LUFS / 播客 -16 LUFS | 平台规范 |
资产表的价值是让下一条内容能复用,不是堆一堆下载文件。每个资产都应有名称、来源、用途和版本。资产表建立一次,后续每条内容只需要更新"变量"部分。
把视觉和声音资产表合并成一张"一致性规则表",这是你账号的"品牌手册":
固定项:
- IP 角色:橘猫吉祥物(绿色围巾、圆耳朵、白色腹部)
- 主色:橙色 #FF8C42 + 米白 #F5F0E8
- 画风:软萌 3D 卡通,哑光材质
- 旁白音色:温暖女声,语速 1.0×
- 片头:3 秒橙色渐变 + Logo
- 片尾:"收藏起来" + 收尾音乐
- 字幕:画面下方 1/4,白色粗体,黑色描边
变量项(每期更新):
- 本期主题
- 3 个要点
- 案例和截图
- 镜头动作
- 标题和行动号召
v1,后续派生基于此版本。| 产出 | 格式 | 状态 |
|---|---|---|
| 内容母稿 v1 | 文档 | ☐ 已确认 |
| 事实核查记录 | 表格 | ☐ 已核实 |
| 授权确认记录 | 表格 | ☐ 已确认 |
| 产出 | 平台 | 字数/时长 | 状态 |
|---|---|---|---|
| 长文 | 公众号 | 1500-3000 字 | ☐ 已完成 |
| 图文文案 | 小红书 | 6-8 张卡片 | ☐ 已完成 |
| 口播稿 | 短视频 | 150-200 字 | ☐ 已完成 |
| 产出 | 数量 | 状态 |
|---|---|---|
| 封面图(各平台) | 3 张 | ☐ 已完成 |
| 图文配图 | 6-8 张 | ☐ 已完成 |
| 视频镜头 | 5-7 个 | ☐ 已完成 |
衔接提示:配音环节可对接本项目 vbox 的单/多角色配音能力,如果你已有角色音色库,可以直接复用。这里不展开,详见 L1B 系列教程。
| 产出 | 格式 | 状态 |
|---|---|---|
| 旁白音频 | MP3/WAV | ☐ 已完成 |
| 字幕文件 | SRT/内置 | ☐ 已完成 |
| 成片(各平台版) | MP4 | ☐ 已完成 |
| 检查项 | 状态 |
|---|---|
| 标题与母稿结论一致 | ☐ |
| 封面比例和文字正确 | ☐ |
| 字幕在安全区内 | ☐ |
| AI 标识已添加 | ☐ |
| 素材来源已记录 | ☐ |
| 发布版本已归档 | ☐ |
把每条内容拆成两类:
固定:账号定位、视觉风格、IP 外观、片头片尾、字幕样式、旁白音色
变量:本期主题、3 个要点、案例、镜头动作、标题和行动号召
批量生成时,固定项不动,只填变量项。这样每条内容都有统一的"品牌外壳",但内容各不相同。
低成本探索 → 人工筛选 → 高质量生成 → 后期交付
关键:不要对每个候选都使用最高分辨率和最长时长。这样能大幅减少无效消耗。
项目名/
00-母稿/
母稿_v1.md
事实核查记录.md
01-文案/
长文_公众号.md
图文_小红书.md
口播稿_短视频.md
02-提示词/
封面提示词.md
配图提示词.md
视频镜头提示词.md
03-图片/
封面_小红书.png
封面_公众号.png
配图_01.png ~ 配图_08.png
04-视频镜头/
S01_开场_5s.mp4
S02_要点1_8s.mp4
S03_要点2_8s.mp4
05-音频/
旁白_完整.wav
旁白_分段_01.wav ~ 旁白_分段_05.wav
06-工程文件/
剪映工程_短视频.draft
07-发布版/
小红书_图文_最终.png
公众号_长文_最终.md
抖音_短视频_最终.mp4
08-授权与复盘/
素材授权记录.md
发布数据复盘.md
文件名包含日期、内容编号和版本,避免
最终版2、真的最终版这类无法追溯的名称。推荐格式:日期_内容编号_描述_版本。
三个目标不能同时无限提高。明确当前内容的优先级:
| 优先级 | 做法 | 适合场景 |
|---|---|---|
| 赶时效 | 在线工具、短镜头、默认参数、人工精选 | 热点追踪、日更内容 |
| 要稳定 | 固定模型、参考图、模板和版本记录 | 系列内容、品牌内容 |
| 要低成本 | 小尺寸初筛、缓存素材、只重做失败项 | 练习阶段、测试选题 |
| 要隐私 | 私有部署或确认数据条款的企业服务 | 客户项目、未公开产品 |
| 要批量 | 统一输入格式、队列、失败重试和质检清单 | 成熟流程的规模化 |
最实用的流程是"低成本探索 → 人工筛选 → 高质量生成 → 后期交付"。不要对每个候选都使用最高分辨率和最长时长。
| 技巧 | 节省什么 | 具体做法 |
|---|---|---|
| 先低分辨率测试 | 算力/credits | 先用低分辨率验证构图和动作,满意再高清 |
| 缓存基准图 | 生成时间 | 基准图和参考图一次做好,后续复用 |
| 只重做失败项 | 生成成本 | 不整条推倒,只重做不合格的镜头 |
| 批量提交 | 时间成本 | 多个镜头同时提交,等待期间做其他事 |
| 固定提示词模板 | 试错成本 | 不要每次从头写提示词,用固定模板 |
以下节点必须人工确认,不能交给 AI 自动化:
| 节点 | 为什么必须人工 | 出错后果 |
|---|---|---|
| 事实、引用、价格、日期 | AI 会编造(幻觉) | 误导用户,损害信誉 |
| 人物、声音、品牌授权 | AI 不懂法律 | 侵权风险 |
| 生成图中的文字、Logo、手指 | AI 经常出错 | 发布后被发现错误 |
| 视频中的闪烁、穿帮、口型 | AI 可能生成不自然画面 | 影响观感 |
| 平台 AI 标识、广告规范 | 规则会变化 | 违规被限流或下架 |
| 最终标题、缩略图和行动号召 | 影响点击和转化 | 流量损失 |
| 环节 | AI 能做什么 | 人工做什么 |
|---|---|---|
| 选题 | 批量生成选题候选 | 筛选和判断 |
| 文案 | 生成初稿 | 修改和确认 |
| 配图 | 生成底稿 | 筛选和排版 |
| 视频 | 生成镜头素材 | 剪辑和质检 |
| 配音 | TTS 生成 | 试听和校对 |
| 字幕 | 自动生成 | 校对和排版 |
AI 可以加速草稿和重复操作,不能替你承担发布责任。 涉及客户项目或商业内容时,保留审核人和审核时间记录。
目标:把一篇 800 字文章拆为一条图文帖和一条 45 秒短视频。
主题:"新手如何建立 AI 图片素材库"。写出母稿和 3 个核心要点(统一命名、标签分类、版本记录),人工确认事实。
对长文、图文和视频逐条对照母稿,确认:
机械复制才会重复。保留核心观点,根据平台用户习惯重写开头、信息密度和互动方式,并使用不同的画面节奏。比如:小红书图文用"问题 + 步骤 + 收藏",抖音短视频用"结果 + 方法 + 行动",公众号长文用"故事 + 分析 + 结论"。同样的事实,不同的表达方式,不算重复内容。
当输入格式稳定、重复次数足够多、人工审核点已经清楚时再自动化。流程仍不稳定时,自动化只会更快地产生错误。判断标准:你手动做了 10 条以上、每条流程基本一致、审核节点明确——这时自动化才有意义。L1D 系列会深入讲解自动化。
可以批量提交,但要分阶段质检。先筛选文案和基准图,再生成视频和高分辨率版本,不要跳过中间审核。一口气全部生成再统一筛选,看似省事,实际上错误会在流程中传递和放大,最终返工成本更高。
建议新手先做一个平台,做到稳定产出(比如连续 4 周每周更新 2 条),再扩展第二个。同时铺太多平台,每个都做不好,反而分散精力。联动工作流的价值不在于"同时做很多平台",而在于"一个主题高效派生多种形态"。
不值得。日常内容按需选择一种形态即可。只有以下情况值得联动:① 选题有长期价值(常青内容);② 一个主题可以多角度展开;③ 你想在一个主题上多平台曝光。80% 的精力放在做好一种形态上,20% 的精力做联动扩展。
现象:母稿里有个数字写错了,长文、图文、视频全都用了错误数字,发现时已经发布了两个平台。
原因:母稿没有经过人工确认就直接派生,错误扩散到所有形态。
处理:母稿必须人工确认并冻结版本后再派生。派生前做一次事实核查(数字、引用、日期、授权)。发现母稿有误时,先改母稿版本号,再逐个平台同步更新,并记录哪些平台已发布、哪些需要修改。
现象:用了三个月的视觉资产表,工具已经换了两个版本,音色库也更新了,但资产表还停在最初的版本。新做的内容和三个月前对不上。
原因:资产表只建不维护,没有随工具和风格的变化更新。
处理:每次工具升级或风格调整时,同步更新资产表。资产表也要有版本号。建议每月做一次资产审查:检查模型版本是否还有效、授权是否过期、音色是否漂移。
现象:一条内容强行做了长文、图文、视频三种形态,但每种形态都不够好,反而不如集中精力做好一种。
原因:把"形态多"当成了目标,忘了内容质量才是根本。
处理:联动的前提是内容本身值得多形态分发。如果选题只在一种形态下有优势(比如纯文字分析不适合做视频),就只做那一种。联动工作流是提效工具,不是内容标准。
现象:一口气生成全部文案、图片和视频,最后统一筛选,发现底层文案有问题,所有上层素材全废了。
原因:没有分阶段质检,错误在流程中层层传递。
处理:每个阶段都有"通过/不通过"的审核点。文案确认了再出图,图确认了再做视频,视频确认了再配音。前一阶段不通过,不进入下一阶段。这样即使出错,也只影响当前阶段,不会浪费下游工作。
L1-C 图片/视频板块到这里完成了从静态出图到多形态生产的基础路径。你已经走过了"出一张图 → 交付一套素材 → 控制一致性 → 生成视频 → 剪辑成片 → 联动分发"的完整链路。
下一阶段可进入《L1D-01 智能体入门:从聊天到会执行的 AI 助手》,学习如何把选题、文案、图片、配音和发布流程接成可监控的工作流,让你的创作从"手动联动"进化到"流程自动化"。
教程版本:v1.0 最后更新:2026-08 内容时效:平台功能、授权条款和模型能力会变化,上线前请按当前规则复核。本文的工作流设计、资产表模板和质检流程长期通用。