L1D-01 智能体入门:从聊天到会执行的 AI 助手

保姆级教程 · 面向想把重复创作任务交给 AI 协助的人

项目 信息
课程系列 AI 创作入门 · L1-D 智能体/自动化
课程编号 L1D-01
难度等级 ★★☆☆☆
适用人群 已经会用 AI 写文、做图或配音,想理解自动化边界的创作者
预计学时 60-80 分钟
前置课程 L0-2 名词词典;建议先完成 L1A、L1B 或 L1C 中任意一个方向
更新日期 2026 年 8 月
内容声明 本课讲通用方法。自动执行涉及发布、付款、删除或对外回复时,必须保留人工确认。

学习目标

学完本教程后,你将能够:

  1. 说清 Agent、聊天机器人和工作流分别解决什么问题,不会把三者混为一谈。
  2. 用"感知—决策—行动"循环解释一个智能体是怎样一步步工作的。
  3. 识别模型、工具、记忆和规划四个核心组件,知道每个组件的边界。
  4. 判断一个创作任务是否适合交给智能体协助,哪些环节必须留给人。
  5. 画出自己的第一个"人机协作小流程",包含输入、输出、审核点和停止条件。
  6. 写出一张可执行的智能体任务卡,把目标、权限和验收标准一次写明白。

前置准备

你需要什么

你不需要什么

一个关键认知

Agent 不是"更聪明的聊天机器人",而是"会根据结果继续做事的助手"。

聊天机器人是你问一句、它答一句,对话结束就结束。Agent 是你给它一个目标,它会自己拆步骤、调工具、看结果、再决定下一步——像一个能跑腿的实习生,但你必须给他明确的任务卡和权限边界。


一、Agent 到底是什么

1.1 一句话定义

Agent(智能体)= 有目标、有工具、会根据结果继续推进的 AI 助手。

它不是一个新模型,而是"模型 + 工具 + 记忆 + 规划"的组合体。模型负责理解和生成,工具负责拿数据和执行动作,记忆负责保存上下文,规划负责把大目标拆成小步骤。

1.2 感知—决策—行动循环

Agent 的工作方式可以用一个循环来概括:

目标:整理本周选题
  │
  ▼
感知:读取热点链接、已有选题表和账号定位
  │
  ▼
决策:筛掉无关话题,按潜力排序,决定是否需要补充资料
  │
  ▼
行动:生成选题表,标记需要人工核实的条目
  │
  ▼
观察结果:人看了选题表,反馈"第3条过时了,第7条没有来源"
  │
  ▼
下一轮:根据反馈调整,重新输出

这个循环常被概括为:

感知 → 决策 → 行动 → 观察结果 → 下一轮

为什么这个循环很重要

普通聊天是"一轮就结束"——你问"帮我写个标题",AI 给你 5 个,你自己挑。Agent 的循环意味着它会多跑几步:先找资料,再筛选题,再生成表格,再标记待核实项,最后交给你确认。每一步的输出都会影响下一步。

这带来两个直接后果:

  1. 效率提升:重复的中间步骤(汇总、分类、去重)交给系统,你只看最终结果。
  2. 风险放大:如果目标不清楚或权限太宽,它可能跑偏好几步你才发现。所以必须在关键节点设人工审核。

1.3 Agent 的真正价值

"会自己跑很多步"不是 Agent 的唯一价值。真正价值是:把稳定、重复、规则清楚的步骤交给系统,让人把时间留给判断、创意和责任。

交给 Agent 的 留给人的
汇总链接、去重、格式化 判断选题是否值得做
生成初稿、多版本标题 确认观点、语气和事实
按模板填写表格 决定发布时机和封面
检索已有资料 核实来源和授权

一句话记忆:Agent 是执行助手,不是替身。它能帮你跑腿,但不能替你负责。


二、Agent、聊天机器人与工作流的区别

这是本课最容易混淆的概念,也是新手第一个踩坑点。很多人把"用 ChatGPT 聊天"当成"用 Agent",结果对 Agent 的期望和实际体验不匹配。

2.1 三者对比表

类型 擅长什么 典型输入 典型输出 需要注意什么
聊天机器人 单次问答、草稿、解释 一段提问 一段回答 上下文通常短,不能代替事实核查
工作流 固定顺序的重复步骤 表单、文件、定时触发 固定格式结果 遇到例外时不够灵活
Agent 有目标地选择工具和步骤 目标 + 资料 + 约束 多步结果或任务建议 可能走偏,必须限制权限和预算

2.2 用同一个任务看三种方式

任务:"为本周内容整理 10 个选题"。

方式一:聊天机器人

你在对话框里打:"帮我找 10 个 AI 效率账号的选题。" AI 给你 10 条。你逐条检查,发现 3 条过时、2 条跟账号定位不符。你再追问:"换掉第 3 条和第 7 条。" AI 换了。重复几轮,你花了很多时间在来回修正上。

方式二:工作流

你搭一条固定流程:表单提交热点链接 → 自动摘要 → 按标签分类 → 去重 → 输出选题表。每周只需提交链接,系统自动出表。但如果某条链接打不开,或主题不在预设标签里,流程会卡住,需要手动处理。

方式三:Agent

你给 Agent 一个目标:"用我提供的热点链接和历史选题,整理 10 个下周选题,输出选题表和待核实项。" Agent 自己判断:先读链接,再筛掉与定位不符的,再补充资料,最后生成表格。如果某条链接打不开,它会标记"资料不足"而不是卡住。你只需看最终结果,确认或退回。

2.3 什么时候用哪种

场景 推荐方式 原因
"把这段文案改成更口语化" 聊天 单次任务,一轮就完
"每天早上把表单数据同步到表格" 工作流 固定步骤,规则清楚
"从一批候选话题里找选题,补资料,生成待审核清单" Agent 需要多步判断,中间可能要调整
"帮我分析这篇竞品文章的结构" 聊天 单次分析,不需要循环
"每周自动生成选题 → 大纲 → 初稿 → 待审核" 工作流 + Agent 流程固定但每步需要判断

选型口诀:单次问答用聊天,固定步骤用工作流,多步判断用 Agent,复杂流程组合用。

2.4 不适合交给 Agent 的任务

以下情况先不要自动化,哪怕工具再方便:

先做后自动原则:先把人工流程跑顺 2-3 次,知道每一步的输入、判断和输出,才能知道该自动化哪一步。L1C-07 中"母稿先确认、再派生多形态内容"的原则,同样适用于 Agent。


三、四个核心组件

Agent 由四个组件构成。理解它们的作用和边界,你就能判断任何 Agent 方案的合理性。

3.1 模型:负责理解与生成

做什么:读懂任务、总结资料、写出候选答案、判断该不该调工具。

擅长:语言理解、模式匹配、文本生成、分类和翻译。

不擅长:精确计算、实时信息、事实核查——模型的知识有截止日期,可能编造(幻觉)。

常见错误:把"模型说了"当作事实来源。模型说"某产品月销 10 万",这个数字必须人工核实,不能直接写进文案。

保姆级建议:选模型时关注三点——中文能力(你的内容是中文)、上下文长度(能处理多长的输入)、成本(每次调用的费用)。新手先用免费额度试,不要一开始就追求最强模型。

3.2 工具:负责拿数据和执行动作

做什么:搜索、读写表格、生成图片、合成语音、调用 API、发送通知。

关键认知:模型本身不等于能上网、能发消息、能操作文件。只有被你明确接入并授权的工具,才可以执行相应动作。 这是一道安全边界——模型"建议调用"和"真正执行"之间,必须有你(或你的程序)做的校验。

工具分类:

类别 举例 风险等级
只读工具 搜索、读表格、读文件
生成工具 画图、TTS、写文件
写入工具 写表格、发通知
不可逆工具 发布、删除、付款 极高,必须人工确认

保姆级建议:第一个 Agent 只接 2-3 个只读或生成工具,不接写入和不可逆工具。等流程稳定后再逐步放开。本项目 vbox 的对外 TTS API 就是一个典型的"生成工具",可以在 L1D-06 学到怎么封装它。

3.3 记忆:保存必要的上下文

做什么:记录账号定位、常用语气、已经做过的选题、用户偏好。

两种记忆:

类型 保存什么 举例
短期记忆 当前任务的中间状态 "这轮已经筛掉 3 条了"
长期记忆 跨任务复用的已确认信息 "账号面向职场新人,语气偏口语"

关键原则:只保存完成任务所需的最少信息。敏感资料(身份证、密码、合同原文)和 unnecessary 的个人信息不应塞进长期记忆。

常见错误:把所有对话都当记忆保存。记忆不是杂物箱——信息越多,检索越慢,隐私风险越大。定期清理过期内容。

3.4 规划:把大目标拆成小步骤

做什么:让 Agent 不只输出一大段文字,而是知道"先收集、再筛选、再生成、最后提交审核"。

好的规划 vs 坏的规划:

❌ 坏规划:帮我运营账号
    → Agent 不知道从哪开始,可能瞎跑

✅ 好规划:
    第一步:读取本周热点链接和历史选题
    第二步:去重,筛掉与定位不符的
    第三步:为剩余条目补充资料摘要
    第四步:生成选题表,标记待核实项
    停止条件:资料不足时标记"待补",不继续猜
    交付:选题表 + 待核实清单 → 人工确认

好规划的三个特征:

  1. 有停止条件:知道什么时候该停下,不会无限跑。
  2. 有审核点:中间有明确的"人工确认"步骤。
  3. 有预算上限:限制调用次数或费用,防止失控。

四、从一个小任务开始

不要从"全自动运营账号"开始。下面用"每周选题整理"做第一个练习,手把手带你走一遍。

第 1 步:写清目标

不够清楚的目标:

帮我找爆款选题。

问题:什么是"爆款"?在哪个平台?给谁看?用什么资料?怎么算"找到"?Agent 无从下手,只能瞎猜。

可执行的目标:

为面向职场新人的 AI 效率账号整理 10 个下周选题。
只使用我提供的热点链接和历史数据。
每个选题输出:目标人群、核心问题、事实待核项、建议形式。
任何没有来源的数字都标为"待核实"。
不要直接发布内容。

为什么这版好:有明确受众、有资料来源限制、有输出字段、有标记规则、有禁止动作。Agent 知道该做什么、不该做什么、怎么算完成。

第 2 步:列出输入和输出

项目 内容
输入 账号定位、历史选题、热点链接、平台限制
中间步骤 去重、相关性判断、按内容形式分类
输出 选题表、资料来源、待核实项、人工建议
停止条件 找不到来源、敏感争议大、与定位不匹配
人工审核点 热点真实性、选题匹配度、标题和发布时机

第 3 步:标出人工审核点

至少在三个位置停下来让人确认:

  1. 热点审核:热点是否真实、是否过时、是否有争议。
  2. 选题审核:选题是否符合你的受众和价值观,是否有足够资料支撑。
  3. 发布审核:标题、结论和发布时机是否要采用(这一步在后续发布流程中,不在选题 Agent 范围内)。

审核点设计原则:审核越靠近源头,错误扩散越少。事实错误如果在选题阶段没发现,到初稿、配图、配音都做完才发现,返工成本是 10 倍以上。

第 4 步:复盘一次执行

用上面的目标实际跑一次(可以先用聊天工具模拟),然后记录:

记录项 示例
哪些步骤稳定 去重、格式化选题表
哪里经常出错 热点链接打不开时容易编造内容
哪些字段总要人工改 "核心问题"经常太泛
稳定的部分下次可接工具 去重可以接表格读取
不稳定的部分保留人工 核心问题的精准度需要人来调

五、实战:做一张"智能体任务卡"

把下面模板复制到笔记里,填完就能判断任务是否值得搭 Agent。这张卡比"帮我做一个聪明的 Agent"有用得多——它把能力、权限、边界和验收标准一次写明白。

┌─────────────────────────────────────────┐
│         智能体任务卡 v1.0                │
├─────────────────────────────────────────┤
│ 任务名称:每周选题助手                     │
│ 最终目标:产出待审核的 10 个选题,不直接发布 │
│                                         │
│ 输入来源:                                │
│   - 历史选题表(表格)                     │
│   - 人工挑选的热点链接(5-10 条)           │
│   - 账号定位文档                         │
│                                         │
│ 允许使用的工具:                           │
│   - 表格读取(只读)                       │
│   - 网页摘要(只读)                       │
│   - 文案草稿生成                         │
│                                         │
│ 禁止动作:                                │
│   - 发布内容                             │
│   - 发送私信                             │
│   - 删除已有内容                         │
│   - 使用未授权素材                       │
│                                         │
│ 必须人工确认:                             │
│   - 事实核查                             │
│   - 敏感话题判断                          │
│   - 标题最终版                           │
│   - 发布时间                             │
│                                         │
│ 失败时怎么办:                             │
│   - 标记"资料不足"                       │
│   - 返回原始链接,不猜测                   │
│   - 连续 3 次失败暂停,通知人工            │
│                                         │
│ 成本上限:每周不超过 ___ 元 / ___ 次调用    │
│                                         │
│ 成功标准:                                 │
│   - 选题可去重、可追溯                    │
│   - 人工修改量逐周下降                    │
│   - 待核实项占比低于 20%                  │
└─────────────────────────────────────────┘

任务卡设计三原则

  1. 目标可验收:写得出"怎么算完成"。不是"帮我找选题",而是"产出 10 个待审核选题"。
  2. 权限最小化:只给完成任务必需的工具和权限,不给多余的。
  3. 失败有路径:写清失败时怎么办,不要让 Agent "硬撑"或编造。

FAQ:常见问题

Q1:Agent 会不会取代创作者?

不会完全取代,但会改变工作方式。它可以替你完成资料归类、初稿和重复搬运,但账号定位、观点、事实、审美和发布责任仍在人。把它当成执行助手,而不是替身。2026 年的趋势是"人机协作"——AI 出初稿,人工精修;AI 做配角,人做主角。

Q2:是不是工具越多越聪明?

不是。工具越多,权限、错误和成本也越难管。第一个 Agent 只接完成任务必需的两三种工具即可。等流程稳定、审核机制成熟后,再逐步增加。这叫"先小后大"原则。

Q3:我没有数据或 API,能学习吗?

能。先用手工输入和模拟表格练任务卡、输入输出、审核点;这些设计比接接口更基础。等你明确了"需要什么工具",再去找对应的 API 或平台。不要因为"还没接接口"就跳过任务设计。

Q4:Agent 和我平时用的 ChatGPT 对话有什么区别?

ChatGPT 对话是"你问一句、它答一句",一轮就结束。Agent 是"你给目标、它自己跑多步",中间会调工具、看结果、再决定下一步。可以理解为:聊天是"问路",Agent 是"派快递"——快递员会自己规划路线、遇到堵路会换路、最后把东西送到你手里确认。

Q5:我看别人搭的 Agent 能自动发内容,我也能做吗?

技术上可以,但本课强烈建议新手不要从"自动发布"开始。自动发送错误、侵权或不当回复的代价很高(账号限流、粉丝流失、法律风险)。正确路径是:先让 Agent 产出草稿 → 人工确认 → 人工发布。等流程跑了几十次都很稳定,再考虑放开"发布"权限,而且仍然建议保留"人工一键暂停"开关。


进阶避坑指南

坑 1:目标写成"自动帮我运营"

现象:跟 AI 说"帮我自动运营账号",结果它不知道从哪开始,要么瞎跑一通,要么什么都不做。

原因:目标太大,系统不知道怎样算"完成"。Agent 需要可验证的小目标,不是模糊的大愿景。

处理:把大目标拆成"整理选题""生成初稿""汇总数据"这样的可验收小任务。每个小任务都有明确的输入、输出和完成标准。先跑通一个小任务,再连成大流程。

坑 2:让 Agent 直接发内容

现象:为了省事,给 Agent 开了发布权限,结果它自动发了一条事实错误的内容,被粉丝指出,账号口碑受损。

原因:Agent 不会替你承担发布责任。自动发布的容错率为零——一次错误就可能造成不可逆的声誉损失。

处理:发布和对外承诺必须是人工确认后的动作。在任务卡的"禁止动作"里明确写上"不自动发布"。如果一定要自动化发布,至少保留:人工审核内容 → 确认后系统定时发送 → 发送后人工检查是否成功。

坑 3:把所有资料都当记忆保存

现象:把所有对话、所有文档、所有用户信息都塞进 Agent 的长期记忆,结果它回答越来越慢,还经常把无关信息混进来。

原因:长期记忆不是杂物箱。信息越多,检索越慢,隐私风险越大,还可能让旧信息干扰新判断。

处理:只保留可复用、已确认、必要的信息(如账号定位、已确认的语气偏好),并定期删除过期内容。设置记忆的"过期时间"和"删除方式",比如"90 天后复核,用户请求即可删除"。


最重要的三句话

  1. Agent 的价值是把目标拆成可控步骤,不是让 AI 替你承担责任。
  2. 模型、工具、记忆和规划都要有明确边界,权限最小、审核靠前、失败有路。
  3. 从一个稳定的小任务和人工审核点开始,先跑通再扩展,先小后大。

下一站预告

已经理解 Agent 的边界后,下一篇《L1D-02 主流 Agent 平台与框架:按任务选搭建路线》会比较无代码、低代码和代码三条路线,帮助你为第一张任务卡选择合适的搭建平台。你会看到扣子、Dify、FastGPT、GPTs 等平台各自适合什么场景,以及如何用四个问题做出选型决策。


教程版本:v1.0 最后更新:2026-08 内容时效:平台能力、授权方式和价格会变化;启用任何外部工具前,请以当前官方文档和账号权限为准。本教程提及的工具名称归各自所有方所有,不构成购买建议。