L0-2 AI 名词词典:小白和自媒体人的一本「术语通关手册」

教程编号:L0-2 | 板块:L0 通识与入门 | 难度:★☆☆☆☆(零基础友好) 适用人群:从未接触过 AI 的纯小白、想用 AI 提效的自媒体创作者 预计阅读时间:25–35 分钟 | 术语数量:30+ 核心词条 内容时效:截至 2026 年 8 月,涵盖当前主流 AI 创作生态中高频出现的术语


封面信息


学习目标

学完本教程后,你将能够:

  1. 看懂任意 AI 工具界面、教程文章、社群讨论中出现的 80% 以上高频术语
  2. 说出每个术语的「一句话定义」和生活类比
  3. 分清容易混淆的术语对(如「模型 vs 算法」「微调 vs RAG」「Agent vs 工作流」)
  4. 判断什么场景该用什么术语对应的能力(如知道什么时候该用 RAG、什么时候该用微调)
  5. 沟通时不再「听天书」——和懂行的人交流 AI 时有底气、不怯场

前置准备


核心概念:30+ 术语大白话 + 类比讲透

本节是教程的主体。我会按照「从最基础到稍进阶」的顺序,把术语分成六个梯队来讲。每个词条的格式统一为:

术语名(英文 / 常见缩写) 一句话定义 生活类比 自媒体场景举例 容易混淆的区分点(如有)


第一梯队:最底层概念(不懂这些后面全卡住)

1. AI(人工智能 / Artificial Intelligence)

一句话:让机器学会做「通常需要人类智慧才能做的事」——比如理解语言、看懂图片、写文章、做决策。

类比:AI 就像一个「读过整个图书馆的超级实习生」。它什么书都读过,你问什么它都能答上来一些,但它没有自己的亲身经历,偶尔会一本正经地胡说八道。

自媒体场景:你让 AI 帮你写一篇小红书文案、帮你把一段语音转成文字、帮你把一张照片变成漫画风格——这些都是 AI 在干活。

区分:AI 是最大的概念伞,下面有机器学习、深度学习、大语言模型等子集。日常口语中我们说「AI」时,多数时候特指「大语言模型对话工具」(如 ChatGPT),但严格来说 AI 的范围大得多。


2. 算法(Algorithm)

一句话:一套「按步骤做事的说明书」。机器照着说明书一步步执行,就能从输入得到输出。

类比:菜谱就是算法。食材是输入,做出来的菜是输出,菜谱上写的「先热油、再放蒜、炒 3 分钟」就是步骤。

自媒体场景:你平时用剪映的「一键成片」,背后就是一套算法——它按固定步骤帮你挑素材、配音乐、加字幕。

区分:算法是「方法/步骤」,不是「成品」。同一个算法用不同数据训练,会得到不同的模型。


3. 模型(Model)

一句话:算法跑完「学习过程」后留下的那个「学会了的本事」。模型是 AI 的「大脑成品」,你给它输入,它给你输出。

类比:如果说算法是菜谱,那模型就是你照着菜谱练了 100 遍之后练出来的「手感」。菜谱谁都能看,但手感是你练出来的、长在你手上的东西。你把这个手感「打包」给别人,别人不用重新练 100 遍就能直接炒菜——这就是「训练好的模型」。

自媒体场景:你用的 ChatGPT、豆包、Kimi,它们各自是一个「模型」。你输入「帮我写个标题」,模型输出一段标题——模型就是那个「会写东西的脑子」。

区分


4. 大语言模型(LLM / Large Language Model)

一句话:专门处理「语言文字」的超大模型。能读、能写、能聊天、能总结、能翻译——一切跟文字有关的任务它都能做。

类比:一个「把全世界互联网上的文字都读过一遍的语言天才」。你问它任何跟文字有关的问题,它都能基于读过的内容给你一个回答。

自媒体场景:写文案、改稿子、起标题、写脚本、想选题——这些都是文字任务,都是 LLM 的主战场。

常见 LLM(截至 2026 年 8 月):

区分:LLM 是模型的一种。模型还有「图像模型」(生成图片)、「语音模型」(生成语音)等。LLM 专管文字。


5. 训练(Training)

一句话:让模型从海量数据中「学习规律」的过程。训练完成后的模型才具备能力。

类比:学生做 10 万道题的过程就叫训练。做完之后,脑子里形成了「做题的方法」——那就是模型。

自媒体场景:你不需要自己训练模型(那是 AI 公司的事)。但你需要知道「训练」这个词的含义,因为很多教程里会说「这个模型是用 2024 年的数据训练的,所以它不知道 2025 年的事」——意思是模型的知识停留在训练数据的时间点。


6. 推理(Inference)

一句话:训练好的模型「回答你的问题」的过程。你输入一段文字,模型输出一段回答——这个动作就叫推理。

类比:学生考完试上了考场,看到一道题开始作答——这个作答过程就是推理。

自媒体场景:你在对话框里打字、点发送、等 AI 回复——你等的那几秒钟,模型正在「推理」。

区分


7. 参数(Parameters)

一句话:模型内部「调节旋钮」的数量。参数越多,模型越大、能力通常越强,但也更贵、更慢。

类比:参数就像音响上的旋钮。一个音响有 10 个旋钮,另一个有 1000 个旋钮——后者能调出更细腻的音效,但也更难调、更贵。模型同理:7B(70 亿参数)的模型比 1B 的强,但跑起来更吃硬件。

自媒体场景:你不需要记参数的具体数字。但看到「70B 模型」「千亿参数」这类说法时,你知道这是在说模型的大小和等级就行。

常见量级:1B = 10 亿参数,7B = 70 亿,70B = 700 亿,1T = 1 万亿。截至 2026 年,主流商用 LLM 的参数量在百亿到万亿级别。


第二梯队:日常用 AI 时最常遇到的词

8. Prompt(提示词)

一句话:你给 AI 的「指令 / 要求」。你打的那段字就是 Prompt。

类比:你去理发店跟理发师说的话。「剪短一点,刘海不要挡眼睛,后面推上去」——这就是 Prompt。说得越清楚,理发师越能剪出你想要的;说得太模糊(「随便剪剪」),结果可能让你崩溃。

自媒体场景:你想让 AI 写一篇小红书种草文案,你输入的这段话就是 Prompt:

「帮我写一篇小红书种草笔记,产品是xx精华液,卖点是美白+保湿,语气要像真实用户分享,300 字左右,结尾加 3 个热门标签。」

关键认知:Prompt 的质量直接决定 AI 输出的质量。写好 Prompt 是 AI 创作的第一核心技能,后续 L2-A1 教程会专门教。


9. Token(令牌 / 词元)

一句话:AI 处理文字的「最小单位」。一段话会被切成很多个 Token,模型按 Token 来计算长度和费用。

类比:Token 就像「自助餐的计价单位」。自助餐不按你吃了什么菜收费,按「盘数」收费——一盘不管装什么都是 10 块。AI 也类似:它不按「字数」算,按 Token 算。一个 Token 大约等于 0.75 个英文单词,或者 0.5–1.5 个汉字(中文一个字可能被切成 1–2 个 Token)。

自媒体场景

实用换算(粗略估算,中文):

区分:Token 不是「字」也不是「词」,是模型自己定义的切分单位。不同模型的 Token 切分方式不同,所以同样的文字在不同模型里 Token 数可能不一样。


10. 上下文窗口 / 上下文长度(Context Window / Context Length)

一句话:模型一次对话能「记住和看到」的最大文字量。超出这个量,早期内容会被「忘记」。

类比:上下文窗口就像「金鱼的记忆容量」。如果你的金鱼记忆容量是 10 句话,你跟它说到第 11 句时,它已经忘了第 1 句。模型也一样:如果上下文窗口是 128K Token,对话总长超过这个量后,最早的消息就被挤出记忆了。

自媒体场景

实用建议:如果你经常需要处理长文档(论文、采访稿、长文),优先选上下文窗口大的模型(如 Kimi、Claude 等)。


11. 对话 / 会话(Conversation / Session)

一句话:你从打开一个新对话到关掉它(或点「新建对话」)之间的整个交互过程。

类比:就像打电话——从拨通到挂断就是一通电话(一个会话)。挂断后再打新的,对方就不记得上一通电话聊了什么了。

自媒体场景:你在 ChatGPT / 豆包里点「新建对话」后开始聊天。在同一个对话里,AI 记得前面说过什么;一旦你新建对话,AI 就「失忆」了,从头开始。

实用建议:不同任务用不同对话。「写文案」用一个对话,「想选题」用另一个。别在一个对话里又写文案又想选题又做翻译,上下文混在一起会让 AI 输出质量下降。


12. 温度(Temperature)

一句话:控制 AI 输出「随机性 / 创造性」的一个数值。温度越高越天马行空,越低越稳定规矩。

类比:温度就像「厨师的发挥程度」。温度低 = 厨师严格按菜谱做,每次做出来的味道一模一样;温度高 = 厨师开始即兴发挥,每次都不一样,可能给你惊喜,也可能翻车。

自媒体场景

注意:不是所有工具都暴露温度设置。多数消费级工具(豆包、Kimi 等)把温度藏在「高级设置」里或不暴露,默认值已经调好。API 用户可以自行设置。


13. 幻觉(Hallucination)

一句话:AI 一本正经地胡说八道。它生成的内容看起来很专业、很流畅,但事实是错的、编造的。

类比:就像一个「考试不会但特别会编答案的学生」。他写出来的答案格式工整、逻辑通顺、用词专业,但内容是完全编的。你如果不懂行,很容易被他唬住。

自媒体场景

避坑要点

  1. 涉及事实、数据、引用的内容,一定要人工核实
  2. 不要让 AI 生成「需要 100% 准确」的内容(如法律条款、医疗建议、财务数据)后直接发布
  3. 在 Prompt 里加一句「如果不确定请说不知道」,能减少一部分幻觉

第三梯队:模型能力的几个关键概念

14. 多模态(Multimodal)

一句话:模型能同时处理多种类型的信息——文字 + 图片 + 语音 + 视频,而不只是单一的文字。

类比:以前 AI 是「单科天才」——只会语文(文字),不会看图、不会听声音。多模态 AI 是「全科选手」——能读文字、能看图片、能听语音、能看视频,而且能把不同类型的信息结合起来理解。

自媒体场景

2026 年现状:主流大模型(GPT-4o、Gemini、Claude、豆包等)已普遍支持多模态输入(文字 + 图片 + 语音),部分支持视频理解和图片/视频生成。


15. 生成式 AI(Generative AI / GenAI)

一句话:能「创造新内容」的 AI——写新文章、画新画、生成新语音、做新视频。与之相对的是「判别式 AI」(只能分类、判断,不能创造)。

类比

自媒体场景:你用 AI 写文案、配图、配音——用到的全是生成式 AI。这是当前 AI 创作生态的核心。


16. 开源模型 vs 闭源模型(Open-source / Closed-source Model)

一句话

类比

自媒体场景

2026 年现状:开源模型能力已非常接近主流闭源模型,差距在持续缩小。对个人创作者来说,日常使用闭源工具最省事;对有技术能力、追求定制化和数据隐私的团队,开源模型是更好的选择。


第四梯队:让模型变强的两条路线

17. 微调(Fine-tuning)

一句话:在已有模型的基础上,用你自己的数据再「补课」一轮,让它在特定领域 / 特定风格上更强。

类比:一个医学毕业生已经学完所有基础课(预训练),你让他去骨科实习 3 个月(微调),回来他就成了骨科专长医生。基础能力没变,但在骨科这个方向上明显更专业。

自媒体场景

什么时候用微调

什么时候不需要微调


18. RAG(检索增强生成 / Retrieval-Augmented Generation)

一句话:在 AI 回答问题前,先去你的资料库里「查一下资料」,把查到的相关内容喂给 AI,让它基于这些资料来回答——从而减少幻觉、增加准确性。

类比:开卷考试。闭卷考试时学生只能靠记忆答题(容易记错 = 幻觉);开卷考试时学生可以先翻书找到相关段落,再抄着答——准确多了。RAG 就是给 AI 来一场「开卷考试」。

自媒体场景

RAG vs 微调(关键区分)

维度 RAG 微调
原理 给 AI 塞参考资料(开卷考试) 给 AI 补课(重新学一轮)
数据量 可以很少(几篇文档也行) 需要较多(几百条起步)
时效性 换资料就更新,实时 改了数据要重新训练
适合场景 事实型问答、知识查询 风格学习、领域专精
技术门槛 中等(需搭检索系统) 较高(需 GPU + 训练知识)

一句话记忆:RAG 是「给 AI 一本书翻着答」,微调是「让 AI 上个培训班学完再答」。


19. 向量数据库 / 向量检索(Vector Database / Vector Search)

一句话:把文字、图片等变成一串数字(向量),然后按「语义相似度」来找最相关的内容——这是 RAG 的底层技术。

类比:普通搜索 = 按「关键词」匹配(搜「苹果」只能找到含「苹果」二字的内容);向量搜索 = 按「意思」匹配(搜「苹果」能找到写着「iPhone」的内容,因为它们意思相近)。

自媒体场景:你做了个 AI 知识库,用户问「怎么退货」,向量检索能找到标题叫「退换货政策」的文档——即使文档里没有「怎么退货」这四个字。


20. 嵌入(Embedding)

一句话:把文字(或图片、语音)变成一串数字的过程。这串数字代表了内容的「语义指纹」,相似内容的指纹也相似。

类比:就像给每段文字发一个「DNA 编码」。内容相似的文字,DNA 编码也接近;内容无关的文字,DNA 编码差很远。AI 通过比较 DNA 编码,就能判断两段文字「意思上像不像」。

自媒体场景:你一般不会直接接触 Embedding,但如果你用 Dify、Coze 等平台搭建 AI 知识库时,会看到「向量化」「Embedding 模型」等选项——就是在干这个事。


第五梯队:Agent 与自动化

21. Agent(智能体)

一句话:能「自己思考、自己调用工具、自己分步骤完成任务」的 AI。不是你问一句它答一句,而是你给一个目标,它自己拆解步骤、调用工具、逐步完成。

类比

自媒体场景

2026 年现状:Agent 是 2025–2026 年 AI 领域最热的方向之一。主流工具(如 ChatGPT、Claude、Coze、Dify 等)都已支持 Agent / 工作流模式。但对纯小白来说,建议先掌握好基础的 Prompt 技能,再过渡到 Agent。


22. 工具调用 / 函数调用(Tool Use / Function Calling)

一句话:让 AI 能「使用外部工具」——比如联网搜索、查数据库、调 API、发邮件、操作软件。AI 本身不会做这些事,但它能「调用」能做这些事的工具。

类比:AI 就像一个「会指挥的老板」。它自己不会开车、不会做饭、不会打电话,但它知道该让谁去做、什么时候做、怎么把结果整合起来。

自媒体场景

区分:工具调用是 Agent 的核心能力之一。Agent 之所以能「自己完成任务」,就是因为它会调用一系列工具。


23. 工作流(Workflow)

一句话:把多个 AI 步骤按固定顺序串起来,每一步的输出是下一步的输入,形成一条「流水线」。

类比:工厂流水线。原料进来 → 第一道工序加工 → 第二道工序 → …… → 成品出厂。工作流就是把 AI 任务拆成流水线。

自媒体场景

Agent vs 工作流(关键区分)


24. MCP(模型上下文协议 / Model Context Protocol)

一句话:一种「让 AI 连接外部工具和数据源的通用接口标准」。可以理解为 AI 世界的「USB 接口」——不管什么工具,只要支持 MCP 就能即插即用地连到 AI 上。

类比:USB 出现之前,每种外设都有不同的接口,电脑上要装各种驱动。USB 出现后,鼠标、键盘、U 盘、打印机全用一种接口。MCP 之于 AI 工具生态,就像 USB 之于电脑外设。

自媒体场景:你用支持 MCP 的 AI 工具时,可以一键连接你的飞书文档、Notion、Google Drive、数据库等——不用每个工具单独写对接代码。2025–2026 年 MCP 已成为主流 Agent 生态的连接标准。


25. 多智能体(Multi-Agent)

一句话:多个 Agent 分工合作,各管一摊,一起完成一个大任务。像一个团队里有产品经理、设计师、文案、编辑,每人负责自己的部分,协作产出最终成品。

类比:一个自媒体团队——一个人负责选题、一个人负责写稿、一个人负责配图、一个人负责审稿。多 Agent 就是让多个 AI 各扮演一个角色,协作完成任务。

自媒体场景


第六梯队:进阶必知

26. 预训练(Pre-training)

一句话:模型「从零开始读海量数据」的第一轮大规模学习。预训练出来的模型叫「基座模型」,具备通用的语言理解和生成能力。

类比:读完小学到大学的基础教育。这阶段学的是「通识」——什么都知道一点,但哪个方向都不够专。之后再去实习 / 考证(微调)才会变专业。


27. RLHF(基于人类反馈的强化学习)

一句话:让人类给 AI 的回答打分 / 排序,AI 根据人类偏好来调整自己的回答方式——让输出更符合人类口味。

类比:实习生写了报告,主管圈圈画画告诉他「这里太啰嗦、这里要分点、这里语气不对」。实习生调整后越写越对味——这就是 RLHF。

自媒体场景:你不需要自己做 RLHF。但你需要知道,AI 工具之所以能输出「听起来像人写的、有礼貌、有结构」的内容,RLHF 功不可没。没有 RLHF 的模型说话会像「原始机器」——干巴巴、不分场合。


28. 上下文(Context)

一句话:在当前对话中,AI 能看到的「所有信息」——包括你说的、它说的、你之前发的、系统预设的,全部加起来就是上下文。

类比:上下文就是「此时此刻这场对话中所有人都能看到和回忆起来的内容」。如果你在群里聊天,上下文就是从你进群到现在所有人发的消息。一旦你退群重进,之前的消息就看不到了——就像新建对话后 AI 失忆。

实用建议:在 Prompt 里提供充足的上下文(背景信息、目标受众、风格要求、参考示例),是提升 AI 输出质量最有效的方法之一。


29. 系统提示词 / 系统消息(System Prompt / System Message)

一句话:在对话开始前给 AI 的「角色设定和行为规则」。用户看不到它,但它影响 AI 全程的表现。

类比:演员上台前导演给的「角色说明」——「你演一个 30 岁的上海宝妈,说话要亲切、用一些上海话俚语、总是先夸再建议」。演员上台后的所有表演都受这个设定影响。

自媒体场景:很多 AI 工具允许你设置「系统提示词」。你可以设:「你是一个资深小红书运营博主,擅长写种草文案,语气亲切自然,总是先给结论再展开」——之后所有对话都会受这个设定影响。


30. 插件 / 扩展(Plugin / Extension)

一句话:给 AI 工具额外加装「功能模块」。装了插件,AI 就多了个能力——就像手机装 App 一样。

类比:手机出厂只有基础功能,装了微信能聊天,装了美图秀秀能修图。AI 工具也类似——装了「联网搜索插件」能搜实时信息,装了「PDF 阅读插件」能读 PDF。


31. API(应用程序接口 / Application Programming Interface)

一句话:让程序和程序之间「对话」的通道。通过 API,你的程序可以调用 AI 模型的能力,而不需要打开网页手动输入。

类比:餐厅的「点菜窗口」。你(顾客 / 程序)在窗口告诉厨师(AI 模型)要什么,厨师做好从窗口递给你。你不用进后厨、不用知道菜怎么做的,只需要知道怎么点单。

自媒体场景


32. 量化(Quantization)

一句话:把模型的「精度压缩」——用更少的数据来存储和计算模型,让模型变小、变快,代价是精度略微下降。

类比:把一张 4K 高清照片压缩成 1080P。文件小了、加载快了,肉眼看起来差不多,但放大细看会损失一些细节。量化让大模型能在普通电脑甚至手机上运行。

自媒体场景:你一般不直接接触量化。但如果你听说「某模型推出了 4bit 量化版,可以在普通笔记本上跑」——这就是量化在起作用,让开源模型的使用门槛大幅降低。


33. 推理速度 / 延迟(Inference Speed / Latency)

一句话:AI 从收到你的输入到给出回答所花的时间。延迟越低,体验越流畅。

类比:点外卖后等餐的时间。等 30 秒你觉得很快,等 5 分钟你觉得慢,等 30 分钟你开始不耐烦。

自媒体场景


术语对照速查表

中文术语 英文 / 缩写 一句话人话 一句话类比
人工智能 AI 让机器做需要人类智慧的事 读过整个图书馆的超级实习生
算法 Algorithm 按步骤做事的说明书 菜谱
模型 Model 学好的本事,AI 的大脑成品 练了 100 遍菜谱后的手感
大语言模型 LLM 专管文字的超大模型 读遍全网文字的语言天才
训练 Training 模型学习的过程 学生做 10 万道题
推理 Inference 模型回答问题的过程 学生考试答题
参数 Parameters 模型内部旋钮的数量 音响上的旋钮个数
提示词 Prompt 你给 AI 的指令 跟理发师说想要的发型
词元 Token AI 计价和计长的最小单位 自助餐的盘子数
上下文窗口 Context Window 一次对话能记住的最大文字量 金鱼的记忆容量
温度 Temperature 控制输出随机性的数值 厨师的发挥程度
幻觉 Hallucination AI 一本正经胡说八道 会编答案的学生
多模态 Multimodal 能同时处理文字/图片/语音/视频 全科选手
生成式 AI GenAI 能创造新内容的 AI 画家(vs 鉴定师)
微调 Fine-tuning 用自己的数据给模型补课 医学生去骨科实习
检索增强生成 RAG 先查资料再回答 开卷考试
向量检索 Vector Search 按「意思」搜索内容 按语义而非关键词搜
嵌入 Embedding 把文字变成数字指纹 给文字发 DNA 编码
智能体 Agent 能自己拆步骤、调工具完成任务的 AI 会自己干活的实习生
工具调用 Tool Use / Function Calling AI 调用外部工具 老板指挥别人干活
工作流 Workflow 固定顺序的 AI 步骤流水线 工厂流水线
MCP Model Context Protocol AI 连接工具的通用接口 AI 世界的 USB 接口
多智能体 Multi-Agent 多个 Agent 分工协作 自媒体团队协作
预训练 Pre-training 从零开始的大规模学习 读大学基础教育
人类反馈强化学习 RLHF 用人类偏好调教 AI 主管批改实习生报告
上下文 Context 对话中所有可见信息 群聊里所有人发的消息
系统提示词 System Prompt 对话前的角色设定 导演给演员的角色说明
插件 Plugin 给 AI 加装功能模块 手机装 App
API Application Programming Interface 程序间对话的通道 餐厅点菜窗口
量化 Quantization 压缩模型精度让变小变快 4K 照片压成 1080P
延迟 Latency AI 响应时间 点外卖后的等餐时间

分步实操:在实际工具中遇到这些术语

学完了理论,下面带你走一遍「打开 AI 工具时你会在哪些地方遇到这些术语」,让知识落地。

步骤 1:打开任意 AI 对话工具(体验 Prompt / Token / 上下文 / 推理)

  1. 打开你常用的 AI 工具(ChatGPT、豆包、Kimi、DeepSeek 均可)
  2. 新建一个对话——你刚创建的就是一个「会话 / Session」
  3. 在输入框打一段话,比如:

    你是一个小红书博主,帮我写一篇关于「夏日防晒霜」的种草笔记,300 字,语气亲切自然。

  4. 点发送——你刚才输入的这段话就是 Prompt,AI 正在 推理,几秒后返回结果
  5. 继续追问「把结尾的标签换成更小众的」——AI 能接上下文,因为它在 上下文窗口 内记住了前面的对话
  6. 如果你用的工具显示 Token 数(如部分工具的「用量统计」),观察一下这段对话消耗了多少 Token

术语遇见清单:Prompt、推理、会话、上下文窗口、Token


步骤 2:上传一张图片让 AI 描述(体验多模态)

  1. 在同一个或新建对话中,上传一张照片(你的自拍、产品图、风景照都行)
  2. 输入 Prompt:「描述这张图片里有什么,用一句话概括」
  3. AI 会返回对图片的描述——这就是 多模态 能力(文字 + 图片混合输入)

术语遇见清单:多模态、Prompt、推理


步骤 3:在设置里找「温度 / 模型选择」(体验模型选择和参数调节)

  1. 打开工具的「设置」或「高级选项」
  2. 如果有「模型选择」,你会看到多个模型名(如 GPT-4o、GPT-4o-mini 等)——这是不同的 模型
  3. 如果有「温度 / Temperature」滑块,拖动它——这就是 温度 参数
  4. 用同一个 Prompt 分别在高温度和低温度下生成,对比输出的差异

术语遇见清单:模型、温度、参数


步骤 4:让 AI 联网搜索(体验工具调用)

  1. 在支持联网的 AI 工具中,输入:

    帮我搜索一下今天的微博热搜前 5 条,用一句话概括每条在说什么。

  2. AI 会先调用「联网搜索」工具,拿到结果后再总结回答——这就是 工具调用 / Tool Use

术语遇见清单:工具调用、Agent(如果工具自动多步执行)


步骤 5:观察一次幻觉(体验并识别幻觉)

  1. 在 AI 对话中输入:

    请介绍一下 2026 年诺贝尔文学奖得主的作品风格。

  2. 注意:由于 2026 年诺贝尔奖可能尚未揭晓(或模型知识有截止日期),AI 可能会 编造 一个听起来很真实的回答——这就是 幻觉
  3. 试着追问「你确定吗?请给出信息来源」——观察 AI 是否会承认不确定

术语遇见清单:幻觉、训练(知识截止日期)


案例实战

案例 1:用 RAG 思路让 AI 基于你的资料写文案(串联:Prompt / 上下文 / 幻觉 / RAG)

场景:你是一个母婴博主,有一份品牌方发来的产品手册(PDF / 文字),想让 AI 基于这份手册写一篇种草文案,而且不能编造产品功效。

小白版 RAG 操作(不需要搭建系统,用对话工具模拟):

  1. 把产品手册的文字内容复制到对话框,前面加一段 Prompt:

    以下是一份产品手册。请仔细阅读,后续我会基于这份手册让你写文案,你只能使用手册中提到的信息,不能编造任何未提及的功效或成分。

    【产品手册内容】: (粘贴全文)

  2. 然后发第二条 Prompt:

    基于上面的手册,帮我写一篇小红书种草笔记,要求:

    • 只使用手册中提到的功效和成分
    • 语气像真实妈妈用户的分享
    • 300 字左右
    • 结尾加 3 个标签
    • 如果手册里没有的信息,请直接说「手册未提及」,不要编
  3. AI 基于你提供的资料来写——这就是 RAG 的核心思路:先给资料,再提问
  4. 对比:不做第 1 步直接让 AI 写,AI 很可能 幻觉 出一些产品没有的功效

术语实战:Prompt(你写的两段指令)、上下文(手册内容进入上下文窗口)、RAG(检索增强生成的思路)、幻觉(对比有无资料的差异)


案例 2:用工作流思路批量生成选题(串联:Prompt / 工作流 / Agent / 工具调用)

场景:你想让 AI 帮你产出一周的短视频选题,要求每个选题自带标题、钩子、大纲。

操作

  1. 第一步 Prompt(选题方向):

    我做一个面向职场新人的短视频账号,主题是「职场沟通技巧」。请帮我生成 7 个本周可拍的选题方向,每个选题用一句话描述。

  2. 第二步 Prompt(基于第一步的输出展开):

    请把上面 7 个选题每个都展开成以下格式: 【标题】一个有吸引力的短视频标题 【钩子】前 3 秒能抓住人的开头 【大纲】3–5 个要点的分点大纲 【时长建议】建议视频时长

  3. 第三步 Prompt(优化):

    请检查以上 7 个选题,去掉任何过于宽泛或重复的,替换成新的。然后按「我认为最可能火的顺序」排列。

解读:你刚才其实手动走了一个 工作流——三个步骤按固定顺序串联,每步的输出是下步的输入。如果把这个流程在 Coze / Dify 里固化下来,让它自动跑——那就是一个真正的 AI 工作流。如果更进一步,让 AI 自己决定每一步该做什么——那就是 Agent。如果中间还调用了「搜索微博热搜」来辅助选题——那就是 工具调用

术语实战:Prompt、工作流、Agent、工具调用、上下文(前一步输出进入后一步上下文)


案例 3:体验微调 vs 纯 Prompt 的差异(串联:微调 / 预训练 / 模型)

场景:你想让 AI 模仿你的写作风格写文案。

方法 A(纯 Prompt,零门槛)

  1. 在对话中粘贴 3 篇你过去写的爆款文案
  2. Prompt:「以上是我过去写的 3 篇文案,请分析我的写作风格(语气、结构、用词偏好),然后用同样的风格帮我写一篇关于xx的新文案」
  3. AI 会尝试模仿——效果取决于 Prompt 写得好不好、样本够不够

方法 B(微调,高门槛)

  1. 收集 200–500 篇你过去写的文案
  2. 把它们整理成「训练数据格式」(需要技术能力或找工具辅助)
  3. 选择一个开源模型(如 Llama / Qwen),用你的数据 微调
  4. 微调后的模型不需要在 Prompt 里塞范文,天然就会用你的风格写

对比

结论:对 99% 的自媒体创作者,先用好方法 A(Prompt),等你确实有大量优质数据 + 技术能力 + 明确的定制需求时,再考虑方法 B(微调)。

术语实战:Prompt、微调、预训练、模型、训练数据


可复用速查表模板

下面给你一张「随时可翻」的速查表。建议截图保存或打印贴在电脑旁。

场景速查:我该用哪个术语对应的能力?

我的需求 对应术语 对应能力 难度
让 AI 帮我写东西 Prompt 提示词工程 ★☆☆
让 AI 记住长文档 上下文窗口 长上下文模型 ★☆☆
让 AI 看图 / 听音 多模态 多模态模型 ★☆☆
让 AI 基于我的资料回答 RAG 检索增强生成 ★★☆
让 AI 自动联网查信息 工具调用 Tool Use ★★☆
让 AI 自己完成多步任务 Agent 智能体 ★★★
把多步 AI 任务串成流水线 工作流 Workflow ★★★
让 AI 模仿我的写作风格 微调 / Prompt Fine-tuning / 少样本 ★★★★
让 AI 连接我的飞书 / Notion MCP 模型上下文协议 ★★★
在自己电脑上跑 AI 开源模型 + 量化 部署开源模型 ★★★★

易混淆术语速查

容易混淆的一对 区别一句话
算法 vs 模型 算法是方法(菜谱),模型是学好后的成品(手感)
训练 vs 推理 训练是学习(做题),推理是应用(考试)
上下文 vs 上下文窗口 上下文是当前对话所有信息,上下文窗口是能装下的最大量
RAG vs 微调 RAG 是开卷考试(临时翻书),微调是培训班(学完再考)
Agent vs 工作流 Agent 自己决定怎么走(出租车),工作流按预设轨道走(火车)
多模态 vs 生成式 AI 多模态指能处理多种信息类型,生成式指能创造新内容(两者正交)
开源 vs 闭源 开源是公开菜谱,闭源是秘方
幻觉 vs 错误 幻觉是「自信地编造」,错误是「诚实地说错」
Prompt vs 系统提示词 Prompt 是用户每次发的指令,系统提示词是对话开始前的角色设定

FAQ:高频问题 8 条

Q1:Token 到底怎么算的?为什么同样一段中文在不同工具里 Token 数不一样?

不同模型使用不同的「分词器」,对中文的切分方式不同。有的模型 1 个汉字 = 1 个 Token,有的是 1 个汉字 = 2 个 Token 甚至更多。粗略估算中文时,按「1 个汉字 ≈ 1–1.5 个 Token」来估比较安全。如果需要精确数字,各工具官方一般提供 Token 计数器。


Q2:AI 的知识有截止日期吗?为什么它不知道最近发生的事?

有。模型的「世界知识」来自 训练数据,训练数据有一个截止时间。比如一个 2024 年 6 月训练的模型,它不知道 2024 年 7 月之后发生的事。解决方法:用支持 联网搜索 / 工具调用 的 AI 工具,或用 RAG 把最新资料喂给它。


Q3:Prompt 写多长合适?是不是越长越好?

不是越长越好。好 Prompt 的关键是「清晰、具体、有约束」,不是堆字数。一段 3 行的精准 Prompt 通常比一段 30 行的啰嗦 Prompt 效果更好。核心要素:角色设定 + 任务目标 + 具体要求 + 输出格式 + 参考示例(可选)。


Q4:我听人说「大模型」「小模型」,到底怎么区分?

没有绝对标准。粗略分法(2026 年口径):

但参数量不是唯一标准——训练数据质量、架构创新等都影响模型实际能力。


Q5:我是纯小白,需要学会微调 / RAG / Agent 吗?

现阶段不需要。这三者都有一定门槛。建议路径:

  1. 先把 Prompt 写好(这是 ROI 最高的技能,零门槛)
  2. 再学会在对话中给 AI 塞参考资料(RAG 的简化版)
  3. 再尝试用 Coze / Dify 等可视化工具搭建 工作流(无需代码)
  4. 最后再考虑 Agent / 微调 等进阶方向

Q6:AI 输出的内容版权归谁?我能直接发到自媒体账号上吗?

这是复杂的法律问题,不同国家和地区规定不同。截至 2026 年,主流观点是:


Q7:「幻觉」能完全消除吗?

不能完全消除,但可以大幅减少。方法:

  1. RAG(先给资料再提问)
  2. 在 Prompt 里加「如果不确定请直接说不知道」
  3. 让 AI「分步骤推理」并「标注信息来源」
  4. 人工核实关键事实——这是最后一道防线,不可省略

Q8:MCP、API、插件有什么区别?

简单理解:API 是「公路」,插件是「某品牌专用车道」,MCP 是「通用高速公路标准」。


进阶避坑

坑 1:把「模型」和「工具」搞混

:以为 ChatGPT = GPT 模型,豆包 = 豆包模型。

纠正:一个「工具 / 产品」背后可能用了多个模型。比如 ChatGPT 这个产品可以选择 GPT-4o、GPT-4o-mini 等不同模型。豆包 App 里也有不同模型在支撑不同功能。模型是大脑,工具是壳子——同一个模型可以装在不同壳子里。


坑 2:盲目追求大模型 / 最新模型

:觉得「最新最大的模型一定最好」,每次都选最强模型。

纠正:选模型要看场景。写个 200 字的朋友圈文案,用小模型就够了,速度快还省钱。做复杂推理 / 长文档分析时才需要大模型。杀鸡不用牛刀——成本和速度也是重要的考量因素。


坑 3:把 Prompt 当许愿灯

:Prompt 写得像许愿——「帮我写一个爆款文案,要超级吸引人,要让人忍不住转发」。

纠正:AI 不懂「爆款」「超级吸引人」具体是什么意思。你需要给 具体可执行的约束——「用疑问句开头」「包含数字」「提到 3 个具体使用场景」「口语化,像跟闺蜜聊天」「总字数 250–300 字」。Prompt 越具体,输出越可控。


坑 4:以为 RAG / 微调能解决一切

:听说 RAG 和微调很厉害,一上来就想搞。

纠正:90% 的自媒体创作需求,用好的 Prompt 就能解决。RAG 和微调是用来解决「Prompt 解决不了的特定问题」的——前者解决「事实准确性 / 私有知识」,后者解决「风格深度定制」。先吃透 Prompt,再考虑这些进阶手段。


坑 5:忽视幻觉,直接发布 AI 生成的事实内容

:AI 写了一篇科普文章,里面有 3 个「研究发现」和 2 个「数据」,你没核实就直接发了。

纠正:AI 会非常自信地编造看起来很真的数据和引用。任何涉及事实、数据、引用、人名、书名、法规的内容,必须人工核实后再发布。这是 AI 创作的铁律。


小结与衔接

本篇小结

恭喜你读完了整本「AI 术语通关手册」。回顾一下你现在的知识储备:

最重要的是:术语只是门面,真正的能力在实践。你现在有了「看懂」的基础,接下来要做的是「动手用」。

下一步去哪

提示:本教程会随 AI 领域发展持续更新。术语的生命力在于使用——下次你在 AI 工具里看到这些词时,停下来想一秒它的意思,用不了几次,这些词就会变成你自己的词汇。


本教程内容截至 2026 年 8 月。AI 领域发展迅速,部分术语的内涵可能随技术演进而变化,我们会定期更新。如有疑问或建议,欢迎在评论区交流。