教程编号:L0-2 | 板块:L0 通识与入门 | 难度:★☆☆☆☆(零基础友好) 适用人群:从未接触过 AI 的纯小白、想用 AI 提效的自媒体创作者 预计阅读时间:25–35 分钟 | 术语数量:30+ 核心词条 内容时效:截至 2026 年 8 月,涵盖当前主流 AI 创作生态中高频出现的术语
学完本教程后,你将能够:
本节是教程的主体。我会按照「从最基础到稍进阶」的顺序,把术语分成六个梯队来讲。每个词条的格式统一为:
术语名(英文 / 常见缩写) 一句话定义 生活类比 自媒体场景举例 容易混淆的区分点(如有)
一句话:让机器学会做「通常需要人类智慧才能做的事」——比如理解语言、看懂图片、写文章、做决策。
类比:AI 就像一个「读过整个图书馆的超级实习生」。它什么书都读过,你问什么它都能答上来一些,但它没有自己的亲身经历,偶尔会一本正经地胡说八道。
自媒体场景:你让 AI 帮你写一篇小红书文案、帮你把一段语音转成文字、帮你把一张照片变成漫画风格——这些都是 AI 在干活。
区分:AI 是最大的概念伞,下面有机器学习、深度学习、大语言模型等子集。日常口语中我们说「AI」时,多数时候特指「大语言模型对话工具」(如 ChatGPT),但严格来说 AI 的范围大得多。
一句话:一套「按步骤做事的说明书」。机器照着说明书一步步执行,就能从输入得到输出。
类比:菜谱就是算法。食材是输入,做出来的菜是输出,菜谱上写的「先热油、再放蒜、炒 3 分钟」就是步骤。
自媒体场景:你平时用剪映的「一键成片」,背后就是一套算法——它按固定步骤帮你挑素材、配音乐、加字幕。
区分:算法是「方法/步骤」,不是「成品」。同一个算法用不同数据训练,会得到不同的模型。
一句话:算法跑完「学习过程」后留下的那个「学会了的本事」。模型是 AI 的「大脑成品」,你给它输入,它给你输出。
类比:如果说算法是菜谱,那模型就是你照着菜谱练了 100 遍之后练出来的「手感」。菜谱谁都能看,但手感是你练出来的、长在你手上的东西。你把这个手感「打包」给别人,别人不用重新练 100 遍就能直接炒菜——这就是「训练好的模型」。
自媒体场景:你用的 ChatGPT、豆包、Kimi,它们各自是一个「模型」。你输入「帮我写个标题」,模型输出一段标题——模型就是那个「会写东西的脑子」。
区分:
一句话:专门处理「语言文字」的超大模型。能读、能写、能聊天、能总结、能翻译——一切跟文字有关的任务它都能做。
类比:一个「把全世界互联网上的文字都读过一遍的语言天才」。你问它任何跟文字有关的问题,它都能基于读过的内容给你一个回答。
自媒体场景:写文案、改稿子、起标题、写脚本、想选题——这些都是文字任务,都是 LLM 的主战场。
常见 LLM(截至 2026 年 8 月):
区分:LLM 是模型的一种。模型还有「图像模型」(生成图片)、「语音模型」(生成语音)等。LLM 专管文字。
一句话:让模型从海量数据中「学习规律」的过程。训练完成后的模型才具备能力。
类比:学生做 10 万道题的过程就叫训练。做完之后,脑子里形成了「做题的方法」——那就是模型。
自媒体场景:你不需要自己训练模型(那是 AI 公司的事)。但你需要知道「训练」这个词的含义,因为很多教程里会说「这个模型是用 2024 年的数据训练的,所以它不知道 2025 年的事」——意思是模型的知识停留在训练数据的时间点。
一句话:训练好的模型「回答你的问题」的过程。你输入一段文字,模型输出一段回答——这个动作就叫推理。
类比:学生考完试上了考场,看到一道题开始作答——这个作答过程就是推理。
自媒体场景:你在对话框里打字、点发送、等 AI 回复——你等的那几秒钟,模型正在「推理」。
区分:
一句话:模型内部「调节旋钮」的数量。参数越多,模型越大、能力通常越强,但也更贵、更慢。
类比:参数就像音响上的旋钮。一个音响有 10 个旋钮,另一个有 1000 个旋钮——后者能调出更细腻的音效,但也更难调、更贵。模型同理:7B(70 亿参数)的模型比 1B 的强,但跑起来更吃硬件。
自媒体场景:你不需要记参数的具体数字。但看到「70B 模型」「千亿参数」这类说法时,你知道这是在说模型的大小和等级就行。
常见量级:1B = 10 亿参数,7B = 70 亿,70B = 700 亿,1T = 1 万亿。截至 2026 年,主流商用 LLM 的参数量在百亿到万亿级别。
一句话:你给 AI 的「指令 / 要求」。你打的那段字就是 Prompt。
类比:你去理发店跟理发师说的话。「剪短一点,刘海不要挡眼睛,后面推上去」——这就是 Prompt。说得越清楚,理发师越能剪出你想要的;说得太模糊(「随便剪剪」),结果可能让你崩溃。
自媒体场景:你想让 AI 写一篇小红书种草文案,你输入的这段话就是 Prompt:
「帮我写一篇小红书种草笔记,产品是xx精华液,卖点是美白+保湿,语气要像真实用户分享,300 字左右,结尾加 3 个热门标签。」
关键认知:Prompt 的质量直接决定 AI 输出的质量。写好 Prompt 是 AI 创作的第一核心技能,后续 L2-A1 教程会专门教。
一句话:AI 处理文字的「最小单位」。一段话会被切成很多个 Token,模型按 Token 来计算长度和费用。
类比:Token 就像「自助餐的计价单位」。自助餐不按你吃了什么菜收费,按「盘数」收费——一盘不管装什么都是 10 块。AI 也类似:它不按「字数」算,按 Token 算。一个 Token 大约等于 0.75 个英文单词,或者 0.5–1.5 个汉字(中文一个字可能被切成 1–2 个 Token)。
自媒体场景:
实用换算(粗略估算,中文):
区分:Token 不是「字」也不是「词」,是模型自己定义的切分单位。不同模型的 Token 切分方式不同,所以同样的文字在不同模型里 Token 数可能不一样。
一句话:模型一次对话能「记住和看到」的最大文字量。超出这个量,早期内容会被「忘记」。
类比:上下文窗口就像「金鱼的记忆容量」。如果你的金鱼记忆容量是 10 句话,你跟它说到第 11 句时,它已经忘了第 1 句。模型也一样:如果上下文窗口是 128K Token,对话总长超过这个量后,最早的消息就被挤出记忆了。
自媒体场景:
实用建议:如果你经常需要处理长文档(论文、采访稿、长文),优先选上下文窗口大的模型(如 Kimi、Claude 等)。
一句话:你从打开一个新对话到关掉它(或点「新建对话」)之间的整个交互过程。
类比:就像打电话——从拨通到挂断就是一通电话(一个会话)。挂断后再打新的,对方就不记得上一通电话聊了什么了。
自媒体场景:你在 ChatGPT / 豆包里点「新建对话」后开始聊天。在同一个对话里,AI 记得前面说过什么;一旦你新建对话,AI 就「失忆」了,从头开始。
实用建议:不同任务用不同对话。「写文案」用一个对话,「想选题」用另一个。别在一个对话里又写文案又想选题又做翻译,上下文混在一起会让 AI 输出质量下降。
一句话:控制 AI 输出「随机性 / 创造性」的一个数值。温度越高越天马行空,越低越稳定规矩。
类比:温度就像「厨师的发挥程度」。温度低 = 厨师严格按菜谱做,每次做出来的味道一模一样;温度高 = 厨师开始即兴发挥,每次都不一样,可能给你惊喜,也可能翻车。
自媒体场景:
注意:不是所有工具都暴露温度设置。多数消费级工具(豆包、Kimi 等)把温度藏在「高级设置」里或不暴露,默认值已经调好。API 用户可以自行设置。
一句话:AI 一本正经地胡说八道。它生成的内容看起来很专业、很流畅,但事实是错的、编造的。
类比:就像一个「考试不会但特别会编答案的学生」。他写出来的答案格式工整、逻辑通顺、用词专业,但内容是完全编的。你如果不懂行,很容易被他唬住。
自媒体场景:
避坑要点:
一句话:模型能同时处理多种类型的信息——文字 + 图片 + 语音 + 视频,而不只是单一的文字。
类比:以前 AI 是「单科天才」——只会语文(文字),不会看图、不会听声音。多模态 AI 是「全科选手」——能读文字、能看图片、能听语音、能看视频,而且能把不同类型的信息结合起来理解。
自媒体场景:
2026 年现状:主流大模型(GPT-4o、Gemini、Claude、豆包等)已普遍支持多模态输入(文字 + 图片 + 语音),部分支持视频理解和图片/视频生成。
一句话:能「创造新内容」的 AI——写新文章、画新画、生成新语音、做新视频。与之相对的是「判别式 AI」(只能分类、判断,不能创造)。
类比:
自媒体场景:你用 AI 写文案、配图、配音——用到的全是生成式 AI。这是当前 AI 创作生态的核心。
一句话:
类比:
自媒体场景:
2026 年现状:开源模型能力已非常接近主流闭源模型,差距在持续缩小。对个人创作者来说,日常使用闭源工具最省事;对有技术能力、追求定制化和数据隐私的团队,开源模型是更好的选择。
一句话:在已有模型的基础上,用你自己的数据再「补课」一轮,让它在特定领域 / 特定风格上更强。
类比:一个医学毕业生已经学完所有基础课(预训练),你让他去骨科实习 3 个月(微调),回来他就成了骨科专长医生。基础能力没变,但在骨科这个方向上明显更专业。
自媒体场景:
什么时候用微调:
什么时候不需要微调:
一句话:在 AI 回答问题前,先去你的资料库里「查一下资料」,把查到的相关内容喂给 AI,让它基于这些资料来回答——从而减少幻觉、增加准确性。
类比:开卷考试。闭卷考试时学生只能靠记忆答题(容易记错 = 幻觉);开卷考试时学生可以先翻书找到相关段落,再抄着答——准确多了。RAG 就是给 AI 来一场「开卷考试」。
自媒体场景:
RAG vs 微调(关键区分):
| 维度 | RAG | 微调 |
|---|---|---|
| 原理 | 给 AI 塞参考资料(开卷考试) | 给 AI 补课(重新学一轮) |
| 数据量 | 可以很少(几篇文档也行) | 需要较多(几百条起步) |
| 时效性 | 换资料就更新,实时 | 改了数据要重新训练 |
| 适合场景 | 事实型问答、知识查询 | 风格学习、领域专精 |
| 技术门槛 | 中等(需搭检索系统) | 较高(需 GPU + 训练知识) |
一句话记忆:RAG 是「给 AI 一本书翻着答」,微调是「让 AI 上个培训班学完再答」。
一句话:把文字、图片等变成一串数字(向量),然后按「语义相似度」来找最相关的内容——这是 RAG 的底层技术。
类比:普通搜索 = 按「关键词」匹配(搜「苹果」只能找到含「苹果」二字的内容);向量搜索 = 按「意思」匹配(搜「苹果」能找到写着「iPhone」的内容,因为它们意思相近)。
自媒体场景:你做了个 AI 知识库,用户问「怎么退货」,向量检索能找到标题叫「退换货政策」的文档——即使文档里没有「怎么退货」这四个字。
一句话:把文字(或图片、语音)变成一串数字的过程。这串数字代表了内容的「语义指纹」,相似内容的指纹也相似。
类比:就像给每段文字发一个「DNA 编码」。内容相似的文字,DNA 编码也接近;内容无关的文字,DNA 编码差很远。AI 通过比较 DNA 编码,就能判断两段文字「意思上像不像」。
自媒体场景:你一般不会直接接触 Embedding,但如果你用 Dify、Coze 等平台搭建 AI 知识库时,会看到「向量化」「Embedding 模型」等选项——就是在干这个事。
一句话:能「自己思考、自己调用工具、自己分步骤完成任务」的 AI。不是你问一句它答一句,而是你给一个目标,它自己拆解步骤、调用工具、逐步完成。
类比:
自媒体场景:
2026 年现状:Agent 是 2025–2026 年 AI 领域最热的方向之一。主流工具(如 ChatGPT、Claude、Coze、Dify 等)都已支持 Agent / 工作流模式。但对纯小白来说,建议先掌握好基础的 Prompt 技能,再过渡到 Agent。
一句话:让 AI 能「使用外部工具」——比如联网搜索、查数据库、调 API、发邮件、操作软件。AI 本身不会做这些事,但它能「调用」能做这些事的工具。
类比:AI 就像一个「会指挥的老板」。它自己不会开车、不会做饭、不会打电话,但它知道该让谁去做、什么时候做、怎么把结果整合起来。
自媒体场景:
区分:工具调用是 Agent 的核心能力之一。Agent 之所以能「自己完成任务」,就是因为它会调用一系列工具。
一句话:把多个 AI 步骤按固定顺序串起来,每一步的输出是下一步的输入,形成一条「流水线」。
类比:工厂流水线。原料进来 → 第一道工序加工 → 第二道工序 → …… → 成品出厂。工作流就是把 AI 任务拆成流水线。
自媒体场景:
Agent vs 工作流(关键区分):
一句话:一种「让 AI 连接外部工具和数据源的通用接口标准」。可以理解为 AI 世界的「USB 接口」——不管什么工具,只要支持 MCP 就能即插即用地连到 AI 上。
类比:USB 出现之前,每种外设都有不同的接口,电脑上要装各种驱动。USB 出现后,鼠标、键盘、U 盘、打印机全用一种接口。MCP 之于 AI 工具生态,就像 USB 之于电脑外设。
自媒体场景:你用支持 MCP 的 AI 工具时,可以一键连接你的飞书文档、Notion、Google Drive、数据库等——不用每个工具单独写对接代码。2025–2026 年 MCP 已成为主流 Agent 生态的连接标准。
一句话:多个 Agent 分工合作,各管一摊,一起完成一个大任务。像一个团队里有产品经理、设计师、文案、编辑,每人负责自己的部分,协作产出最终成品。
类比:一个自媒体团队——一个人负责选题、一个人负责写稿、一个人负责配图、一个人负责审稿。多 Agent 就是让多个 AI 各扮演一个角色,协作完成任务。
自媒体场景:
一句话:模型「从零开始读海量数据」的第一轮大规模学习。预训练出来的模型叫「基座模型」,具备通用的语言理解和生成能力。
类比:读完小学到大学的基础教育。这阶段学的是「通识」——什么都知道一点,但哪个方向都不够专。之后再去实习 / 考证(微调)才会变专业。
一句话:让人类给 AI 的回答打分 / 排序,AI 根据人类偏好来调整自己的回答方式——让输出更符合人类口味。
类比:实习生写了报告,主管圈圈画画告诉他「这里太啰嗦、这里要分点、这里语气不对」。实习生调整后越写越对味——这就是 RLHF。
自媒体场景:你不需要自己做 RLHF。但你需要知道,AI 工具之所以能输出「听起来像人写的、有礼貌、有结构」的内容,RLHF 功不可没。没有 RLHF 的模型说话会像「原始机器」——干巴巴、不分场合。
一句话:在当前对话中,AI 能看到的「所有信息」——包括你说的、它说的、你之前发的、系统预设的,全部加起来就是上下文。
类比:上下文就是「此时此刻这场对话中所有人都能看到和回忆起来的内容」。如果你在群里聊天,上下文就是从你进群到现在所有人发的消息。一旦你退群重进,之前的消息就看不到了——就像新建对话后 AI 失忆。
实用建议:在 Prompt 里提供充足的上下文(背景信息、目标受众、风格要求、参考示例),是提升 AI 输出质量最有效的方法之一。
一句话:在对话开始前给 AI 的「角色设定和行为规则」。用户看不到它,但它影响 AI 全程的表现。
类比:演员上台前导演给的「角色说明」——「你演一个 30 岁的上海宝妈,说话要亲切、用一些上海话俚语、总是先夸再建议」。演员上台后的所有表演都受这个设定影响。
自媒体场景:很多 AI 工具允许你设置「系统提示词」。你可以设:「你是一个资深小红书运营博主,擅长写种草文案,语气亲切自然,总是先给结论再展开」——之后所有对话都会受这个设定影响。
一句话:给 AI 工具额外加装「功能模块」。装了插件,AI 就多了个能力——就像手机装 App 一样。
类比:手机出厂只有基础功能,装了微信能聊天,装了美图秀秀能修图。AI 工具也类似——装了「联网搜索插件」能搜实时信息,装了「PDF 阅读插件」能读 PDF。
一句话:让程序和程序之间「对话」的通道。通过 API,你的程序可以调用 AI 模型的能力,而不需要打开网页手动输入。
类比:餐厅的「点菜窗口」。你(顾客 / 程序)在窗口告诉厨师(AI 模型)要什么,厨师做好从窗口递给你。你不用进后厨、不用知道菜怎么做的,只需要知道怎么点单。
自媒体场景:
一句话:把模型的「精度压缩」——用更少的数据来存储和计算模型,让模型变小、变快,代价是精度略微下降。
类比:把一张 4K 高清照片压缩成 1080P。文件小了、加载快了,肉眼看起来差不多,但放大细看会损失一些细节。量化让大模型能在普通电脑甚至手机上运行。
自媒体场景:你一般不直接接触量化。但如果你听说「某模型推出了 4bit 量化版,可以在普通笔记本上跑」——这就是量化在起作用,让开源模型的使用门槛大幅降低。
一句话:AI 从收到你的输入到给出回答所花的时间。延迟越低,体验越流畅。
类比:点外卖后等餐的时间。等 30 秒你觉得很快,等 5 分钟你觉得慢,等 30 分钟你开始不耐烦。
自媒体场景:
| 中文术语 | 英文 / 缩写 | 一句话人话 | 一句话类比 |
|---|---|---|---|
| 人工智能 | AI | 让机器做需要人类智慧的事 | 读过整个图书馆的超级实习生 |
| 算法 | Algorithm | 按步骤做事的说明书 | 菜谱 |
| 模型 | Model | 学好的本事,AI 的大脑成品 | 练了 100 遍菜谱后的手感 |
| 大语言模型 | LLM | 专管文字的超大模型 | 读遍全网文字的语言天才 |
| 训练 | Training | 模型学习的过程 | 学生做 10 万道题 |
| 推理 | Inference | 模型回答问题的过程 | 学生考试答题 |
| 参数 | Parameters | 模型内部旋钮的数量 | 音响上的旋钮个数 |
| 提示词 | Prompt | 你给 AI 的指令 | 跟理发师说想要的发型 |
| 词元 | Token | AI 计价和计长的最小单位 | 自助餐的盘子数 |
| 上下文窗口 | Context Window | 一次对话能记住的最大文字量 | 金鱼的记忆容量 |
| 温度 | Temperature | 控制输出随机性的数值 | 厨师的发挥程度 |
| 幻觉 | Hallucination | AI 一本正经胡说八道 | 会编答案的学生 |
| 多模态 | Multimodal | 能同时处理文字/图片/语音/视频 | 全科选手 |
| 生成式 AI | GenAI | 能创造新内容的 AI | 画家(vs 鉴定师) |
| 微调 | Fine-tuning | 用自己的数据给模型补课 | 医学生去骨科实习 |
| 检索增强生成 | RAG | 先查资料再回答 | 开卷考试 |
| 向量检索 | Vector Search | 按「意思」搜索内容 | 按语义而非关键词搜 |
| 嵌入 | Embedding | 把文字变成数字指纹 | 给文字发 DNA 编码 |
| 智能体 | Agent | 能自己拆步骤、调工具完成任务的 AI | 会自己干活的实习生 |
| 工具调用 | Tool Use / Function Calling | AI 调用外部工具 | 老板指挥别人干活 |
| 工作流 | Workflow | 固定顺序的 AI 步骤流水线 | 工厂流水线 |
| MCP | Model Context Protocol | AI 连接工具的通用接口 | AI 世界的 USB 接口 |
| 多智能体 | Multi-Agent | 多个 Agent 分工协作 | 自媒体团队协作 |
| 预训练 | Pre-training | 从零开始的大规模学习 | 读大学基础教育 |
| 人类反馈强化学习 | RLHF | 用人类偏好调教 AI | 主管批改实习生报告 |
| 上下文 | Context | 对话中所有可见信息 | 群聊里所有人发的消息 |
| 系统提示词 | System Prompt | 对话前的角色设定 | 导演给演员的角色说明 |
| 插件 | Plugin | 给 AI 加装功能模块 | 手机装 App |
| API | Application Programming Interface | 程序间对话的通道 | 餐厅点菜窗口 |
| 量化 | Quantization | 压缩模型精度让变小变快 | 4K 照片压成 1080P |
| 延迟 | Latency | AI 响应时间 | 点外卖后的等餐时间 |
学完了理论,下面带你走一遍「打开 AI 工具时你会在哪些地方遇到这些术语」,让知识落地。
你是一个小红书博主,帮我写一篇关于「夏日防晒霜」的种草笔记,300 字,语气亲切自然。
术语遇见清单:Prompt、推理、会话、上下文窗口、Token
术语遇见清单:多模态、Prompt、推理
术语遇见清单:模型、温度、参数
帮我搜索一下今天的微博热搜前 5 条,用一句话概括每条在说什么。
术语遇见清单:工具调用、Agent(如果工具自动多步执行)
请介绍一下 2026 年诺贝尔文学奖得主的作品风格。
术语遇见清单:幻觉、训练(知识截止日期)
场景:你是一个母婴博主,有一份品牌方发来的产品手册(PDF / 文字),想让 AI 基于这份手册写一篇种草文案,而且不能编造产品功效。
小白版 RAG 操作(不需要搭建系统,用对话工具模拟):
以下是一份产品手册。请仔细阅读,后续我会基于这份手册让你写文案,你只能使用手册中提到的信息,不能编造任何未提及的功效或成分。
【产品手册内容】: (粘贴全文)
基于上面的手册,帮我写一篇小红书种草笔记,要求:
- 只使用手册中提到的功效和成分
- 语气像真实妈妈用户的分享
- 300 字左右
- 结尾加 3 个标签
- 如果手册里没有的信息,请直接说「手册未提及」,不要编
术语实战:Prompt(你写的两段指令)、上下文(手册内容进入上下文窗口)、RAG(检索增强生成的思路)、幻觉(对比有无资料的差异)
场景:你想让 AI 帮你产出一周的短视频选题,要求每个选题自带标题、钩子、大纲。
操作:
我做一个面向职场新人的短视频账号,主题是「职场沟通技巧」。请帮我生成 7 个本周可拍的选题方向,每个选题用一句话描述。
请把上面 7 个选题每个都展开成以下格式: 【标题】一个有吸引力的短视频标题 【钩子】前 3 秒能抓住人的开头 【大纲】3–5 个要点的分点大纲 【时长建议】建议视频时长
请检查以上 7 个选题,去掉任何过于宽泛或重复的,替换成新的。然后按「我认为最可能火的顺序」排列。
解读:你刚才其实手动走了一个 工作流——三个步骤按固定顺序串联,每步的输出是下步的输入。如果把这个流程在 Coze / Dify 里固化下来,让它自动跑——那就是一个真正的 AI 工作流。如果更进一步,让 AI 自己决定每一步该做什么——那就是 Agent。如果中间还调用了「搜索微博热搜」来辅助选题——那就是 工具调用。
术语实战:Prompt、工作流、Agent、工具调用、上下文(前一步输出进入后一步上下文)
场景:你想让 AI 模仿你的写作风格写文案。
方法 A(纯 Prompt,零门槛):
方法 B(微调,高门槛):
对比:
结论:对 99% 的自媒体创作者,先用好方法 A(Prompt),等你确实有大量优质数据 + 技术能力 + 明确的定制需求时,再考虑方法 B(微调)。
术语实战:Prompt、微调、预训练、模型、训练数据
下面给你一张「随时可翻」的速查表。建议截图保存或打印贴在电脑旁。
| 我的需求 | 对应术语 | 对应能力 | 难度 |
|---|---|---|---|
| 让 AI 帮我写东西 | Prompt | 提示词工程 | ★☆☆ |
| 让 AI 记住长文档 | 上下文窗口 | 长上下文模型 | ★☆☆ |
| 让 AI 看图 / 听音 | 多模态 | 多模态模型 | ★☆☆ |
| 让 AI 基于我的资料回答 | RAG | 检索增强生成 | ★★☆ |
| 让 AI 自动联网查信息 | 工具调用 | Tool Use | ★★☆ |
| 让 AI 自己完成多步任务 | Agent | 智能体 | ★★★ |
| 把多步 AI 任务串成流水线 | 工作流 | Workflow | ★★★ |
| 让 AI 模仿我的写作风格 | 微调 / Prompt | Fine-tuning / 少样本 | ★★★★ |
| 让 AI 连接我的飞书 / Notion | MCP | 模型上下文协议 | ★★★ |
| 在自己电脑上跑 AI | 开源模型 + 量化 | 部署开源模型 | ★★★★ |
| 容易混淆的一对 | 区别一句话 |
|---|---|
| 算法 vs 模型 | 算法是方法(菜谱),模型是学好后的成品(手感) |
| 训练 vs 推理 | 训练是学习(做题),推理是应用(考试) |
| 上下文 vs 上下文窗口 | 上下文是当前对话所有信息,上下文窗口是能装下的最大量 |
| RAG vs 微调 | RAG 是开卷考试(临时翻书),微调是培训班(学完再考) |
| Agent vs 工作流 | Agent 自己决定怎么走(出租车),工作流按预设轨道走(火车) |
| 多模态 vs 生成式 AI | 多模态指能处理多种信息类型,生成式指能创造新内容(两者正交) |
| 开源 vs 闭源 | 开源是公开菜谱,闭源是秘方 |
| 幻觉 vs 错误 | 幻觉是「自信地编造」,错误是「诚实地说错」 |
| Prompt vs 系统提示词 | Prompt 是用户每次发的指令,系统提示词是对话开始前的角色设定 |
不同模型使用不同的「分词器」,对中文的切分方式不同。有的模型 1 个汉字 = 1 个 Token,有的是 1 个汉字 = 2 个 Token 甚至更多。粗略估算中文时,按「1 个汉字 ≈ 1–1.5 个 Token」来估比较安全。如果需要精确数字,各工具官方一般提供 Token 计数器。
有。模型的「世界知识」来自 训练数据,训练数据有一个截止时间。比如一个 2024 年 6 月训练的模型,它不知道 2024 年 7 月之后发生的事。解决方法:用支持 联网搜索 / 工具调用 的 AI 工具,或用 RAG 把最新资料喂给它。
不是越长越好。好 Prompt 的关键是「清晰、具体、有约束」,不是堆字数。一段 3 行的精准 Prompt 通常比一段 30 行的啰嗦 Prompt 效果更好。核心要素:角色设定 + 任务目标 + 具体要求 + 输出格式 + 参考示例(可选)。
没有绝对标准。粗略分法(2026 年口径):
但参数量不是唯一标准——训练数据质量、架构创新等都影响模型实际能力。
现阶段不需要。这三者都有一定门槛。建议路径:
这是复杂的法律问题,不同国家和地区规定不同。截至 2026 年,主流观点是:
不能完全消除,但可以大幅减少。方法:
简单理解:API 是「公路」,插件是「某品牌专用车道」,MCP 是「通用高速公路标准」。
坑:以为 ChatGPT = GPT 模型,豆包 = 豆包模型。
纠正:一个「工具 / 产品」背后可能用了多个模型。比如 ChatGPT 这个产品可以选择 GPT-4o、GPT-4o-mini 等不同模型。豆包 App 里也有不同模型在支撑不同功能。模型是大脑,工具是壳子——同一个模型可以装在不同壳子里。
坑:觉得「最新最大的模型一定最好」,每次都选最强模型。
纠正:选模型要看场景。写个 200 字的朋友圈文案,用小模型就够了,速度快还省钱。做复杂推理 / 长文档分析时才需要大模型。杀鸡不用牛刀——成本和速度也是重要的考量因素。
坑:Prompt 写得像许愿——「帮我写一个爆款文案,要超级吸引人,要让人忍不住转发」。
纠正:AI 不懂「爆款」「超级吸引人」具体是什么意思。你需要给 具体可执行的约束——「用疑问句开头」「包含数字」「提到 3 个具体使用场景」「口语化,像跟闺蜜聊天」「总字数 250–300 字」。Prompt 越具体,输出越可控。
坑:听说 RAG 和微调很厉害,一上来就想搞。
纠正:90% 的自媒体创作需求,用好的 Prompt 就能解决。RAG 和微调是用来解决「Prompt 解决不了的特定问题」的——前者解决「事实准确性 / 私有知识」,后者解决「风格深度定制」。先吃透 Prompt,再考虑这些进阶手段。
坑:AI 写了一篇科普文章,里面有 3 个「研究发现」和 2 个「数据」,你没核实就直接发了。
纠正:AI 会非常自信地编造看起来很真的数据和引用。任何涉及事实、数据、引用、人名、书名、法规的内容,必须人工核实后再发布。这是 AI 创作的铁律。
恭喜你读完了整本「AI 术语通关手册」。回顾一下你现在的知识储备:
最重要的是:术语只是门面,真正的能力在实践。你现在有了「看懂」的基础,接下来要做的是「动手用」。
提示:本教程会随 AI 领域发展持续更新。术语的生命力在于使用——下次你在 AI 工具里看到这些词时,停下来想一秒它的意思,用不了几次,这些词就会变成你自己的词汇。
本教程内容截至 2026 年 8 月。AI 领域发展迅速,部分术语的内涵可能随技术演进而变化,我们会定期更新。如有疑问或建议,欢迎在评论区交流。