AI 学习之路之「AI 世界入门词典:小白必备概念清单」
大模型、Token、RAG、Agent、MCP……一篇把 AI 世界最常见的概念用大白话讲清楚,小白入门必读。
你有没有这种体验:
打开一篇 AI 教程,第一段就看到「大模型」「Token」「RAG」「Agent」「MCP」……每个字都认识,连在一起完全不知道在说什么。
然后你关掉网页,告诉自己「AI 这东西太复杂了,不适合我。」
其实不是你的问题。是没人好好跟你解释过这些词。
这篇文章就做一件事:把 AI 世界里最常见的概念,用你能听懂的话说清楚。不需要记住所有的,先看一遍,有个印象。等后面遇到具体工具的时候,再回来查。
1 底层技术概念
这部分是 AI 的「发动机」。你不需要会造发动机,但大概知道它怎么转,用起来会顺很多。
大模型(LLM)
全称 Large Language Model,直译「大型语言模型」。
类比:超级学霸。 想象一个学生,把互联网上几乎所有的书、文章、代码、对话全读了一遍——几万亿字。他不只是「记住」了这些内容,还学会了语言背后的逻辑:怎么推理、怎么写作、怎么回答问题。
这个「超级学霸」,就是大模型,你也可以认为他是一个「超级大脑」。
它跟搜索引擎有本质区别。搜索是帮你找链接,你自己再从链接去找答案。大模型是直接理解你的问题、生成答案。你问它「帮我写一封请假邮件」,它不会给你一堆链接,而是直接把邮件写出来。
大模型到底哪家强
大家现在能用到的 ChatGPT、Claude、Gemini、豆包、千问……背后跑的,都是各家的大模型,可以说每一家 AI 公司背后都有专属于自己的「超级大脑」。
虽然都是「超级大脑」,但是「超级大脑」也有第一和第二的区别,虽然每家都说自己家的很强,但是目前世界公认的前三是 Google 家的 Gemini,OpenAI 家的 GPT 以及 Anthropic 家的 Opus。
大模型没有绝对的第一,但是却分细分领域,举个类比,都是全世界顶级的医学教授,但是有的在呼吸科,有的专精肿瘤科。都是「超级大脑」,不同的大模型在不同的领域有它独自的优势,所以大家可以看到很多公司都会有一系列的大模型,比如在图片处理,在视频领域等细分场景,必须用到专属的大模型。
Token
这是 AI 领域大模型处理文字的最小单位,也是很多人看不懂账单的原因。
你可以把他类比为互联网时代的「手机流量」。你用手机上网,消耗的是「流量」,单位是 MB、GB。
AI 时代处理文字,消耗的是「Token」。你跟它说的每一句话、它给你的每一句回复,都会被切成一个个 token 来处理。
怎么理解? 可以把 token 想成「字砖」。
大模型不是一个字一个字读的,而是一块一块地读。中文里,大概每 1-2 个汉字是一个 token;英文里,大概每 3-4 个字母是一个 token。
举个例子,「我今天吃了一碗拉面」大概是 8-10 个 token。
基本上对中文来说,大概 1000 个 Token ≈ 1500 到 2000 个汉字。
Token 很重要,有两个原因:
第一,计费。用 API 调用 AI,按 Token 收费。知道换算关系,才不会被账单吓到。
目前为止,大多数 AI 服务,收费就是按 token 算的。基本按照每消耗百万 token 来计价,不同的大模型价格不一样,一般来说国内的便宜些,价格从几块到十几块,国外的会贵些,价格几刀到十几刀。
第二,它决定了记忆上限。每个大模型都有「上下文窗口」,就是它一次能处理的最大 token 数。超出这个范围,它就「忘了」前面说的话。
这也是为什么有时候你跟 AI 聊得太长,它开始「失忆」——不是它变笨了,是装不下了。
上下文窗口(Context Window)
类比:工作台的大小。 你在桌上工作,桌子越大,能同时摆的资料越多,做事越方便。桌子太小,资料放不下,就得不停地换来换去。
AI 的「工作台」就是上下文窗口,单位是 Token。如果一个模型支持「128K 上下文」,意思是它能同时「看到」大约 12 万个 Token 的内容——相当于一本十几万字的书。
这就是为什么有些 AI 能帮你读一整份报告,有些只能处理几段话。工作台大小不一样。
多模态(Multimodal)
为什么很多人在使用一些最基础的大模型时候,只能给他文字聊天,你给他发一张图片,或者视频,他就理解不了了,那是因为有些模型是单纯的文本模型,他只能理解文字。
类比:人的感官。 你既能看文字,也能看图片,还能听声音、看视频。早期的 AI 只能处理文字,就像一个只用眼睛但不看图的人。
多模态就是让 AI 也能「看图」「听声音」甚至「看视频」。现在主流的大模型基本都支持多模态——你可以把一张截图发给它,让它帮你分析内容;或者上传一段录音,让它整理成文字。
训练 vs 推理
这两个词经常出现在 AI 新闻里,很多人搞混。
类比:学习和考试。
训练是 AI 学习的阶段。用海量数据「喂」给模型,让它慢慢学会各种规律和知识。这个过程需要消耗大量算力和时间,是 Google、OpenAI、Anthropic 这些公司做的事。
推理是 AI 用学到的知识回答你的问题。你每次打开 ChatGPT 或 Claude 提问,用的就是推理能力。
对普通用户来说,你只需要关心推理——也就是怎么把问题问好,怎么让 AI 给出更好的答案。训练那部分,交给专门的公司去做就行。
2 使用层概念
这部分是你真正会用到的。搞懂这些,用 AI 能顺很多。
Prompt(提示词)
这个词出现频率最高,但解释得清楚的人不多。
类比:给员工布置任务。 你跟一个新员工说「帮我弄一下报告」,他不知道你要什么风格、什么内容、多少字、给谁看——结果大概率不符合预期。
但如果你说「帮我写一份面向高管的季度总结,300 字以内,重点突出销售增长和市场份额,语气正式」,员工就能做出你想要的东西。
Prompt 就是你给 AI 的这套说明。说得越清楚,AI 的输出越准确。这也是为什么同样一个问题,有的人问出来的答案比你好——他们的 Prompt 写得更好。
简单来说,你喂给 AI 的 Prompt 越细致,越明确,AI 才能给你想要的答案,Prompt 最本质的目的就是让 AI 理解你的核心诉求。
后面会有专门一篇文章教 Prompt 怎么写。
RAG(检索增强生成)
全称 Retrieval-Augmented Generation,名字唬人,原理不复杂。
先说一个普通大模型的问题:它的知识是有截止日期的。训练完就定住了,之后发生的事它不知道。更麻烦的是,它有时候不知道自己不知道——你问它一个它没学过的问题,它可能一本正经地「编」一个答案出来。这就是常说的「AI 幻觉」。
RAG 就是为了解决这个问题而生的。
类比:给 AI 配一个专属资料员。 你问 AI 一个问题,它不是直接从脑子里调答案,而是先把问题交给「资料员」,资料员去翻你指定的文件堆,找到最相关的内容,再递给 AI——AI 基于这些资料来回答你,有据可查,不胡编。
举几个你真实会遇到 RAG 的场景:
场景一:你上传一份合同让 AI 分析。 这份合同 AI 之前从没见过,但它能逐字检索合同内容,回答你「第 8 条违约条款具体说了什么」——这就是 RAG 在工作。
场景二:公司内部客服机器人。 很多企业把产品手册、FAQ、内部规范全丢进一个知识库,让 AI 基于这些资料回答员工或客户的问题。AI 不会乱答,因为它只从这堆资料里找答案。
场景三:NotebookLM。 你把几篇论文或报告上传进去,然后问「这几篇文章的核心观点有什么矛盾」——它能跨文档检索比对,给你一个有依据的总结。这个工具后面会专门介绍。
简单说:普通大模型靠「记忆」答题,RAG 靠「查资料」答题。查资料的比只靠记忆的,准确多了。
这就是为什么当下很多人都要整理一个专属于自己的资料库,本质就是依赖 RAG。
Agent(智能体)
这是近一两年最火的词,也是 AI 未来的方向。
你用过豆包吗?打开豆包,你可以跟它聊天、问问题、让它帮你写东西。这是大多数人对 AI 的印象——一个对话框,你问它答。
但这只是 AI 最初级的形态。
类比:有手有脚的大脑。 普通大模型是一个「只会说话的大脑」——你问豆包「帮我查一下今天有没有适合我的招聘信息」,它最多告诉你去哪里找,但它自己打不开招聘网站、刷不了职位列表、也没法替你投简历。
再比如你让豆包帮你查一份报告,然后想要把这份报告以 pdf 的形式,排好版,保存在你的电脑桌面。这个豆包做不到,因为他没法直接操作你的电脑,他只是一个超级大脑,只能告诉你答案,但没法给你干活,但是智能体就可以。
Agent 不一样。它是「大脑 + 手脚」——能自己联网、自己点击网页、自己打开文件、自己写代码并运行、甚至自己帮你发邮件。你只需要说「帮我找北京地区 3 年经验的产品经理岗位,筛选出月薪 3 万以上的,整理成表格发我」,Agent 会真的去做完这整件事。
你不用一步步告诉它怎么做,它自己规划步骤、自己执行、自己把结果交给你。
现在大家常说的龙虾,本质是来自于 GitHub 一个开源的智能体框架 OpenClaw,国内的各种龙虾都是基于他的变种。
而当下全球公认最强的 AI 智能体就是 Claude Code,他什么都好,就是贵以及老封号,不给中国地区使用,但是如果你想要深度学习并且用 AI 帮你做事,无论如何要想办法使用 Claude Code。
Skill / Tool(工具调用)
Agent 能干活,靠的是各种「技能」和「工具」。
类比:工具箱里的不同工具。 锤子负责敲钉子,扳手负责拧螺丝,电钻负责打孔。每个工具干一件专门的事。
AI 的 Tool 也是一样。搜索工具负责联网搜索,代码执行工具负责跑程序,文件读取工具负责读你的文档。Agent 根据任务需要,自动选择调用哪个工具。
举个例子,如果你想要让 AI 帮你把电脑上的文件改个名,就需要用到一个「文件操作」的工具。
大家只需要理解这个概念,当下大部分工具都有现成的,想用什么自己去找就行,不需要自己额外创造工具。
你不需要知道这些工具怎么实现,但知道「AI 能调用工具」这件事,就能理解为什么有些 AI 能直接帮你干很多事,而有些只能聊天。
MCP(模型上下文协议)
全称 Model Context Protocol,2024 年底由 Anthropic 提出,现在已经成为行业标准。
类比:USB 接口。 以前每个设备都有自己专属的充电口,手机一个、相机一个、平板一个,充电器带一堆。USB-C 出来之后,一根线通用所有设备。
MCP 做的是同样的事——它定义了一套标准协议,让 AI 和各种外部工具、数据源「即插即用」。开发者只需要按 MCP 标准写一个接口,任何支持 MCP 的 AI 都能调用这个工具。
举个简单的例子就知道了,AI 可以操作你电脑的文件,因为电脑是一个系统级别,但是你想让你的 AI 工具,打开微信,打开浏览器,打开编辑器,那默认是做不到的,就好比,你让微信帮你打开美团,那肯定不行,因为这相当于每个 app 之间的操作,但是你让 siri 帮你打开美团就可以做到。
所以如果你想让你的 AI 智能体连接各种电脑上的 app,就需要借助 MCP。
对普通用户来说,MCP 意味着:未来你的 AI 助手能连接越来越多的服务——日历、邮件、代码编辑器、知识库——而且接入成本越来越低。
3 小白必备工具清单
上面介绍了 AI 领域的基础概念,这是你进入 AI 领域系统学习的第一步,那么在进入下一章节之前,我想让大家提前准备一些工具,这里列了个清单。
魔法上网
这个称呼大家懂就好,目前虽然国内的一些大模型也可以用,但是如果你想体验全球最顶尖 AI 模型/工具,魔法上网是必备的,这里没法给大家推荐,自行去搜索或者问身边的朋友,就一点,一定要用付费的,免费不稳定太耽误事。
markdown
markdown 你可以理解为是一种轻量的文档编辑格式,他可以让你用简单的符号就能排版出漂亮的文档。目标是让你专注写作,不用纠结格式。
AI 领域的文件格式几乎都是依赖于 markdown,所以这里大家自行去搜索了解下 markdown 的基本语法,这里就不单独介绍了,因为很简单,你五分钟就可以上手,比如我这篇教程就是用的 markdown 写作的。
Obsidian
Obsidian 是一款本地运行的 Markdown 笔记软件,所有数据存在你自己的电脑上,不上传云端,隐私有保障。
跟普通笔记软件不一样,它支持笔记之间相互关联,形成一张「知识网络」。后面我们会专门介绍怎么用 Claude 配合 Obsidian 搭建你的 AI 第二大脑——这是目前个人知识管理里最值得折腾的一套组合。
官网直接下载,免费,全平台可用。
Gemini
Google 家的 AI,可以理解为 Google 版的 ChatGPT。
它的优势在两块:一是跟 Google 全家桶打通,Gmail、Google Docs、Google Drive 都能直接接入;二是支持超长上下文,处理大文档表现很稳。
需要魔法上网,有 Google 账号就能用。如果你已经重度依赖 Google 生态,Gemini 值得体验一下。
之所以介绍 Gemini,是想让大家以后遇到问题不要再问豆包了,从现在开始,习惯使用 Gemini 提问,他更专业更强大。
NotebookLM
Google 出品的文档分析工具,功能听起来简单,但用起来很惊艳。
你把几篇 PDF、报告、文章丢进去,它就能帮你跨文档回答问题、整理矛盾观点、生成学习指南。最绝的一个功能是「Audio Overview」——它能把你上传的所有资料,自动生成一期播客,两个 AI 主播有来有回地帮你把核心内容讲一遍。
后面会有专门一篇文章介绍它的玩法。需要科学上网,在这之前,希望大家先了解自己体验下。
Workbuddy
腾讯云出品的 AI 办公助理,定位是「职场版智能体」。
不只是聊天,它能帮你生成文档、做数据分析报告、甚至调度多个 AI 子任务协同完成一件事。国内直接可用,对不想折腾科学上网的用户来说,是一个值得尝试的 Agent 入口。
之所以介绍这个工具,是因为对于如果没体验过任何强大 AI 智能体的人来说,这就是一个最简单最方便,成本最低的体验一个完整 AI 智能体的最好方式,注册就送一些额度,配合每天签到几乎够你用的了。
如果你现在已经在用 Claude,也别看不起 Workbuddy,Workbuddy 是腾讯旗下,意味着他收录了腾讯生态的强大数据,比如他收录了公众号各种优质创作者的数据,如果你用它来做公众号写作,那么选择上面的「内容创作专家」,他可以帮你写一篇很高质量的文章。
没有任何 AI 使用经验和技术背景的同学,我强烈建议你从这个工具开始体验你的 AI 之路,后续更高级别的 Cli 模式,在配置安装环境这块,直接扔给他搞定,可以节省你很大效率。
你甚至可以尝试着用 Workbuddy 帮你处理文档,内容写作,ppt 制作,报表处理等大部分的职场日常工作,他虽然没有 Claude 那么强大,但是他几乎免费,而且对于职场人士遇到的问题基本都可以搞定。
体验过之后,咱们循序渐进。
4 小结
这篇文章涉及的词不少,但不需要现在就全记住。
先留个印象:大模型是超级学霸,Token 是 AI 的流量,上下文窗口是工作台大小,多模态是让 AI 有感官,Prompt 是给 AI 的任务说明,RAG 是开卷考试,Agent 是有手有脚的 AI,MCP 是 AI 世界的 USB 接口。
后面每篇文章都会用到这些概念,到时候自然就熟了。
下一篇,咱们继续循序渐进,一步步来。
本文由 kuzhang 整理