从 LLM 到 Agent Skill:9 个底层概念,一次理清整个 AI 技术栈
别再被 AI 新词唬住了:9 个概念,看懂整个 AI 圈
AI 圈像个永远在造新词的工厂。前脚 LLM,后脚 token、context、prompt、MCP、Agent、Agent Skill…… 词儿你都眼熟,真要挨个说清确切含义,很多人就卡壳了。
其实没那么玄。所有这些概念,都围着同一个东西转。从最底层往上捋一遍,你会发现它们一层叠一层,逻辑特别顺。这篇就按「底层工程视角」,把每个概念拆开讲清楚。
本文脉络:LLM → Token → Context(含 Context Window)→ RAG → Prompt → Tool → MCP → Agent → Agent Skill。建议顺着读,每个概念都为下一个埋了伏笔。
1. LLM:一切的起点
LLM = Large Language Model(大语言模型)。大家嘴里的「大模型」,基本指它。今天你能见到的主流大模型,底层架构几乎清一色是 Transformer。
它到底怎么工作?本质是个文字接龙游戏。
你问:「Codigger 编程怎么样?」它收到这句话,内部运算一圈,预测出下一个概率最高的词,比如「特别」;它不会停,而是把这个词追加到输入末尾,接着预测「的」,再预测「棒」…… 直到吐出一个特殊的结束符,回答才结束。这也是为什么大模型只能逐词输出、说话总是一顿一顿的。
关键认知:LLM 本质是一个超大的数学函数——给输入,算输出。它不「理解」意思,只「预测」下一个 token。
但模型跑的全是矩阵运算,只认数字、不认文字。这就引出了下一个概念。
2. Token:模型认识的最小单位
上面说「它收到一句话」,其实不准确。模型直接处理的不是文字,而是 token(词元)。
中间需要一层翻译,叫 tokenizer,做两件事:
- 编码:文字 → 数字
- 解码:数字 → 文字
编码又分两步:
- 切分:把句子拆成最小片段 token(一个 token 可能是一个字、一个词、或词根,中英文规则不同);
- 映射:把每个 token 对应成一个数字 id。
于是「Codigger 编程怎么样?」会变成一串 id 送进模型;模型吐出 id,tokenizer 再解码回文字。所以 token 才是模型处理文本的真正基本单元,而不是我们肉眼看到的「字」或「词」。
顺带一提:各家大模型按 token 收费、按 token 限长,原因就在这——它们账本上记的是 token,不是汉字。
3. Context:模型的「临时记忆」
你和某个大模型聊天,它好像记得前文:你开头说「我叫 Codigger」,过会儿问「我叫什么」,它还能答上来。
但别忘了,模型只是个函数,给输入出输出,自己没有记忆。
秘密在调用方式上:你每发一条消息,程序都会把整段对话历史一起发给模型。模型看到的永远是「完整对话」,所以它「知道」之前发生了什么。
这份每次处理任务时接收的信息总和,就是 context(上下文)——包括你的问题、对话历史、正在生成的 token、可用的工具列表、系统提示(system prompt)等等。它相当于模型的临时记忆体。
Context Window(上下文窗口):这个记忆体的容量上限,单位也是 token。一旦超出,要么被截断(忘掉最早的内容),要么就得用下一节的 RAG 等手段来「瘦身」。
4. 当 Context 装不下:RAG
假设你有一千页产品手册,想让模型据此回答用户问题。把整本手册塞进 context?不现实——太长,算力和成本都压不住,还可能直接超出窗口上限。
RAG(Retrieval-Augmented Generation,检索增强生成) 的解法很聪明:
先从手册里捞出与问题最匹配的几段,只把这几段发给模型。模型接到的不是一整本书,而是精选的几句话,既绕开了 context window 限制,成本也低得多。
一句话:RAG 让模型「现查现答」,而不是「把所有知识都装进脑子」。
5. Prompt:怎么把话说清楚
Prompt(提示词),就是你给模型的问题或指令。
只说「创建一个表格」,模型可能给你个 Word 文档——太模糊,它不知道你要什么。换成:「创建一个项目管理表,跟踪项目全生命周期任务,视觉风格优雅简约」,结果立刻不一样。
这就是 Prompt Engineering(提示词工程) 的全部意义:用更精确的表达,把你的真实意图「翻译」成模型能稳稳接住的语言。
6. Tool:让模型看见外面的世界
大模型有知识截止日期,感知不到实时外界。你问「今天北京天气怎么样」,它只能说「我的知识截止到某年某月」。
Tool(工具) 就是破局的钥匙——本质是个函数:输入「城市 + 日期」,输出「天气」。
调用链是四个角色协作:
- 用户提问,发给平台;
- 平台连同「可用工具列表」一起转给模型;
- 模型输出调用指令(工具名 + 参数)——注意,它自己并不执行;
- 平台真的去调用那个函数,把结果返回给模型;
- 模型把结果整理成人话,平台再转回给用户。
模型负责「想用哪个工具、传什么参数」,平台负责「真去执行」。分工明确。
7. MCP:给工具一个统一接口
Tool 好用,但接入规范各平台一套:ChatGPT 按 OpenAI 的写,Claude 按 Anthropic 的写,Gemini 按 Google 的写——同一个工具,要写三遍。
于是有人提出:能不能搞个统一标准?
这就是 MCP(Model Context Protocol,模型上下文协议) 的由来。类比手机的 Type-C 接口——开发者写一次工具,到处都能插上用。它统一了「模型 ↔ 工具」之间的通信规则。
8. Agent:会自己规划的「打工人」
有 Tool、有 MCP,还差最后一步。
「这边天气怎么样?如果下雨,帮我查附近有没有卖伞的店。」——这句话要连续调用多次工具:先调定位工具拿经纬度 → 再查天气 → 发现下雨 → 再找雨伞店 → 汇总答案。
模型需要一步步思考、自己决定下一步做什么。这种「自主规划 + 循环调用工具直到任务完成」的能力,就叫 Agent(智能体)。
常见产品:Claude Code、Codex、Gemini CLI 等;经典构建模式有 ReAct、Plan-and-Execute 等。
一句话区分:Tool / MCP 是「能力」,Agent 是「会调用这些能力去完成目标的系统」。
9. Agent Skill:给 Agent 立的规矩说明书
Agent 不知道你的私人规则。想让它当你的出门小助手,按你的习惯提醒(下雨带伞、强光戴帽、风大穿防风外套、手机必带),还要固定格式输出——它一概不知。你总不能每次提问都复制一大段规则,太反人类。
Agent Skill(智能体技能) 就是提前写好的「说明书」:一个 Markdown 文件,分两层:
- 元数据层:
name+description,告诉 Agent 这个技能叫什么、能干什么; - 指令层:目标、执行步骤、判断规则、输出格式、示例。
写好一次,Agent 就能在需要时自动调用,按你的规矩办事。
串起来看
捋到这儿,整张图就清晰了:
| 概念 | 一句话定位 |
|---|---|
| LLM | 核心引擎,所有 AI 技术都围着它转 |
| Token | 模型处理文本的最小单元(也是计费 / 限长单位) |
| Context | 临时记忆体;Context Window 是它的容量上限 |
| RAG | 当记忆装不下时,让模型「现查现答」 |
| Prompt | 你给模型的具体指令 |
| Tool | 模型调用外部能力的函数 |
| MCP | 统一工具接入标准(Type-C 化) |
| Agent | 能自主规划、连续调用工具的系统 |
| Agent Skill | 给 Agent 立的规矩说明书 |
它们的层次关系,其实是一条线:
LLM(引擎)
└─ Token(它读写的最小单位)
└─ Context(每次能「记住」的信息总和,有 Window 上限)
└─ 记不下时 → RAG(外挂知识,现查现答)
└─ Prompt(你如何指挥它)
└─ Tool + MCP(它如何连接外部世界)
└─ Agent(自主规划、连续调用 Tool 去完成任务)
└─ Agent Skill(给 Agent 定规矩)
看懂这 9 个,再遇到新词,你基本能把它挂到这条链上的某个位置——新词,就唬不住你了。
浙公网安备 33010602011771号