关于 AI 的学习路线图
[!NOTE] 笔记说明
这篇文章是本人一系列与 AI 相关笔记的开场白与规划说明,这一系列的笔记将用于系统性地整理我个人在长期学习、实践与反思人工智能理论及其相关工具的使用过程中,逐步形成的一些结构性认识。这些内容将被持续维护于我在 Github 上的计算机学习笔记库中,并会随着理解的深化不断修订,而非一次性结论。
如果你只想了解 AI 训练大致是怎么回事,但不想深入数学推导,可以先读面向非专业读者的轻量入口《[[AI 训练在干什么(给非专业读者的导览)]]》——它用类比和直觉讲清楚整个系列的核心命题(目标、优化、评估的三角),再回过头来看本文规划的具体学习路径,会更有抓手。
术语/名词简介
在正式开始规划如何学习现代人工智能理论及其相关工具的使用方法之前,考虑到如今到处有人拿着一些时下热门的流行词汇装神弄鬼,把人说得时而兴奋,时而焦虑,想要学习却无从下手,我觉得还是有必要先对一些术语/名词进行简要的澄清,以便后续能更好地展开相关的讨论。
-
人工智能(Artificial Intelligence,英文缩写 AI):泛指一整套致力于让机器实现智能化的计算机技术。其长期目标之一,是构建一套具备感知、推理、决策能力的通用软件系统。
-
机器学习(Machine Learning,英文缩写 ML):这是现代人工智能主流的训练方法,主要思路是让机器通过数据学习规律,从而做出预测和决策。当前工程实践大量采用基于深度神经网络的学习方法,其中包括监督学习、自监督学习和强化学习等不同的范式。
-
大语言模型(Large Language Model,英文缩写 LLM):这是一种基于深度学习架构训练的通用语言模型,它通常会以 API 或本地推理形式向用户提供服务,例如 OpenAI 的 GPT、Google 的 Gemini、Anthropic 的 Claude、Meta 的 LLaMA、智普的 GLM 等(截止到 2026 年 1 月)。
-
提示词(Prompt):泛指用户在与 LLM 交互时所要输入的文本内容与特定指令,用于引导模型生成特定输出。
-
AI 智能体(AI Agent):泛指以 LLM 为核心,具备状态管理、工具调用与任务执行能力的人工智能代理系统,它可在用户授权范围内执行本地或远程操作,其典型应用按交互/部署的方式可划分为:
- Web 应用型:如 ChatGPT、Google AI Studio;
- 桌面应用型:如 Codex、Kimi Works;
- 命令行工具型:如 Claude Code、OpenCode;
- 可部署服务型:如 OpenClaw、Hermes Agent;
-
模型上下文协议(Model Context Protocol,英文缩写 MCP):通常可被视为 LLM 接入外部工具的通用接口。其实最早是由 Anthropic 公司提出的一种通信协议,主要用于在 AI Agent 系统中实现外部工具的标准化接入。在技术文档中,这个词有时也泛指基于该协议提供的工具包。
-
智能体的技能单元(Agent Skills):通常可被视为是对提示词以及相关工具描述、执行逻辑的封装。
在我个人看来,一份合格的科普应该要能让读者顺着文中所用到的词汇一个接一个查询下去,且越查越知道自己要学什么。
先修知识
由于本路线图的若干阶段会涉及理论学习与代码实验,我在这里会建议读者在开始之前至少具备以下基础:
- 编程语言:Python 基础语法(变量、函数、控制流、列表 / 字典推导式),能够独立完成 100 行左右的脚本编写;熟悉
pip与虚拟环境的基本用法。 - 数学基础:线性代数(向量、矩阵乘法、特征值与特征向量的直觉);概率论(条件概率、贝叶斯公式、期望与方差)。更高阶的优化与高等数学知识可在后续阶段按需补齐。
- 工程基础:Git 基本命令(
clone / add / commit / push / branch);命令行工具的基本使用(包括管道 / 重定向)。 - 英语阅读能力:本路线图推荐的大部分经典教材都有英文原版,且许多前沿论文只在英文圈流通。
如果读者对上述基础尚有欠缺,建议先花 1-2 个月补齐,再开始本路线图的正式学习。下面,就让我顺着上面提到的这些术语/名词来规划一下学习 AI 的路线图吧。
学习路线图规划
下文按由浅入深的顺序规划了四个学习阶段。每个阶段对应一组核心问题、一组推荐教材与一组关联笔记。下图给出阶段间的依赖关系(箭头表示"前置 → 后置",但实际学习中可根据个人背景交叉推进):
- AI 能力边界
↓ - 深度学习工作原理
↓ - LLM 在系统中的角色
↓ - AI Agent 应用实践
正如之前所说,AI 是一整套相关技术的集合,这就决定了它的学习路线不太可能是一条单向进阶的技能树。我们需要在基础理论与工程实践之间来回切换视角,既要让理论指导项目实践,也要让实践反过来加深对理论的理解。基于这些思考,我规划了以下四个阶段的学习路线图。
第一阶段:理解 AI 的能力边界
学习任何一门技术的第一步,都是先搞清楚它能做什么和不能做什么。具体到 AI,这就需要我们先了解其研究方法的演变历程及背后的数学模型,然后回答以下问题:
- 为什么如今主流的 AI 模型大量采用深度神经网络?
- 深度神经网络主要适合解决什么类型的问题?
- 为什么深度神经网络难以解决一些看似简单的问题?
基于上述问题,我会推荐读者去阅读以下经典教材:
- 《人工智能:现代方法》(第 4 版)(Russell & Norvig,人民邮电出版社)——选读搜索、推理、学习三大块。回答 ”为什么深度学习会成为主流”。
- 《模式识别与机器学习》(Christopher Bishop,人民邮电出版社)——选读概率模型、神经网络、优化与泛化。提供 ”基于数学模型回答问题” 的理论支点。
- 《统计学习要素》(第 2 版)(Hastie, Tibshirani, Friedman,清华大学出版社)——建议读英文原版,选读偏差-方差、样本复杂度、模型选择、正则化。帮助建立 ”不要迷信模型” 的概念。
这一阶段的学习重点应放在方法论的理解上,上面这些书用来理解方法论和能力边界即可。需要强调的是,如果读者是非研究领域的普通开发者,不要过早陷在数学推导细节里,这样做可能会让自己无法继续前进。
⏱ 时间预算与掌握标志:
- 时间预算:2-4 周(具备基础数学与 Python 的读者)。
- 掌握标志:① 能够口头解释监督学习、无监督学习、强化学习的核心差异;② 阅读《[[AI 研究方法的演变]]》时不再被公式劝退,能抓住 "为什么 X 算法在某类问题上有效" 的直觉;③ 能在不查阅资料的前提下,列出深度学习兴起背后的三个关键推力(如数据规模、算力提升、算法突破)。
📌 关联笔记:
- [[AI 研究方法的演变]]:在这篇笔记中,我会基于 AI 在不同研究阶段使用的数学模型来了解其能力边界。博客园链接
第二阶段:理解深度学习的工作原理
在完成了第一阶段的学习后,我们应该已经对 AI 的能力边界有了一个基本的判断。接下来就可以深入当前最主流的方法 —— 深度学习 —— 去看看它到底是怎么工作的。这需要我们回答以下问题:
- LLM 在训练过程中究竟 ”学” 到了什么?
- 机器在学习过程中所要优化的对象是什么?
- LLM 的行为与损失函数之间存在怎样的映射关系?
基于这些问题,我会推荐读者去阅读以下经典教材:
- 《动手学深度学习》(第 2 版)(李沐、Aston Zhang、Zachary C. Lipton、Alex J. Smola,人民邮电出版社):中文圈最受欢迎的开源实战教材,覆盖 PyTorch / TensorFlow / MXNet 多框架实现,包含可直接运行的代码与中文习题讲解。建议作为"花书"的实战补充,入门阶段可优先使用。
- 《深度学习》(Goodfellow, Bengio, Courville,人民邮电出版社):建议选读表示学习、优化与泛化、卷积网络、序列建模。AI 学习者不可回避的”正典”。
- 《神经网络与机器学习》(第 3 版)(Simon Haykin,机械工业出版社):建议选读神经网络、学习算法、CNN、RNN。回答”为什么神经网络效果好但不万能”。
- 《强化学习》(第 2 版)(Sutton & Barto,电子工业出版社):建议浅读即可。帮助理解”深度网络 ≠ 自动具备智能”,避免将某个具体技术手段与 AI 的终极目标混为一谈。
在这一阶段,初学者们常犯的一个错误是,把 “LLM 的学习” 理解为 “LLM 学会了规则”。实际上,在绝大多数工程场景中,神经网络所做的事情更接近于:在高维参数空间中,寻找一个在给定数据分布上表现足够好的函数近似,换言之就是:
- LLM 并不会显式地 “理解” 任务目标;
- 当输入分布发生变化时,LLM 的能力可能出现不可预期的退化。
- LLM 的许多 “智能表现”,可以从函数逼近在特定数据分布上的成功中得到解释;
因此,读者需要重点理解的是 函数逼近、概率建模与优化过程之间的关系,而不是具体网络结构的堆叠技巧。完成这一阶段后,我们不一定能够训练出一个效果很好的 LLM,但应当能够在 LLM 的行为出现偏差时解释可能的原因、区分 "实际能力不足" 与 "目标定义不合理",并对 LLM 训练效果的提升空间做出理性预期。这意味着,我们将开始从 "算法使用者" 逐步过渡为对 LLM 的行为具有判断力的工程实践者。
⏱ 时间预算与掌握标志:
- 时间预算:6-10 周(取决于数学基础与代码实验投入;如果跳过数学细节、可压缩到 4-6 周)。
- 掌握标志:① 能用一张图解释训练集 / 验证集 / 测试集的关系,并说明过拟合与欠拟合的判定标准;② 当 LLM 输出 "看起来不对" 时,能够列出至少 3 个排查方向(如 prompt 设计、温度参数、上下文长度);③ 能口头解释 "LLM 学到的是函数逼近,而非规则" 这一核心直觉。
📌 关联笔记:
- [[深度学习的训练与评估]]:在这篇笔记中,我将重点介绍如何通过损失曲线、评估指标和诊断工具判断模型"学好了没有",以及当效果不理想时该从哪些方向排查。博客园链接
第三阶段:观察 LLM 在 AI 系统中所扮演的角色
在这一阶段,学习的目标是从算法的使用者过渡为对 LLM 的行为有一定判断力的工程实践者,这就需要我们去仔细观察 LLM 在 AI 系统中所扮演的角色并回答以下问题:
- LLM 在 AI 系统中是核心决策单元,还是能力增强模块?
- LLM 的不确定性会通过哪些路径影响 AI 系统的稳定性?
- 哪些是 LLM 本身能力的问题,哪些是 AI 系统的设计问题?
- 为什么同一个 LLM 在不同 AI 系统中的表现差异巨大?
基于这些问题,我会建议读者根据自身所拥有的设备条件选择以下路径之一,来完成一次对 LLM 在 AI 系统中的角色观察实验:
- 如果设备条件有限,可以基于 Ollama 等工具部署一个能够本地运行的 LLM,通过构造不同输入和系统约束观察其能力边界与失败模式;
- 如果设备条件允许,也可以进一步基于 LLaMA-Factory 等工具完成一次小规模微调实验,观察训练数据和优化目标发生变化后,模型行为如何变化。
需要强调的是,无论我们选择的是上面的哪条路径,目标都应该是通过实验来观察 LLM,并进而了解 AI 系统中的以下工程细节:
- 输入边界:LLM 可以接收什么样的输入?哪些输入在进入 LLM 之前需要经过 AI 系统的过滤、裁剪或重写?
- 输出约束:LLM 的输出是如何被 AI 系统结构化的?如何避免将自然语言输出直接作为系统指令执行?
- 失败模式:当 LLM 的输出不可靠、超时或不可解析时,AI 系统该如何处理能力的退化问题?
- 责任边界:哪些决策可以交给 LLM 处理,哪些必须由 AI 系统中预设的确定性逻辑来完成?
只有在理解了这些问题之后,我们才能真正把 LLM 视为一个不稳定但有价值的外部能力源,而非 "更聪明的函数"。接下来,我们就可以基于这些认知,学习如何通过 AI 系统将 LLM 的能力运用到实际应用中。
⏱ 时间预算与掌握标志:
- 时间预算:4-8 周(取决于本地设备条件;高端 GPU 可压缩到 2-4 周)。
- 掌握标志:① 能够在本地用 Ollama 或类似工具部署一个 7B 量级的 LLM,并完整跑通一轮能力边界测试;② 能区分 "LLM 本身能力不足" 与 "AI 系统设计不合理" 这两类失败模式;③ 在面对 LLM 输出不可靠、超时或不可解析的场景时,能够给出 AI 系统侧的应对方案(如回退到确定性逻辑、人工接管、降级提示等)。
📌 关联笔记:
- [[LLM 的部署与测试]]:在这篇笔记中,我会介绍如何通过 Ollama 等工具在本地部署一个 LLM,并基于该模型完成一次简单的能力边界测试,以此来观察 LLM 在 AI 系统中的角色。博客园链接
- [[LLM 的微调实验]]:在这篇笔记中,我会介绍如何通过 LLaMA-Factory 等工具在本地实现一次 LLM 的微调实验,并基于该实验结果分析 LLM 在 AI 系统中的角色。(未完成)
第四阶段:基于 AI Agent 进行应用实践
在完成了前面对 LLM 在 AI 系统的角色观察之后,我们才真正意义上具备了深度应用 AI Agent 这个典型 AI 系统的前提条件。因为在这种情况下,读者很容易就能理解 AI Agent 并不是一个简单调用 LLM API 的客户端,它是围绕 LLM 能力构建的任务执行系统。这一阶段的学习重点在于:
- 理解 AI Agent 的任务边界:明确哪些任务适合交给 AI Agent,哪些不适合;
- 管理 AI Agent 的自主性:掌握如何在操作系统中限制 AI Agent 的执行权限;
- 控制 AI Agent 的行为:能在 AI Agent 的行为偏离任务目标时进行有效干预。
基于上述学习任务,我会推荐读者分以下角色去理解 AI Agent 的核心组件:
- 工具调用层(Function Calling):模型输出结构化指令,由外部系统执行——这是 AI Agent 行动的起点。
- 记忆机制(Memory):短期记忆(会话上下文)与长期记忆(向量数据库/结构化存储)共同决定了 AI Agent 能否在持续交互中保持一致行为。
- 安全边界(Sandboxing):在操作系统层面限制 AI Agent 的文件系统/网络/进程访问权限,是生产部署中最常被忽略但最关键的一环。
- 技能体系(Skills):将提示词、工具描述和执行逻辑封装为可复用的技能单元,是实现 ”Agent 能力持续增长” 的核心模式。关于这一点,《图解 Skills》做了很好的系统性阐述,该书的作者本身也是一线 Agent 开发者,可信度高于市面上大多数泛泛而谈的 Agent 教程。
在这一阶段,我会建议读者根据自身条件来选择以下路径之一,来完成一次对 AI Agent 的实践应用:
- 基于 OpenClaw 这类可远端部署的 AI Agent 提升个人工作或团队管理的效率。
- 基于 OpenCode 这类本地运行的 AI Agent 完成一个中小型项目的开发与重构;
同样的,无论我们选择的是上面的哪条路径,目标都应该是寻求基于亲身使用体验来明确以下问题:
- 在指定的具体项目中,引入 AI Agent 的必要性有无实际数据支撑?
- 相比确定性程序,AI Agent 带来的收益是否足以覆盖其不确定性成本?
- 当 AI Agent 不再可控时,目标项目的工程状态是否可以无损地回退?
只有当我们能理性地回答上述问题时,AI Agent 才会从技术展示品转变为一种可被谨慎使用的工程化手段。
⏱ 时间预算与掌握标志:
- 时间预算:4-6 周(取决于具体项目复杂度;如果只是体验性使用可压缩到 1-2 周)。
- 掌握标志:① 在真实项目中引入 AI Agent 后,能用具体数据(如任务完成率、人工干预频率、单位时间收益)回答 "是否值得用 Agent 替代确定性程序";② 能够在 AI Agent 行为失控时, 通过沙箱与权限管理将其影响控制在可回退范围内;③ 能用具体例子区分 "Function Calling / Memory / Skills / Sandboxing" 四个核心组件各自承担的责任。
📌 关联笔记:
AI Agent 应用的使用笔记:
Vibe Coding 实践笔记:
- [[关于项目重构的实践]]:在这篇笔记中,我会使用 OpenCode 演示如何实现针对一个旧有程序的重构,并分享一些个人经验。(未完成)
- [[关于应用开发的实践]]:在这篇笔记中,我会使用 OpenCode 演示如何完成 Android 应用的开发,并分享一些个人经验。(未完成)
结束语
最后需要再次强调一下,我在这里所列出的学习阶段并非严格线性的学习流程,它只用于明确认知依赖关系。换言之,越靠前的阶段,越决定后续学习是否高效;越靠后的阶段,越依赖工程经验而非理论深度。 在实际学习过程中,可以根据个人背景进行交叉推进,但不应跳过对前置判断的建立。学习路线的核心价值,并不在于掌握多少工具,而在于避免在错误的阶段投入过多精力。
浙公网安备 33010602011771号