关于 AI 的学习路线图

[!NOTE] 笔记说明

这篇文章是本人一系列与 AI 相关笔记的开场白与规划说明,这一系列的笔记将用于系统性地整理我个人在长期学习、实践与反思人工智能理论及其相关工具的使用过程中,逐步形成的一些结构性认识。这些内容将被持续维护于我在 Github 上的计算机学习笔记库中,并会随着理解的深化不断修订,而非一次性结论。

术语/名词简介

在正式开始规划如何学习现代人工智能理论及其相关工具的使用方法之前,考虑到如今到处有人拿着一些时下热门的流行词汇装神弄鬼,把人说得时而兴奋,时而焦虑,想要学习却无从下手,我觉得还是有必要先对一些术语/名词进行简要的澄清,以便后续能更好地展开相关的讨论。

  • 人工智能(Artificial Intelligence,英文缩写 AI):泛指一整套致力于让机器实现智能化的计算机技术。其长期目标之一,是构建一套具备感知、推理、决策能力的通用软件系统。

  • 机器学习(Machine Learning,英文缩写 ML):这是现代人工智能主流的训练方法,主要思路是让机器通过数据学习规律,从而做出预测和决策。目前主要包括监督学习、无监督学习、强化学习等几种范式,当前工程实践以基于深度神经网络的监督学习为主(即所谓的深度学习)。

  • 大语言模型(Large Language Model,英文缩写 LLM):这是一种基于深度学习架构训练的通用语言模型,它通常会以 API 或本地推理形式向用户提供服务,例如 OpenAI 的 GPT、Google 的 Gemini、Anthropic 的 Claude、Meta 的 LLaMA、智普的 GLM 等(截止到 2026 年 1 月)。

  • 提示词(Prompt):泛指用户在与 LLM 交互时所要输入的文本内容与特定指令,用于引导模型生成特定输出。

  • AI 智能体(AI Agent);泛指以 LLM 为核心,具备状态管理、工具调用与任务执行能力的人工智能代理系统,它可在用户授权范围内执行本地或远程操作,其典型应用按交互/部署的方式可划分为:

    • Web 应用型:如 ChatGPT、Google AI Studio;
    • 桌面应用型:如 CodeX、Kimi Works;
    • 命令行工具型:如 Claude Code、OpenCode;
    • 可部署服务型:如 OpenClaw、Hermes Agent;
  • 模型上下文协议(Model Context Protocol,英文缩写 MCP):通常可被视为 LLM 接入外部工具的通用接口。其实最早是由 Anthropic 公司提出的一种通信协议,主要用于在 AI Agent 系统中实现外部工具的标准化接入。在技术文档中,这个词有时也泛指基于该协议提供的工具包。

  • 智能体的技能单元(Agent Skills):通常可被视为是对提示词以及相关工具描述、执行逻辑的封装。

在我个人看来,一份合格的科普应该要能让读者顺着文中所用到的词汇一个接一个查询下去,且越查越知道自己要学什么。下面,就让我顺着上面提到的这些术语/名词来规划一下学习 AI 的路线图吧。

学习路线图规划

正如之前所说,AI 是一整套相关技术的集合,这就决定了它的学习路线不太可能是一条单向进阶的技能树。我们需要在基础理论与工程实践之间来回切换视角——既要让理论指导项目实践,也要让实践反过来加深对理论的理解。基于这些思考,我规划了以下四个阶段的学习路线图。

第一阶段:理解 AI 的能力边界

学习任何一门技术的第一步,都是先搞清楚它能做什么和不能做什么。具体到 AI,这就需要我们先了解其研究方法的演变历程及背后的数学模型,然后回答以下问题:

  • 为什么如今主流的 AI 训练方法是深度神经网络?
  • 深度神经网络主要用于解决什么类型的问题?
  • 为什么某些任务看似简单,却难以通过深度神经网络来解决?

基于上述问题,我会推荐读者去阅读以下经典教材:

  • 《人工智能:现代方法》(第 4 版)(Russell & Norvig,人民邮电出版社)——选读搜索、推理、学习三大块。回答”为什么深度学习会成为主流”。
  • 《模式识别与机器学习》(Christopher Bishop,人民邮电出版社)——选读概率模型、神经网络、优化与泛化。提供”基于数学模型回答问题”的理论支点。
  • 《统计学习要素》(第 2 版)(Hastie, Tibshirani, Friedman,清华大学出版社)——建议读英文原版,选读偏差-方差、样本复杂度、模型选择、正则化。帮助建立”不要迷信模型”的概念。

这一阶段的学习重点应放在方法论的理解上,上面这些书用来理解方法论和能力边界即可。需要强调的是,如果您是非研究领域的普通开发者,不要过早陷在数学推导细节里,这样做可能会让您无法继续前进。

📌 关联笔记:

  • [[AI 研究方法的演变]]:在这篇笔记中,我会基于 AI 在不同研究阶段使用的数学模型来了解其能力边界。博客园链接

第二阶段:理解深度学习的工作原理

在完成了第一阶段的学习后,我们应该已经对 AI 的能力边界有了一个基本的判断。接下来就可以深入当前最主流的方法 —— 深度学习 —— 去看看它到底是怎么工作的。这需要我们回答以下问题:

  • LLM 在训练过程中究竟 ”学” 到了什么?
  • 机器在学习过程中所要优化的对象是什么?
  • 模型行为与损失函数之间存在怎样的映射关系?

基于这些问题,我会推荐读者去阅读以下经典教材:

  • 《深度学习》(Goodfellow, Bengio, Courville,人民邮电出版社):建议选读表示学习、优化与泛化、卷积网络、序列建模。AI 学习者不可回避的”正典”。
  • 《神经网络与机器学习》(第 3 版)(Simon Haykin,机械工业出版社):建议选读神经网络、学习算法、CNN、RNN。回答”为什么神经网络效果好但不万能”。
  • 《强化学习》(第 2 版)(Sutton & Barto,电子工业出版社):建议浅读即可。帮助理解”深度网络 ≠ 自动具备智能”,避免将某个具体技术手段与 AI 的终极目标混为一谈。

在这一阶段,初学者们常犯的一个错误是,把 “模型学习” 理解为 “模型学会了规则”。实际上,在绝大多数工程场景中,神经网络所做的事情更接近于:在高维参数空间中,寻找一个在给定数据分布上表现足够好的函数近似,换言之就是:

  • LLM 并不会显式地 “理解” 任务目标;
  • 所谓的 “智能表现”,来源于函数逼近在统计意义上的成功;
  • 当输入分布发生变化时,模型行为可能出现不可预期的退化。

因此,读者需要重点理解的是 函数逼近、概率建模与优化过程之间的关系,而不是具体网络结构的堆叠技巧。完成这一阶段后,我们不一定能够训练出一个效果很好的模型,但应当能够解释模型行为出现偏差的可能原因、区分“模型能力不足”与“目标定义不合理”,并对模型效果的提升空间做出理性预期。这意味着,我们将开始从“算法使用者”逐步过渡为对模型行为具有判断力的工程实践者。

📌 关联笔记:

  • [[深度学习的训练与评估]]:在这篇笔记中,我将重点介绍如何通过损失曲线、评估指标和诊断工具判断模型"学好了没有",以及当效果不理想时该从哪些方向排查。博客园链接

第三阶段:观察 LLM 在生产环境中的角色

在完成这一阶段后,我们应当要能够解释模型行为出现偏差的原因、区分 "模型能力不足" 与 "目标定义不合理",从算法使用者过渡为对模型行为有判断力的工程实践者。接下来,我们带着这些判断力进入生产环境,观察 LLM 在真实系统中的角色,这需要我们回答以下问题:

  • LLM 在生产环境中是核心决策单元,还是能力增强模块?
  • LLM 的不确定性会通过哪些路径影响系统稳定性?
  • 哪些问题是模型本身的问题,哪些是系统设计问题?
  • 为什么同一个模型在不同系统中表现差异巨大?

基于这些问题,我会建议读者根据自身条件选择以下路径之一,来完成一次对 LLM 在生产环境中的角色观察:

  • 基于 Ollama 等工具流部署一个能在本地运行并进行测试的 LLM;
  • 基于 LLaMA-Factory 等工具在本地实现一次 LLM 的微调实验;

需要强调的是,无论我们选择的是上面的哪条路径,目标都应该是用实际观察来明确以下工程细节:

  • 输入边界:模型可以接收什么样的输入?哪些输入需要在进入模型前被过滤、裁剪或重写?
  • 输出约束:模型输出如何被结构化?如何避免将自然语言输出直接作为系统指令执行?
  • 失败模式:当模型输出不可靠、超时或不可解析时,系统如何退化?
  • 责任边界:哪些决策可以交给模型,哪些必须由确定性逻辑完成?

只有在理解了这些问题之后,我们才能真正把 LLM 视为一个不稳定但有价值的外部能力源,而非”更聪明的函数”。接下来,我们就可以基于这些认知,学习如何通过 AI Agent 将 LLM 的能力运用到实际的应用场景中。

📌 关联笔记:

  • [[LLM 的部署与测试]]:在这篇笔记中,我会介绍如何通过 Ollama 等工具在本地部署一个 LLM,并基于该模型完成一次简单的能力边界测试,以此来观察 LLM 在生产环境中的角色。博客园链接
  • [[LLM 的微调实验]]:在这篇笔记中,我会介绍如何通过 LLaMA-Factory 等工具在本地实现一次 LLM 的微调实验,并基于该实验结果分析 LLM 在生产环境中的角色。(未完成),

第四阶段:基于 AI Agent 进行应用实践

在完成了前面对 LLM 能力的观察之后,我们才真正意义上具备了深度应用 AI Agent 的前提条件。AI Agent 的角色类似于数据库系统中的 SQL 引擎。换而言之,它是 LLM 的集成调用环境,而非直接调用 LLM 的客户端。这一阶段的学习重点在于:

  • 理解 AI Agent 的任务边界:明确哪些任务适合交给 Agent,哪些不适合;
  • 管理 AI Agent 的自主性:掌握如何在操作系统中限制执行权限;
  • 控制 AI Agent 的行为:能在行为偏离任务目标时进行有效干预。

基于上述学习任务,我会推荐读者分以下角色去理解 AI Agent 的核心组件:

  • 工具调用层(Function Calling):模型输出结构化指令,由外部系统执行——这是 Agent 行动的起点。
  • 记忆机制(Memory):短期记忆(会话上下文)与长期记忆(向量数据库/结构化存储)共同决定了 Agent 能否在持续交互中保持一致行为。
  • 安全边界(Sandboxing):在操作系统层面限制 Agent 的文件系统/网络/进程访问权限,是生产部署中最常被忽略但最关键的一环。
  • 技能体系(Skills):将提示词、工具描述和执行逻辑封装为可复用的技能单元,是实现 ”Agent 能力持续增长” 的核心模式。关于这一点,《图解 Skills》做了很好的系统性阐述,该书的作者本身也是一线 Agent 开发者,可信度高于市面上大多数泛泛而谈的 Agent 教程。

在这一阶段,我会建议读者根据自身条件来选择以下路径之一,来完成一次对 AI Agent 的实践应用:

  • 基于 OpenCode 这类本地运行的 Agent 完成一个中小型项目;
  • 基于 OpenClaw 这类可远端部署的 Agent 提升个人或团队效率。

同样的,无论我们选择的是上面的哪条路径,目标都应该是寻求基于亲身使用体验来明确以下问题:

  • 在指定的具体项目中,引入 AI Agent 的必要性有无实际数据支撑?
  • 相比确定性程序,AI Agent 带来的收益是否足以覆盖其不确定性成本?
  • 当 AI Agent 不再可控时,目标项目的工程状态是否可以无损地回退?

只有当我们能理性地回答上述问题时,AI Agent 才会从技术展示品转变为一种可被谨慎使用的工程化手段。

📌 关联笔记:

  • [[Agent 的基础应用]]:在这篇笔记中,我会通过 OpenCode 等工具从零上手 Agent,介绍安装配置与基础使用流程。博客园链接
  • [[Agent 的能力体系]]:在这篇笔记中,我会从提示词边界出发,展开 MCP 协议、Skills 技能体系等扩展能力。博客园链接
  • [[Agent 的记忆机制]]:在这篇笔记中,我会介绍如何为 Agent 构建记忆机制,涵盖 RAG 架构与长上下文窗口的实践经验。博客园链接
  • [[Agent 的应用演示]]:,在这篇笔记中,我会汇总具有代表性的可复现应用场景,包括私人助理、职场办公、开发测试、代码分析等。博客园链接

结束语

最后需要再次强调一下,我在这里所列出的学习阶段并非严格线性的学习流程,它只用于明确认知依赖关系。换言之,越靠前的阶段,越决定后续学习是否高效;越靠后的阶段,越依赖工程经验而非理论深度。 在实际学习过程中,可以根据个人背景进行交叉推进,但不应跳过对前置判断的建立。学习路线的核心价值,并不在于掌握多少工具,而在于避免在错误的阶段投入过多精力。

posted on 2026-02-01 13:57  凌杰  阅读(2015)  评论(1)    收藏  举报

导航