Agent 速成笔记 · 第 2 章 智能体发展史

Agent 速成笔记 · 第 2 章 智能体发展史

源:Datawhale《Hello-Agents》第 2 章 | 定位:概念原理与历史脉络 | 一句话:搞清"每一代智能体为什么会被下一代取代",从而理解今天 Agent 架构里每个部件的历史来由。


0. 一章速览(30 秒)

  • 一句话:智能体发展史是一条"问题驱动"的迭代链——符号主义给出了逻辑推理框架但卡在知识获取,联结主义解决了感知但不会决策,强化学习解决了决策但缺先验知识,大模型预训练填上了世界知识,四块拼图最终在 LLM 智能体里合体。
  • 本章解决什么问题:解释"现代智能体为什么长成今天这样",让你做技术选型时知道某个设计对应历史上哪个痛点。
  • 必须记住的 5 个点:
    • 符号主义的核心命题是物理符号系统假说(PSSH, 1976),以及它的两大死穴:知识获取瓶颈与框架问题。
    • 联结主义解决"感知",强化学习解决"序贯决策",预训练解决"先验知识",三者解决的问题完全不同,不能互相替代。
    • 明斯基《心智社会》把"集中式单一智能"翻转为"分布式涌现智能",是多智能体系统(MAS)的思想起点。
    • LLM 的质变在于涌现能力:上下文学习与思维链,使"不重训权重也能干新任务"成为可能。
    • 现代 LLM 智能体是神经-符号混合体:联结主义造出的模型,在当符号推理的"大脑"用。

1. 符号主义:逻辑与符号的早期智能体(对应原文 2.1)

1.1 物理符号系统假说(PSSH)

  • 是什么:1976 年由两位图灵奖得主艾伦·纽厄尔(Allen Newell)与赫伯特·西蒙(Herbert A. Simon)提出的理论假说,是符号主义(Symbolicism,也称"逻辑 AI""传统 AI")时代的理论地基。
  • 两个论断(必背):
    • 充分性论断:任何一个物理符号系统,都具备产生通用智能行为的充分手段。
    • 必要性论断:任何一个能展现通用智能行为的系统,其本质必然是一个物理符号系统。
  • 怎么运作:所谓"物理符号系统"= 一组可被区分的符号 + 一系列对这些符号进行操作的过程。符号可组合成表达式等复杂结构;过程则负责创建、修改、复制、销毁这些符号结构。智能,就等于符号的计算与处理。
  • 为什么重要:它把"心智"这一模糊的哲学问题降维成可工程化实现的具体问题:只要找到正确的知识表示方式加有效的推理算法,就能造出媲美人类的机器智能——整个符号主义时代都在这条路线下展开。
  • 工程要点:这个假说的隐含前提是"智慧源于设计者预先编码的知识库与推理规则,而非自主学习"。记住了这个前提,就能理解后面所有范式的反抗对象是什么。

1.2 专家系统:符号主义最成功的果实

  • 是什么:把人类专家的知识与经验编码成程序,使其在特定领域给出媲美甚至超越专家的结论。这是符号主义时代最重要、最成功的应用成果。
  • 架构:由知识库、推理机、用户界面等构成。它鲜明体现了符号主义的核心设计思想——知识与推理相分离。
  • 怎么运作(两个核心部件):
    • 知识库(Knowledge Base):知识存储中心。关键问题是知识表示(Knowledge Representation),最常用的方法是产生式规则(Production Rules),即一连串 IF-THEN 条件语句,例如"IF 病人有发烧症状 AND 咳嗽 THEN 可能患有呼吸道感染"。IF 部分是条件,THEN 部分是结论或行动。一个复杂系统可含成百上千条规则,构成庞大的知识网络。
    • 推理机(Inference Engine):通用程序,负责根据用户给出的事实,在知识库里寻找并应用规则以推导新结论。它有两条工作路线:
      • 正向链(Forward Chaining):从已知事实出发,不断匹配规则的 IF 部分、触发 THEN 结论,把新结论加回事实库,直到推出目标或无规则可匹配。数据驱动。
      • 反向链(Backward Chaining):从假设目标出发,找能推出该目标的规则,再把该规则的 IF 部分当作新的子目标递归下去,直到所有子目标都被已知事实证明。目标驱动。
  • 工程决策规则:事实少、目标明确且候选有限 → 反向链(如诊断"是不是某种病",顺着目标找证据);事实多、要从数据推出所有可能结论 → 正向链。

1.3 标志案例 MYCIN:专家系统能做到什么程度

  • 硬信息:斯坦福大学于 20 世纪 70 年代开发,用于辅助诊断细菌性血液感染并推荐抗生素治疗方案。
  • 怎么运作:通过与医生问答式交互收集症状、病史、化验结果。知识库包含约 600 条由医学专家提供的 IF-THEN 规则。推理机主要采用反向链:从"确定致病菌"这一最高目标出发,反推需要哪些证据与条件,再向医生提问索取这些信息。
  • 关键创新:置信因子(Certainty Factor, CF)。医学诊断充满不确定性,MYCIN 用一个 -1 到 1 之间的数值表示结论的可信度,使系统能处理模糊、不确定的医学知识,输出带可信度评估的诊断结果。这比纯布尔逻辑更贴近现实世界——这是早期"不确定性推理"的样板。
  • 成就与意义:在一项评估中,MYCIN 的血液感染诊断表现超过非专业医生,甚至达到人类专家水平,雄辩地证明了 PSSH 的有效性,也为 AI 在垂直领域的商业化铺了路。

1.4 SHRDLU:从"深度"走向"广度"的集成式智能体

  • 是什么:由特里·威诺格拉德(Terry Winograd)于 1968—1970 年开发的综合性智能体项目,运行在"积木世界"——一个含不同形状、颜色、大小的积木与可抓取积木的虚拟机械臂的模拟三维空间。用户用自然语言下指令或提问,它执行动作或文字作答。
  • 为什么重要:SHRDLU 第一次把语言解析、规划、记忆等多个原本彼此独立的人工智能模块集成进一个统一系统并使其协同工作。
  • 四项具体能力(考点):
    • 自然语言理解 + 指代消解:能处理 Find a block which is taller than the one you are holding and put it into the box.,正确理解 the one you are holding 指当前正被抓取的物体。
    • 上下文记忆:说完 Grasp the pyramid. 后接着问 What does the box contain?,系统能联系上下文回答。
    • 规划与行动:指令是"把蓝色积木放到红色积木上"而红色积木上已有绿色积木时,它会自主规划出"先移开绿色积木,再放蓝色积木"的动作序列。
    • 记忆与问答:能回答世界状态(Is there a large block behind a pyramid?)、行为历史(Did you touch any pyramid before you put the green one on the little cube?)、行为动机(Why did you pick up the red block? → BECAUSE YOU ASKED ME TO.)。
  • 历史地位:① 综合性智能的典范——它的"感知-思考-行动"闭环设计奠定了现代智能体研究的基础;② 推广了"微观世界"研究方法——在规则明确的简化环境中验证复杂智能体原理;③ 引发了对 AGI 的早期乐观预期,也引发了对"符号处理 vs 真正理解"的长期思辨。

1.5 符号主义的两类根本性挑战(为什么必须换范式)

这是全章最重要的一节:理解这两类挑战,就理解了后面所有新范式的动机。

(1)常识知识与知识获取瓶颈

  • 知识获取瓶颈(Knowledge Acquisition Bottleneck):知识必须由人类专家与知识工程师通过繁琐的访谈、提炼、编码来构建,成本高昂、耗时漫长、难以规模化。更要命的是,专家的许多知识是内隐的、直觉性的,很难被清晰表达成 IF-THEN 规则。
  • 常识问题(Common-sense Problem):人类行为依赖庞大常识("水是湿的""绳子可以拉不能推"),而符号系统除非被明确编码,否则一无所知。为广而模糊的常识建立完备知识库至今是重大挑战——Cyc 项目历经数十年努力,成果与应用仍非常有限。

(2)框架问题与系统脆弱性

  • 框架问题(Frame Problem):动态世界中,智能体执行一个动作后,如何高效判断哪些事物没有发生改变,是一个逻辑难题。为每个动作显式声明所有不变状态在计算上不可行;而人类能毫不费力地忽略不相关的变化。
  • 系统脆弱性(Brittleness):系统完全依赖预设规则,一旦遇到规则之外的微小变化或新情况就可能完全失灵。SHRDLU 的成功恰恰因为它在规则完备的封闭世界里——而真实世界充满例外。

一句话总结这条转折动因:符号主义的能力上限 = 人手工写进去的知识量;而真实世界的知识量与例外数量都是无穷的。这条路走不通,不是因为推理不够强,而是因为知识没法喂完。


2. ELIZA:亲手感受"规则驱动"的边界(对应原文 2.2)

  • 是什么:约瑟夫·魏泽鲍姆(Joseph Weizenbaum)于 1966 年在麻省理工学院发布的程序,是早期自然语言处理的著名尝试。ELIZA 不是一个单一程序,而是一个可执行不同"脚本"的框架;最著名、最成功的脚本是 "DOCTOR",它模仿一位罗杰斯学派的非指导性心理治疗师。
  • 设计思想(反讽):魏泽鲍姆并不想造一个真能"理解"人类情感的智能体,恰恰相反,他想证明:靠简单的句式转换技巧,机器能在完全不理解对话内容的情况下营造出"智能"与"共情"的假象。结果出乎他意料——许多交互者(包括他的秘书)产生了情感依赖,深信它能理解自己。
  • 怎么运作(四步机制,必记):
    1. 关键词识别与排序:规则库为每个关键词(如 mother、dreamed、depressed)设定优先级;输入含多个关键词时,选优先级最高的规则处理。
    2. 分解规则:用带通配符(*)的分解规则捕获句子其余部分。例:规则 * my * + 输入 "My mother is afraid of me" → 捕获 ["", "mother is afraid of me"]。
    3. 重组规则:从关联的一组重组规则中选一条生成回应(通常随机选择以增加多样性),可选择性插入上一步捕获的内容。
    4. 代词转换:重组前做简单人称转换(I → you,my → your),维持对话连贯性。
  • 最小实现骨架(约 15 行,看懂即可):
rules = {                                  # 模式(正则) -> 响应模板列表
    r'I am (.*)': ["Did you come to me because you are {0}?",
                   "How long have you been {0}?"],
    r'.* mother .*': ["Tell me more about your mother."],
    r'.*': ["Please tell me more."],       # 兜底通配规则
}
pronoun_swap = {"i": "you", "my": "your", "am": "are"}   # 代词转换表

def respond(user_input):
    for pattern, responses in rules.items():             # 按顺序匹配
        match = re.search(pattern, user_input, re.IGNORECASE)
        if match:                                        # 命中规则
            g = match.group(1) if match.groups() else ''
            g = " ".join(pronoun_swap.get(w, w) for w in g.lower().split())
            return random.choice(responses).format(g)     # 随机挑模板填槽
    return random.choice(rules[r'.*'])                    # 全不中则兜底

这段在干什么:整段就是"正则匹配 + 模板填槽 + 代词替换"三件事——没有语义理解,没有状态,规则按顺序短路匹配,命中即返回。

  • 暴露的三条根本局限(直接对应 2.1 节的理论挑战):
    • 缺乏语义理解:面对 "I am not happy",仍会机械匹配 I am (.*) 规则,生成语义不通的回应——它无法理解否定词的作用。
    • 无上下文记忆:系统是无状态的(Stateless),每次回应只基于当前单句输入,无法做连贯多轮对话。
    • 规则扩展性问题:增加规则会导致规则库规模爆炸,规则间冲突与优先级管理极其复杂,最终难以维护。
  • ELIZA 效应:许多用户相信它能理解自己。这种"智能幻觉"来自两点——巧妙的对话策略(扮演被动提问者、用开放式模板)+ 人类天生的情感投射心理。
  • 结论:系统看似智能的表现,完全依赖设计者预先编码的规则。系统没有真正的理解,只是在执行符号操作——这正是脆弱性的根源。

3. 明斯基的心智社会:从"集中"转向"分布"(对应原文 2.3)

3.1 反思的起点:为什么"单一整体智能"走不通

20 世纪 70—80 年代,符号主义局限日益明显:专家系统没有儿童般的常识;SHRDLU 无法理解积木世界之外的事;ELIZA 对对话内容一无所知。它们都遵循同一套自上而下(Top-down)的设计——一个全知全能的中央处理器,按统一逻辑规则处理信息、做出决策。

马文·明斯基(Marvin Minsky)在《心智社会》(The Society of Mind)中提出颠覆性论断:"The trick is that there is no trick. The power of intelligence stems from our vast diversity, not from any single, perfect principle."(智能的力量来自庞大的多样性,而不是某个单一而完美的原理。)

他由此追问:"理解"是单一能力,还是视觉化、逻辑推理、情感共鸣、社会常识等数十种心智过程协同的结果?"常识"是数百万条规则的庞大知识库(如 Cyc),还是分布式交织的经验网络?智能体该追求一个完美的统一逻辑系统,还是承认智能本身就是由许多功能各异甚至彼此冲突的简单部分组成的大杂烩?

3.2 核心概念:智能体、机构、涌现

  • 智能体(此处理解):指一个极其简单的、专门化的心智过程,它自身是"无心"的。例如负责识别线条的 LINE-FINDER,或负责抓握的 GRASP。注意与第 1 章的现代 Agent 定义不同,这是最易混淆的点。
  • 机构(Agency):一组协同工作的智能体,用来完成更复杂的任务。它们之间通过去中心化的激活与抑制信号相互影响,形成动态控制流。
  • 涌现(Emergence):复杂的、有目的性的智能行为,并非由某个高级智能体预先规划,而是从大量简单底层智能体的局部交互中自发产生。

"搭建积木塔"的运作链条(讲清"谁激活谁"):

  • 高层目标("我要搭一个塔")→ 激活 BUILD-TOWER
  • BUILD-TOWER 并不知道怎么做物理动作,唯一作用是激活下属 BUILDER
  • BUILDER 只含一个循环逻辑:只要塔没搭完,就激活 ADD-BLOCK
  • ADD-BLOCK 依次激活 FIND-BLOCK、GET-BLOCK、PUT-ON-TOP
  • GET-BLOCK 再激活视觉系统的 SEE-SHAPE 与运动系统的 REACH、GRASP

关键点:全程没有任何智能体或机构拥有全局规划——GRASP 只负责抓握,不知什么是塔;BUILDER 只负责循环,不知如何控制手臂。当无数"无心"的智能体按简单激活/抑制规则相互作用时,"搭积木塔"这一高度智能的行为自然涌现。

3.3 对多智能体系统的理论启发

心智社会最深远的影响,是为分布式人工智能(Distributed Artificial Intelligence, DAI)及后来的多智能体系统(Multi-Agent System, MAS)提供了概念基础。它引出的关键追问是:如果单个心智内部的智能是靠大量简单智能体协作涌现的,那么多个物理上分离的计算实体(计算机、机器人)之间,是否也能通过协作涌现出更强的"群体智能"?

这直接把研究焦点从"如何构建一个全能的单一智能体"转向"如何设计一个高效协作的智能体群体"。三条直接启发:

  • 去中心化控制(Decentralized Control):理论核心是不存在中央控制器。MAS 完全继承这一思想,设计无中心节点的协调机制与任务分配策略成为其核心课题。
  • 涌现式计算(Emergent Computation):复杂问题的解法可从简单局部交互规则中自发产生,这启发了 MAS 中大量基于涌现的算法,如蚁群算法、粒子群优化。
  • 智能体的社会性(Agent Sociality):明斯基强调交互(激活、抑制);MAS 将其扩展为系统研究通信语言(如 ACL)、交互协议(如契约网)、协商策略、信任模型乃至组织结构,构建真正的计算社会。

4. 学习范式的演进与现代智能体(对应原文 2.4)

本节回答的问题是:如果智能无法被完全设计,那它能否被"学"出来? 学习的核心目标不再是手动编码知识,而是构建能从经验和数据中自动获取知识与能力的系统。

4.1 联结主义(Connectionism):把"感知"学出来

  • 是什么:对符号主义局限的直接回应,20 世纪 80 年代重新兴起。与符号主义自上而下、依赖明确逻辑规则不同,联结主义是自下而上的方法,灵感来自生物大脑的神经网络结构。
  • 三条核心思想(必背):
    1. 知识的分布式表示:知识不以明确符号或规则存在,而是以连接权重的形式,分布式地存储在大量简单处理单元(人工神经元)的连接之间;整个网络的连接模式本身就构成知识。
    2. 简单的处理单元:每个神经元只做很简单的计算——接收其他神经元的加权输入,过激活函数,输出给下一个神经元。
    3. 通过学习调整权重:智能不来自设计者写的复杂程序,而来自学习过程——接触大量样本,按某种学习算法(如反向传播算法)自动、迭代地调整连接权重,使网络输出逐渐接近期望目标。
  • 范式转变的本质:智能体不再是"被动执行规则的逻辑推理机",而是"能通过经验自我优化的适应性系统"。符号主义试图把人类知识显式编码给机器;联结主义试图造出能像人一样学习知识的机器。
  • 它解决了什么 / 没解决什么:解决了感知问题("这张图片里有什么?"),使其能直接从原始数据(图像、声音、文本)理解世界;但没解决决策问题("在这种情况下,我应该做什么?")——如何学会在与环境的动态交互中做最优序贯决策,需要另一种范式。
  • 关键人名:杰弗里·辛顿(Geoffrey Hinton)等研究者推动,反向传播算法为神经网络复苏奠基;后续经卷积神经网络、Transformer 成为主流。

4.2 强化学习(Reinforcement Learning, RL):把"决策"学出来

  • 是什么:专注序贯决策问题的学习范式。它不直接从标注好的静态数据集学习,而是通过智能体与环境的直接交互,在"试错"中学习如何最大化长期收益。
  • 实例:AlphaGo 的核心自我对弈过程就是 RL 的经典体现。AlphaGo(智能体)观察棋盘布局(环境状态)→ 决定落子位置(行动)→ 一局结束后按胜负收到明确信号(赢=正向奖励,输=负向奖励)。通过数百万次自我对弈不断调整内部策略,逐渐学会在何种棋局下选何种行动最可能导向胜利。这个过程完全自主,不依赖人类棋谱的直接指导。
  • 六个核心要素(必背):
要素 符号 在 AlphaGo 中的对应
智能体 Agent — 决策程序
环境 Environment — 围棋规则 + 对手
状态 State S 棋盘上所有棋子的当前位置
行动 Action A 在某个合法位置落子
奖励 Reward R 一局结束后胜 +1 / 负 -1
策略 Policy π 从状态到行动的映射
  • 怎么运作("感知-行动-学习"闭环,五步):
    1. 时间步 t,智能体观察环境当前状态 \(S_t\);
    2. 基于 \(S_t\),按内部策略 π(状态→行动的映射,定义智能体的行为方式)选择行动 \(A_t\) 并执行;
    3. 环境收到 \(A_t\) 后转移到新状态 \(S_{t+1}\);
    4. 同时反馈即时奖励 \(R_{t+1}\);
    5. 智能体用(\(S_{t+1}\), \(R_{t+1}\))更新并优化内部策略——这一步就是"学习"。
  • 学习目标(易错点):不是最大化某一时间步的即时奖励,而是最大化从当前时刻起的累积奖励(Cumulative Reward),也称为回报(Return)。这意味着智能体必须具备"远见"——有时要牺牲当前即时奖励换取未来更大奖励(围棋中的"弃子")。
  • 工程要点:RL 的难点集中在"奖励稀疏 + 需要海量针对特定任务的交互数据",这正是它最大的短板——智能体学习之初缺乏先验知识,要从零构建对任务的理解:符号主义手工编码的常识、人类决策依赖的背景知识,在 RL 智能体里都是缺失的。

4.3 基于大规模数据的预训练:把"先验知识"学出来

  • 要解决的问题:如何让智能体在开始学具体任务之前,就先具备对世界的广泛理解?答案在自然语言处理(NLP)领域浮现——预训练(Pre-training)。
  • 旧模式的毛病:传统 NLP 模型为单一特定任务在专门标注的中小规模数据集上从零独立训练 → 知识面狭窄、难以跨任务泛化、每个新任务都要重新耗费大量人力标注数据。
  • 预训练 + 微调(Pre-training, Fine-tuning)范式的两步:
    1. 预训练阶段:在互联网级海量文本的通用语料库上,通过自监督学习(Self-supervised Learning)训练超大规模神经网络。目标不是完成任何特定任务,而是学习语言本身的内在规律、语法结构、事实知识与上下文逻辑。最常见的目标是"预测下一个词"。
    2. 微调阶段:预训练后模型已学到丰富知识;针对下游任务,只需少量该任务的标注数据微调,即可适应对应任务。
  • 为什么它解决了符号主义最棘手的问题:在数万亿级文本上预训练后,大型语言模型的神经网络权重实际上已构建了一个关于世界知识的、高度压缩的隐式模型——这以一种全新方式解决了"知识获取瓶颈"。对比之下:符号主义是显式、人工编码、可枚举的知识;预训练是隐式、自动习得、分布式压缩的知识。
  • 涌现能力(Emergent Abilities,本章核心考点):当模型规模(参数量、数据量、计算量)跨越某个阈值后,模型开始展现未被直接训练的、预料之外的能力:
    • 上下文学习(In-context Learning):无需调整模型权重,仅在输入中提供几个示例(Few-shot)甚至零个示例(Zero-shot),模型就能理解并完成新任务。
    • 思维链(Chain-of-Thought)推理:引导模型在回答复杂问题前先输出一步步的推理过程,可显著提升其在逻辑、算术和常识推理任务上的准确性。
  • 结论:LLM 不再仅是一个语言模型,它已演变成兼具海量知识库与通用推理引擎双重角色的组件。至此,关键拼图集齐——符号主义提供逻辑推理框架,联结主义与强化学习提供学习与决策能力,预训练提供前所未有的世界知识与通用推理能力。

4.4 基于大语言模型的智能体:拼图合体

LLM 智能体通过一个多模块协同、持续迭代的闭环流程完成任务。四步拆解如下(谁调用谁、输入输出是什么):

  1. 感知(Perception):感知模块通过传感器从外部环境接收原始输入,形成观察(Observation)。观察信息(用户指令、API 返回的数据、环境状态变化)是决策起点,处理后传给思考阶段。
  2. 思考(Thought):认知核心,由规划模块 + LLM 协同。
    • 规划与分解:规划模块接收观察,做高级策略制定,通过反思(Reflection)与自我批判(Self-criticism)等机制,把宏观目标分解为更具体、可执行的步骤。
    • 推理与决策:作为中枢的 LLM 接收规划模块的指令,并与记忆模块交互整合历史信息,进行深度推理,最终决策出下一步具体操作——通常表现为一个工具调用(Tool Call)。
  3. 行动(Action):由执行模块负责。LLM 生成的工具调用指令被发送到执行模块,该模块解析指令,从工具箱(Tool Use)中选择并调用合适的工具(代码执行器、搜索引擎、API 等)与环境交互。这个实际交互就是行动。
  4. 观察与循环:工具执行后返回工具结果(Tool Result)给 LLM,构成对行动效果的直接反馈;同时行动改变了环境,产生全新的环境状态。"工具结果"与"新环境状态"共同构成新一轮观察,被感知模块再次捕获;LLM 同时更新记忆(Memory Update),启动下一轮循环。

一句话记住这个架构:感知模块管输入、规划模块管拆解、LLM 管推理决策、记忆模块管历史、执行模块管调工具——五者咬合成"感知-思考-行动-观察"的永动环。

4.5 三大思潮与关键节点

三大思潮主导了不同时期的范式,最终在 21 世纪 20 年代以前所未有的方式融合:

思潮 核心主张 代表人物 标志成果
符号主义 智能 = 符号操作与逻辑推理 西蒙、明斯基 SHRDLU、专家系统、深蓝
联结主义 智能来自神经网络的权重学习 辛顿等 反向传播、CNN、Transformer
行为主义 智能来自与环境互动的试错学习 — TD-Gammon、AlphaGo
  • 行为主义(Behaviorism):强调智能体通过与环境的互动和试错来学习最优策略,其现代化身就是强化学习。从早期的 TD-Gammon 到与深度学习结合并击败人类顶尖棋手的 AlphaGo,这一流派为智能体赋予了"从经验中习得复杂决策行为"的能力。
  • 融合结果:以 GPT 系列为代表的大语言模型,其本身是联结主义的产物,却成为了执行符号推理、进行工具调用和规划决策的核心"大脑",形成了神经-符号结合的现代智能体架构——范式之间不是替代关系,而是层层叠加。
  • 生态参考:当前 AI Agent 技术栈图由 Letta 公司于 2024 年 11 月发布,对 Agent 相关工具、平台与服务做了分层分类,可作为技术选型的参考。

5. 高频考点 & 易错点速查

  1. PSSH 两个论断各记一句:充分性=物理符号系统够造通用智能;必要性=能展现通用智能的系统必然是物理符号系统。挑战其"充分性"的正是知识获取瓶颈、常识问题、框架问题、脆弱性。
  2. 知识库 vs 推理机是"知识/推理分离",别把推理机当知识存储;产生式规则 = IF-THEN。
  3. 正向链是数据驱动,反向链是目标驱动——MYCIN 用的是反向链(从"确定致病菌"倒推证据)。别记反。
  4. MYCIN 的两个数字:约 600 条规则;置信因子 CF 取值 -1 到 1。开发方是斯坦福大学。
  5. 专家系统衰落的根因不是推理不行,而是知识喂不完(知识获取瓶颈 + 无法编码内隐直觉知识 + 规则外的情况直接失灵)。
  6. SHRDLU 三大历史地位:综合集成(感知-思考-行动闭环的源头)、微观世界方法论、引发"符号处理 vs 真正理解"的长期思辨。它的强,恰恰因为它待在规则完备的封闭世界里。
  7. ELIZA 是"故意"不做理解的:魏泽鲍姆的设计目的是证伪,却意外造成"ELIZA 效应"。三条局限:无语义理解(否定词失效)、无状态、规则爆炸。
  8. 四步机制顺序不能乱:关键词优先级排序 → 分解规则(通配符 * 捕获)→ 代词转换 → 重组规则(随机选模板)。
  9. 明斯基的"智能体"是"无心的简单过程",与现代 Agent 定义不同——这是最容易掉进去的陷阱。GRASP 不知道"塔"是什么,智能行为是涌现的。
  10. 联结主义解决感知、RL 解决决策、预训练解决先验知识:三者解决的问题互不重叠,说"RL 能替代预训练"是典型错误。
  11. RL 的目标是最大化累积奖励(回报),不是即时奖励——"弃子"就是牺牲即时奖励的经典例子。五步循环中,第 5 步"更新策略"才是"学习"本身。
  12. 涌现能力的两个具体表现:上下文学习(Few-shot / Zero-shot,不改权重)、思维链(先输出推理步骤)。跨过的是参数量/数据量/计算量的门槛。
  13. 神经-符号结合:LLM 是联结主义产物,却用来做符号推理与工具调用——这是现代 Agent 架构的本质特征。
  14. 习题考点映射:① PSSH 两论断 + 谁挑战了充分性 + LLM 是否仍是物理符号系统;② MYCIN 未大规模临床化的技术/伦理/法律/接受度原因 + 何时规则系统仍优于深度学习;③ 扩展 ELIZA 规则与上下文记忆 + 与 ChatGPT 的本质差异 + 规则爆炸的数学解释;④ GRASP 失效的后果 + 心智社会与 CAMEL/MetaGPT/CrewAI 的异同 + LLM 时代理论是否仍适用;⑤ AlphaGo 的试错机制 + RL 与监督学习的数据需求差异 + 马里奥任务选型 + RL 在 LLM 训练中的作用;⑥ 预训练为何解决知识瓶颈 + 互联网数据的风险 + 该范式能否被取代;⑦ 智能代码审查助手在三个时代(1980s / 2015 / 当下)的三种设计对比。

6. 与前后章节的衔接

本章的输入是第 1 章给出的现代 Agent 定义与最小实现(Agent Loop、Thought-Action-Observation);本章补充的是这些设计"为什么是这样"的历史动因——符号主义留下"知识与推理分离"的架构直觉,心智社会留下"多智能体协作"的思想种子,联结主义与 RL 留下"用学习代替编码"的路线,预训练与涌现能力提供了让 Agent 重新可行的最后一块拼图。

下一章将聚焦大语言模型本身的基本概念与原理;本章建立的"神经-符号混合"框架,是后续记忆、规划、工具、多智能体等工程专题的共同底座。


7. 课后练习

在线试卷:https://md-quiz-online.app.workbuddy.host/

posted @ 2026-09-28 14:44  测试小罡  阅读(6)  评论(0)    收藏  举报