hello-agent 学习打卡 Task02 0916
阅读《智能体发展史》
https://github.com/datawhalechina/hello-agents/blob/main/docs/chapter2/第二章 智能体发展史.md

范式
deepseek给出的定义:一套被广泛接受的、用于定义问题、解决问题和评估结果的理论框架与操作规范”。它不只是一种具体技术,而是某个时期整个领域共同遵循的“世界观”和“方法论”。
涌现(Emergence)
复杂的、有目的性的智能行为,并非由某个高级智能体预先规划,而是从大量简单的底层智能体之间的局部交互中自发产生的。
范式转换,可以理解成整个架构/规则转变
范式1:符号主义
逻辑AI
物理符号系统假说PhysicalSymbol SystemHypothesis, PSSH
核心:智能的本质,就是符号的计算与处理
瓶颈:常识知识与知识获取瓶颈,框架问题与系统脆弱性
典型应用:
a. 专家系统Expert System, 由知识库、推理机组成
b. SHRDLU: 自然语言给出指令,系统在虚拟世界模型中执行
c. 聊天机器人ELIZA 借助模式匹配和文本替换,和调用者互动
范式2:联结主义Connectionism
灵感来源于对生物大脑神经网络结构的模仿, 解决了感知问题
a. 知识的分布式表示
b. 简单的处理单元
c. 通过学习调整权重

范式3:强化学习(Reinforcement Learning, RL)
通过智能体与环境的直接交互,在“试错”中学习如何最大化其长期收益
赋予了智能体从交互中学习决策策略
典型示例:AlphaGo
范式4:预训练与微调(Pre-training, Fine-tuning)
从特定任务到通用模型
主要阶段:
a. 预训练阶段, 通过自监督学习(Self-supervised Learning)的方式训练一个超大规模的神经网络模型
b. 微调阶段, 针对特定的下游任务,只需使用少量该任务的标注数据对模型进行微调
演变:经过在数万亿级别的文本上进行预训练,大型语言模型的神经网络权重实际上已经构建了一个关于世界知识的、高度压缩的隐式模型。
成了一个兼具海量知识库和通用推理引擎双重角色的组件。
涌现新的能力:
a. 上下文学习(In-context Learning):不需要或少量提示,就能回答
b. 思维链(Chain-of-Thought)推理:引导一步步推理,提高准确性
范式5:基于大语言模型的智能体
不仅能够理解和生成人类语言,还能够通过与环境的交互,自主地感知、规划、决策和执行任务
感知 --> 观察 --> 思考:规划分解(Plan)、推理决策(LLM)--> 行动 --> 观察、循环
待深入



浙公网安备 33010602011771号