生成式AI时代下的机器学习(2025)_李宏毅 | 第一讲_一堂课搞懂生成式人工智能的技术突破与未来发展

目录

  • 1 前置知识
  • 2 生成式 AI 有什么样的行为
  • 3 生成式 AI 运作机制
  • 4 生成式 AI 怎么产生出来的
  • 5 生成式 AI 怎么赋予新的能力

1 前置知识

生成式 AI 导论 2024
https://www.youtube.com/playlist?list=PLJV_el3uVTsPz6CTopeRp2L2t4aL_KgiI
(至少看到第八讲,能看完最好)

机器学习 2021
https://www.youtube.com/playlist?list=PLJV_el3uVTsMhtt7_Y6sgTHGHp1Vb2P2J
(至少看到“Transformer(下)”,能看完最好)

2 生成式 AI 有什么样的行为

2.1 生成一段讲课视频

从一张投影片开始……
GitHub: https://github.com/mtkresearch/BreezyVoice
Paper: https://arxiv.org/abs/2501.17790
image

ChatGPT → 生成讲稿
Breezy Voice → 生成声音
HeyGen → 生成视频

让生成式 AI 制作投影片?
内容空洞,不够有趣,但勉强合格

2.2 机器展现“思考”(Reasoning)的过程

image

Claude → 擅长写程序、画可视化图片、做网页

2.3 未来 AI 工作方式将不再局限于一问一答

很多任务往往无法一步完成

AI Agent:可以执行需要多个步骤完成的工作

  • 能够从经验中学习
  • 使用工具的能力
  • 具备规划能力

作业一:让 AI 上网搜寻后回答问题

Deep Research
ChatGPT、Gemini、Perplexity 都有

Claude Computer Use / ChatGPT Operator
不只是生成,还能操控物件(先从数据世界中鼠标、键盘开始)
image

开发机器学习模型也需要多步骤

image

详见第二讲
作业二:让 AI Agent 开发机器学习模型

3 生成式 AI 运作机制

3.1 生成式人工智能(Generative AI)基本原理

输入 \(x\)(文字/图片/声音),输出 \(y\)(文字/图片/声音)

基本单位:Token

复杂物件由有限的基本单位(如方块字/像素/取样点)构成 \(y=\{y_1,y_2,...,y_i,...\}\)
共性:有限选择(方块字总数/一张图片的像素(或其他单位)总数/每个 bite(或其他单位)承载取样点的数值),组合出无穷可能

GenAI 的基本单位:Token
image

所有复杂物件都可以写成 \(y=\{y_1,y_2,...,y_i,...\}\)

基本原理

image

Autoregressive Generation(“文字”接龙):根据固定的次序每次只产生一个 \(y_i\)
如果 Token 是文字 → 语言模型(其实现在语音模型图片模型都被统称为语言模型)
image

3.2 让机器思考

类神经网络(Neural Network)

函式 \(f\) 产生下一个 Token 的几率分布
image

类神经网络即深度学习(Deep Learning):把一个问题拆解成 \(L\)(layer 数目)个步骤

\(f\) 拆解为 \(f_1\)\(f_L\) 的串联
image

为什么要“深度”?

从指数级到多项式级的转换
image

从数学上说明:Deep Learning Theory 课程 https://www.youtube.com/watch?v=KKT2VkTdFyc&list=PLJV_eL3uVTsOh1F5eo9txATa4iww0Kp8K

为什么让机器“思考”会有用

让机器“思考”也是另外一种“深度”

Testing Time Scaling:困难的问题需要思考很多步,Layer 不够——拓展思考问题的长度
Refer to ALBERT https://arxiv.org/abs/1909.11942
image

o1 https://openai.com/index/learning-to-reason-with-llms/
image

s1: Simple test-time scaling https://arxiv.org/abs/2501.19393
image

3.3 Transformer

一个 Layer 中又发生了什么事

Layer 套娃
Self-attention Layer:考虑全部输入产生输出
Layer:根据单点做思考
image

详见第三讲作业三

Transformer:内置 Self-attention Layer

Transformer 的限制

过长输入可能导致 Transformer 运作出现问题:Self-attention Layer 需要看过整个输入后产生输出

解决方法:Transformer 结合 Mamba (and its friends)

详见第四讲

4 生成式 AI 怎么产生出来的

4.1 类神经网络:架构 vs. 参数

已知:
\(\{z_1,z_2,...,z_{t-1}\}\rightarrow z_t\)
\(z_t=f(z_1,z_2,...,z_{t-1})\)

\(z_t=f_L(...f_2(f_1(z_1,z_2,...,z_{t-1})))\)
架构:每一层处理完传给下一层
参数:决定实际处理

架构 (architecture)

又称超参数 (hyperparameter)
由开发者(人类)决定:天生资质

参数 (parameter)

由训练资料决定:后天学习

参数的数量:架构的一部分
参数的数值:需通过训练资料学习

以下通过 \(f_{θ}\) 中的 \(θ\) 表示类神经网络中的参数

参数数量

单位 b:billion
7b 模型:7 billion 参数的模型

4.2 找出参数(训练模型)

准备训练资料

image

找训练资料

寻找让 \(f_{θ}\) 最能满足训练资料的一组参数 \(θ\)
image

从而输出几率分布
image

作业四

4.3 机器学习中的分类 (Classification) 问题

即有限选择题,如信用卡盗刷检测(是/否)、垃圾邮件检测(是/否)、下围棋(19×19落子位置)

生成式人工智能不是新的问题

翻译系统也是一种生成式人工智能的表现(专才)

现在的人工智能(通才)

  • 需要说清楚你要干嘛(Prompt)

4.4 这些通用模型是怎么被发展起来的

不同语言共用模型

通用翻译语言:把任何语言翻译为机器内部语言,有可能翻译没见过的语言对

Zero-Shot Translation with Google's Multilingual Neural Machine Translation System (2016) https://research.google/blog/zero-shot-translation-with-googles-multilingual-neural-machine-translation-system/

image

image

模型确实存在机器内部语言
image

不同任务共用模型

The Natural Language Decathlon: Multitask Learning as Question Answering https://arxiv.org/abs/1806.08730
image

通用机器学习模型不同形态

第一形态 (2018-2019)

编码器 (Encoder)
需要接入特化模型
image

第二形态 (2020-2022)

有完整的文字生成功能
需要微调参数 (Fine-tune)
架构相同但参数不同
image

第三形态 (2023-)

不需要调整
架构相同、参数相同
image

如何打造这样的模型?……
可以参考生成式 AI 导论 2024 https://youtube.com/playlist?list=PLJV_el3uVTsPz6CTopeRp2L2t4aL_KgiI&si=F8l9nG4cXcuvtGkU
image

在文字以外的模型也适用

第一形态

image

Useful Toolkit!
The S3PRL toolkit https://github.com/s3prl
image

一系列模型的发展历史:Speech processing Universal PERformance Benchmark https://arxiv.org/abs/2205.10643

第二形态

image

发展史 https://ga642381.github.io/SpeechPrompt/

第三形态

image

DeSTA2 https://kehanlu.github.io/DeSTA2/

5 生成式 AI 怎么赋予新的能力

5.1 机器的终身学习 (Life-long Learning) 时代

参考 2019 机器学习
https://www.youtube.com/watch?v=CXgbekl66jc&list=PLJV_el3uVTsPy9oCRY30oBPNLCo89yu49

https://youtu.be/XnyM3-xtxHs

给 AI 提供固定参数,让具备基本通用能力的模型负担某些任务
相关信息不会永远改变模型的行为

微调 (Fine-tune):通过调整模型(改变参数) 让 AI 永久具备新技能
有可能破坏原有的能力
应该先确定不微调就无法具备目标能力时才选择微调

微调 (Fine-tune)

ChatGPT 微调参数界面 https://platform.openai.com/docs/guides/fine-tuning
上传训练资料

微调后模型的回答可能是胡言乱语,或是针对非特定输入输出同样的输出
image

参考第六讲作业六

模型编辑 (Model Edition)

类神经网络编辑:找出与特定问题有关的参数,手动修改参数
image

参考第八讲作业八

模型合并(Model Merging)

image

参考第九讲作业九

posted @ 2026-03-14 20:41  Guanz  阅读(384)  评论(0)    收藏  举报