生成式AI时代下的机器学习(2025)_李宏毅 | 第一讲_一堂课搞懂生成式人工智能的技术突破与未来发展
目录
- 1 前置知识
- 2 生成式 AI 有什么样的行为
- 3 生成式 AI 运作机制
- 4 生成式 AI 怎么产生出来的
- 5 生成式 AI 怎么赋予新的能力
1 前置知识
生成式 AI 导论 2024
https://www.youtube.com/playlist?list=PLJV_el3uVTsPz6CTopeRp2L2t4aL_KgiI
(至少看到第八讲,能看完最好)
机器学习 2021
https://www.youtube.com/playlist?list=PLJV_el3uVTsMhtt7_Y6sgTHGHp1Vb2P2J
(至少看到“Transformer(下)”,能看完最好)
2 生成式 AI 有什么样的行为
2.1 生成一段讲课视频
从一张投影片开始……
GitHub: https://github.com/mtkresearch/BreezyVoice
Paper: https://arxiv.org/abs/2501.17790

ChatGPT → 生成讲稿
Breezy Voice → 生成声音
HeyGen → 生成视频
让生成式 AI 制作投影片?
内容空洞,不够有趣,但勉强合格
2.2 机器展现“思考”(Reasoning)的过程

Claude → 擅长写程序、画可视化图片、做网页
2.3 未来 AI 工作方式将不再局限于一问一答
很多任务往往无法一步完成
AI Agent:可以执行需要多个步骤完成的工作
- 能够从经验中学习
- 有使用工具的能力
- 具备规划能力
作业一:让 AI 上网搜寻后回答问题
Deep Research
ChatGPT、Gemini、Perplexity 都有
Claude Computer Use / ChatGPT Operator
不只是生成,还能操控物件(先从数据世界中鼠标、键盘开始)

开发机器学习模型也需要多步骤

详见第二讲
作业二:让 AI Agent 开发机器学习模型
3 生成式 AI 运作机制
3.1 生成式人工智能(Generative AI)基本原理
输入 \(x\)(文字/图片/声音),输出 \(y\)(文字/图片/声音)
基本单位:Token
复杂物件由有限的基本单位(如方块字/像素/取样点)构成 \(y=\{y_1,y_2,...,y_i,...\}\)
共性:有限选择(方块字总数/一张图片的像素(或其他单位)总数/每个 bite(或其他单位)承载取样点的数值),组合出无穷可能
GenAI 的基本单位:Token

所有复杂物件都可以写成 \(y=\{y_1,y_2,...,y_i,...\}\)
基本原理

Autoregressive Generation(“文字”接龙):根据固定的次序每次只产生一个 \(y_i\)
如果 Token 是文字 → 语言模型(其实现在语音模型图片模型都被统称为语言模型)

3.2 让机器思考
类神经网络(Neural Network)
函式 \(f\) 产生下一个 Token 的几率分布

类神经网络即深度学习(Deep Learning):把一个问题拆解成 \(L\)(layer 数目)个步骤
将 \(f\) 拆解为 \(f_1\) 到 \(f_L\) 的串联

为什么要“深度”?
从指数级到多项式级的转换

从数学上说明:Deep Learning Theory 课程 https://www.youtube.com/watch?v=KKT2VkTdFyc&list=PLJV_eL3uVTsOh1F5eo9txATa4iww0Kp8K
为什么让机器“思考”会有用
让机器“思考”也是另外一种“深度”
Testing Time Scaling:困难的问题需要思考很多步,Layer 不够——拓展思考问题的长度
Refer to ALBERT https://arxiv.org/abs/1909.11942

o1 https://openai.com/index/learning-to-reason-with-llms/

s1: Simple test-time scaling https://arxiv.org/abs/2501.19393

3.3 Transformer
一个 Layer 中又发生了什么事
Layer 套娃
Self-attention Layer:考虑全部输入产生输出
Layer:根据单点做思考

详见第三讲及作业三
Transformer:内置 Self-attention Layer
Transformer 的限制
过长输入可能导致 Transformer 运作出现问题:Self-attention Layer 需要看过整个输入后产生输出
解决方法:Transformer 结合 Mamba (and its friends)
详见第四讲
4 生成式 AI 怎么产生出来的
4.1 类神经网络:架构 vs. 参数
已知:
\(\{z_1,z_2,...,z_{t-1}\}\rightarrow z_t\)
\(z_t=f(z_1,z_2,...,z_{t-1})\)
\(z_t=f_L(...f_2(f_1(z_1,z_2,...,z_{t-1})))\)
架构:每一层处理完传给下一层
参数:决定实际处理
架构 (architecture)
又称超参数 (hyperparameter)
由开发者(人类)决定:天生资质
参数 (parameter)
由训练资料决定:后天学习
参数的数量:架构的一部分
参数的数值:需通过训练资料学习
以下通过 \(f_{θ}\) 中的 \(θ\) 表示类神经网络中的参数
参数数量
单位 b:billion
7b 模型:7 billion 参数的模型
4.2 找出参数(训练模型)
准备训练资料

找训练资料
寻找让 \(f_{θ}\) 最能满足训练资料的一组参数 \(θ\)

从而输出几率分布

作业四
4.3 机器学习中的分类 (Classification) 问题
即有限选择题,如信用卡盗刷检测(是/否)、垃圾邮件检测(是/否)、下围棋(19×19落子位置)
生成式人工智能不是新的问题
翻译系统也是一种生成式人工智能的表现(专才)
现在的人工智能(通才)
- 需要说清楚你要干嘛(Prompt)
4.4 这些通用模型是怎么被发展起来的
不同语言共用模型
通用翻译语言:把任何语言翻译为机器内部语言,有可能翻译没见过的语言对
Zero-Shot Translation with Google's Multilingual Neural Machine Translation System (2016) https://research.google/blog/zero-shot-translation-with-googles-multilingual-neural-machine-translation-system/


模型确实存在机器内部语言

不同任务共用模型
The Natural Language Decathlon: Multitask Learning as Question Answering https://arxiv.org/abs/1806.08730

通用机器学习模型不同形态
第一形态 (2018-2019)
编码器 (Encoder)
需要接入特化模型

第二形态 (2020-2022)
有完整的文字生成功能
需要微调参数 (Fine-tune)
架构相同但参数不同

第三形态 (2023-)
不需要调整
架构相同、参数相同

如何打造这样的模型?……
可以参考生成式 AI 导论 2024 https://youtube.com/playlist?list=PLJV_el3uVTsPz6CTopeRp2L2t4aL_KgiI&si=F8l9nG4cXcuvtGkU

在文字以外的模型也适用
第一形态

Useful Toolkit!
The S3PRL toolkit https://github.com/s3prl

一系列模型的发展历史:Speech processing Universal PERformance Benchmark https://arxiv.org/abs/2205.10643
第二形态

发展史 https://ga642381.github.io/SpeechPrompt/
第三形态

DeSTA2 https://kehanlu.github.io/DeSTA2/
5 生成式 AI 怎么赋予新的能力
5.1 机器的终身学习 (Life-long Learning) 时代
参考 2019 机器学习:
https://www.youtube.com/watch?v=CXgbekl66jc&list=PLJV_el3uVTsPy9oCRY30oBPNLCo89yu49
给 AI 提供固定参数,让具备基本通用能力的模型负担某些任务
相关信息不会永远改变模型的行为
微调 (Fine-tune):通过调整模型(改变参数) 让 AI 永久具备新技能
有可能破坏原有的能力
应该先确定不微调就无法具备目标能力时才选择微调
微调 (Fine-tune)
ChatGPT 微调参数界面 https://platform.openai.com/docs/guides/fine-tuning
上传训练资料
微调后模型的回答可能是胡言乱语,或是针对非特定输入输出同样的输出

参考第六讲及作业六
模型编辑 (Model Edition)
类神经网络编辑:找出与特定问题有关的参数,手动修改参数

参考第八讲及作业八
模型合并(Model Merging)

参考第九讲及作业九

浙公网安备 33010602011771号