从零构建大模型-第一章:理解大语言模型
已经是不知道多少遍学这本书了,每次都半途而废,这次不要再半途而废了好吗老己?
目录
- 什么是大语言模型
- 大语言模型的应用
- 构建和使用大语言模型
- transformer介绍
- 利用大型数据集
- 深入剖析gpt架构
- 构建大语言模型
- 小结
大语言模型属于深度神经网络,通过大规模的文本数据训练而成。LLM的构建包括预训练和微调两个阶段,预训练时模型会在大规模的数据集上进行训练,形成全面的理解能力。微调阶段会在规模比较小的特定领域数据集上进行针对性训练,提升特定能力。
预训练后的LLM称为基模,微调最流行的两种方法是指令微调(“指令-答案”对)以及分类任务微调(文本及类别标签)。
Transformer
该架构由编码器encoder和解码器decoder组成。
- 编码器:将输入文本标识为一系列数值或向量,捕捉上下文信息。
- 解码器:接收编码向量,生成输出文本。
二者都由多层组成,通过自注意力(self-attention)机制连接。自注意力机制允许模型衡量序列中不同单词之间的相对重要性,捕捉长距离依赖和上下文关系。

浙公网安备 33010602011771号