大模型基础概念

 一、大模型基础概念
1.1 大模型是什么?
🤖 核心定义:
├─ LLM(Large Language Model): 大语言模型
├─ 基于Transformer架构的深度学习模型
├─ 通过海量数据训练的神经网络
└─ 具备自然语言理解和生成能力
 
💡 市场代表性模型:
├─ DeepSeek: 中国开源大模型
├─ LLM: 通用大语言模型统称
├─ 元宝(百度): 闭源大模型
├─ 豆包(字节跳动): 闭源大模型
└─ 通义千问(阿里): 开源+闭源
1.2 大模型存在的意义
🎯 技术层面:
├─ 推动AI领域技术突破
├─ 自然语言处理能力质变
├─ 多模态融合能力
└─ 从感知智能到认知智能
 
🏭 产业层面:
├─ 推动传统产业智能化升级
├─ 创造新的商业模式
├─ 提高生产效率
└─ 降低技术应用门槛
 
🌍 社会层面:
├─ 加速社会智能化进程
├─ 改变人机交互方式
├─ 提升信息获取效率
└─ 促进AI民主化应用
 
🔧 二、技术核心原理
2.1 大模型参数
📊 参数的本质:
├─ 通过海量数据训练得到的内部数值
├─ 存储知识关联和语义信息
├─ 决定模型处理信息的方式
└─ 参数量 = 模型容量和智能程度
2.2 Transformer架构
🔄 工作流程:
├─ Encoder(编码器):
│ ├─ 接收输入序列
│ ├─ 处理序列特征
│ └─ 生成编码矩阵
└─ Decoder(解码器):
├─ 接收Encoder编码矩阵
├─ 逐步生成输出
└─ 自回归生成
 
💡 关键概念:
├─ Self-Attention: 自注意力机制
├─ Multi-Head Attention: 多头注意力
├─ Positional Encoding: 位置编码
└─ Layer Normalization: 层归一化
 
📊 三、数据处理关键步骤
3.1 数据处理五大步骤
1️⃣ 数据清洗
├─ 去重: 删除重复数据
├─ 去噪: 删除无用信息
└─ 去毒: 删除有害内容
 
2️⃣ 数据格式化
├─ UTF8编码: 统一字符编码
├─ JSON格式: 结构化数据存储
└─ 数据标准化处理
 
3️⃣ 数据分词
└─ Tokenization: 文本转Token序列
 
4️⃣ 数据混合
├─ 控制来源平衡比例
├─ 动态采样策略
└─ 高质量数据加权
 
5️⃣ 数据压缩
├─ 最小哈希: 降低存储空间
└─ 布隆过滤器: 快速查看数据
 
🏢 四、开源 vs 闭源大模型
4.1 模型分类
🔓 开源大模型:
├─ DeepSeek (DB)
├─ Qwen (阿里开源)
├─ 混元 (HY)
└─ Hugging Face托管
 
🔒 闭源大模型:
├─ OpenAI (GPT系列)
├─ Meta (Llama)
├─ 元宝(百度)
└─ 豆包、通义等
4.2 模型资源平台
🤗 Hugging Face:
├─ 地址: https://huggingface.co/models
├─ 全球最大的开源模型库
├─ 提供模型权重和社区支持
└─ 覆盖NLP、CV、多模态
 
🇨🇳 魔塔社区:
├─ 地址: https://modelscope.cn/models
├─ 国内领先的开源模型平台
├─ 聚焦中文模型
└─ 提供模型评测和下载
 
💾 五、显存估算
5.1 显存估算公式
📐 公式:
M = (P × Q) / 8 × 1.2
 
参数说明:
M: 显存需求(GB)
P: 模型参数量(如13B = 13×10⁹)
Q: 量化位数
├─ FP16 = 16位
├─ INT8 = 8位
└─ FP32 = 32位
1.2: 缓冲系数(考虑中间计算)
5.2 示例计算
📊 13B模型FP16部署:
 
计算过程:
M = (13 × 10⁹ × 16) / 8 × 1.2
= (208 × 10⁹) / 8 × 1.2
= 26 × 10⁹ × 1.2
= 31.2 × 10⁹ 字节
= 31.2 GB
 
结果:约31.2GB显存需求
 
📊 13B模型INT8量化:
 
计算过程:
M = (13 × 10⁹ × 8) / 8 × 1.2
= (104 × 10⁹) / 8 × 1.2
= 13 × 10⁹ × 1.2
= 15.6 GB
 
结果:约15.6GB显存需求(节省50%)
 
🚀 六、大模型安装部署
6.1 云平台选择
☁️ AutoDL:
├─ 特点: 专注GPU租赁
├─ 优势: 价格低、选择多、按小时计费
├─ 适用: 学生学习、个人研究
└─ 缺点: 需要自己配置环境
 
☁️ 腾讯云:
├─ 特点: 国内大厂,稳定可靠
├─ 优势: 服务稳定、技术支持好
├─ 适用: 企业生产、商业部署
└─ 缺点: 价格相对较高
6.2 部署技术
🛠️ oLLama:
├─ 开源的本地LLM部署工具
├─ 支持多种开源模型
├─ 轻量级,易于使用
└─ 支持API接口调用
 
🏗️ 集群部署:
├─ 多GPU并行推理
├─ 负载均衡
├─ 高可用架构
└─ 横向扩展能力
 
🔬 七、微调技术
7.1 微调核心概念
🎯 定义:
├─ 对预训练模型的进一步训练
├─ 特定任务领域的优化
├─ 提升特定场景性能
└─ 适应特定应用需求
 
📈 优势:
├─ 数据需求小(vs从头训练)
├─ 训练成本降低
├─ 训练时间缩短
└─ 快速适应新场景
7.2 微调分类
1️⃣ 全参数微调
├─ Full Fine-tuning
├─ 微调全部模型参数
├─ 优势: 效果最好
├─ 劣势: 计算和存储需求大
└─ 适用: 有充足资源的场景
 
2️⃣ 参数高效微调
├─ Parameter-Efficient Fine-tuning (PEFT)
├─ 只微调部分参数
├─ 优势: 计算需求小、存储要求低
├─ 劣势: 效果略逊于全参数
└─ 适用: 资源有限的场景
7.3 微调工具链
🛠️ 开源工具:
├─ Hugging Face Transformers
│ ├─ 最流行的微调框架
│ ├─ 支持PEFT库
│ └─ 丰富的模型库
 
├─ PEFT(Hugging Face)
│ ├─ 参数高效微调库
│ ├─ 支持LoRA、QLoRA等
│ └─ 降低显存需求
 
└─ LLaMA-Factory
├─ 轻量级微调工具
├─ 易于使用
└─ 支持多种模型
 
🏢 商业平台:
├─ 阿里云PAI
│ ├─ 提供完整的微调服务
│ ├─ 可视化操作
│ └─ 适合企业用户
 
├─ 硅基流动
│ ├─ 专注AI模型训练
│ ├─ 专业的技术支持
│ └─ 按需计费
 
└─ 科飞星辰
├─ 国产微调平台
├─ 支持中文模型
└─ 本土化服务
7.4 数据集制作
📊 Easy Dataset:
├─ 开源数据集制作工具
├─ 简化数据处理流程
├─ 支持多种数据格式
└─ 可视化数据预览
 
💡 数据集制作流程:
├─ 数据收集
├─ 数据清洗
├─ 数据标注
├─ 数据划分
└─ 数据质量评估
 
⚙️ 八、微调超参数
8.1 Model Side参数
🤖 模型侧参数:
├─ 选择适合的预训练模型
├─ 确定模型架构
├─ 设置层结构
└─ 初始化参数
 
💡 选择原则:
├─ 任务匹配度
├─ 数据量要求
├─ 资源限制
└─ 目标性能
8.2 训练参数
🔄 Number of Epochs(训练轮数):
├─ 定义: 完整遍历数据集的次数
├─ 选择策略:
│ ├─ 数据量小: 较多轮数(10-20)
│ ├─ 数据量大: 较少轮数(3-5)
│ └─ 避免过拟合
└─ 典型值: 3-10轮
 
📊 Learning Rate(学习率):
├─ 定义: 参数更新的步长
├─ 选择范围:
│ ├─ 推荐: 1e-5 ~ 1e-4
│ ├─ 过大: 不稳定
│ └─ 过小: 收敛慢
└─ 常用值: 5e-5
 
🎯 Batch Size(批次大小):
├─ 定义: 每次训练的样本数
├─ 影响因素:
│ ├─ 显存限制
│ ├─ 训练稳定性
│ └─ 训练速度
└─ 常用值: 4-8(根据显存调整)
posted @ 2026-03-25 18:30  牛粪也香  阅读(29)  评论(0)    收藏  举报