神经网络基础 超全学习笔记

一、神经网络基本概念

1. 什么是人工神经网络

人工神经网络(ANN)模仿生物神经元结构与工作方式:
生物神经元通过树突接收信号、加权处理后由轴突输出;
人工神经元则做加权求和 + 激活函数,是深度学习网络的最小单元。

2. 网络三层核心结构

  • 输入层:接收原始特征数据(图像、文本、表格特征)
  • 隐藏层:多层非线性特征提取,网络“深度”由隐藏层数决定
  • 输出层:输出最终预测(分类概率/回归数值)

网络规则:

  • 层与层之间全连接,同层神经元无连接
  • 数据单向前向传播
  • 每一组连接都有权重 w 和偏置 b

3. 神经元两个关键值

  • 内部状态值z = W·x + b 加权求和结果
  • 激活值a = f(z) 经激活函数做非线性变换后的输出

二、激活函数详解

1. 激活函数核心作用

给网络引入非线性
如果不用激活函数,再深的网络也等价于线性模型,无法拟合复杂任务。

2 四大常用激活函数

Sigmoid

  • 映射范围:(0, 1)
  • 缺点:非0中心、深层易梯度消失
  • 适用:二分类输出层

Tanh

  • 映射范围:(-1, 1)
  • 优点:以0为中心,收敛比Sigmoid快
  • 缺点:仍存在梯度消失
  • 适用:隐藏层替代Sigmoid

ReLU

  • 规则:小于置0,大于不变
  • 优点:计算简单、缓解梯度消失
  • 缺点:存在神经元死亡问题
  • 适用:隐藏层首选

Softmax

  • 输出归一化概率,所有值之和为1
  • 适用:多分类输出层

3. 激活函数选择口诀

  • 隐藏层:优先 ReLU
  • 输出层:二分类用Sigmoid、多分类用Softmax、回归不用激活

三、网络参数初始化

1. 基础初始化方式

均匀分布、正态分布、全0、全1、固定值初始化。

2. 工业级高级初始化

  • Xavier(Glorot):适配 Sigmoid / Tanh
  • Kaiming(He):适配 ReLU 系列,深度学习最常用

3 初始化选择原则

  • Sigmoid/Tanh → 用Xavier
  • ReLU → 用Kaiming
  • 深层网络禁止全0/全1随机初始化

四、损失函数分类

1. 分类任务损失

  • 多分类:nn.CrossEntropyLoss(自带Softmax)
  • 二分类:nn.BCELoss 配合Sigmoid使用

2. 回归任务损失

  • MAE(L1):平均绝对误差,零点不平滑
  • MSE(L2):均方误差,误差大时梯度易爆炸
  • SmoothL1:融合L1/L2优点,平稳不易爆炸

五、网络优化与反向传播

1. 梯度下降核心思想

梯度负方向更新参数,不断缩小损失值;
学习率太大容易震荡不收敛,太小收敛太慢。

2 训练三大概念

  • Epoch:使用全部数据训练一轮
  • Batch:每次迭代一小批样本
  • Iteration:一个Batch完成一次参数更新

3. 反向传播BP算法

前向传播计算损失 → 反向利用链式法则求梯度 → 逐层更新权重和偏置。

4 主流优化器

  • Momentum:加入动量,平滑梯度、冲出鞍点
  • AdaGrad:自适应学习率,后期学习率易过小
  • RMSProp:改进AdaGrad,工业常用
  • Adam:融合动量+自适应学习率,默认首选优化器

5 学习率衰减策略

  • StepLR:等间隔衰减
  • MultiStepLR:指定轮次衰减
  • ExponentialLR:指数连续衰减

六、正则化(解决过拟合)

1. Dropout 随机失活

训练时随机让部分神经元停止工作,减少神经元依赖;
测试时关闭Dropout,不随机失活。

2. BN 批量归一化

对批次数据做标准化 + 缩放平移
作用:加速收敛、提升泛化能力、缓解过拟合。


七、实战:手机价格多分类案例

1 业务需求

根据手机20项硬件特征,预测4个价格区间,属于多分类任务

2 完整开发流程

  1. 读取数据集、划分训练集/测试集
  2. 构造Dataset和DataLoader数据加载器
  3. 搭建全连接神经网络
  4. 设置损失函数、优化器
  5. 循环训练、保存模型
  6. 加载模型、评估测试集准确率

3 网络结构

输入20维 → 128神经元 → 256神经元 → 输出4分类,全程ReLU激活。

4 模型效果与调优方向

  • 初始准确率:64.25%
  • 提升方法:
    更换Adam优化器、调小学习率、特征标准化、增加网络层数、加入Dropout/BN。

八、学习总结

  1. 神经网络由输入层、隐藏层、输出层组成,依靠加权求和+激活函数实现非线性拟合;
  2. ReLU是隐藏层标配,Sigmoid/Softmax分别用于二分类、多分类输出层;
  3. 参数初始化优先Kaiming/Xavier,深层网络不能简单随机置零;
  4. 分类用交叉熵、回归用MAE/MSE/SmoothL1;
  5. Adam是最实用优化器,配合学习率衰减效果更好;
  6. 过拟合可用 Dropout、BN 正则化解决;
  7. 掌握全连接网络搭建、训练、评估流程,是深度学习入门必备。
posted @ 2026-05-21 08:58  Petula  阅读(57)  评论(0)    收藏  举报