机器学习入门概述:从基础概念到建模全流程(超详细笔记)

大家好,这篇文章是我学习机器学习基础的完整笔记,涵盖 AI/ML/DL 关系、核心术语、算法分类、建模流程、特征工程、模型拟合等必备知识点,适合零基础入门、面试复习。


一、人工智能、机器学习、深度学习三者关系

1. 基本定义

  • AI(人工智能):用计算机模拟/替代人类大脑智能行为,是最大的范畴。
  • ML(机器学习):实现人工智能的核心方法,让机器从数据中自动学习规律,不需要手动写死规则
  • DL(深度学习):机器学习的一个分支,使用多层神经网络模拟人脑结构,处理复杂任务。

2. 包含关系

人工智能(AI) ⊃ 机器学习(ML) ⊃ 深度学习(DL)

深度学习是机器学习的进阶,机器学习是实现人工智能的主流途径。


二、两种学习方式:规则编程 vs 模型学习

1. 基于规则的学习

  • 人工编写 if-else 逻辑
  • 适合逻辑简单、规则明确的场景
  • 缺点:复杂场景(图像、语音、NLP)无法定义规则

2. 基于模型的学习

  • 从大量数据中自动学习规律
  • 模型自动拟合输入与输出的关系
  • 适合预测、分类、识别等复杂任务

三、机器学习核心基础术语

1. 样本 / 特征 / 标签

  • 样本(Sample):一行数据,代表一个实例。
  • 特征(Feature):一列数据,是用于预测的输入属性。
  • 标签(Label / Target):模型要预测的目标结果。

2. 数据集划分

  • 训练集(70%~80%):用于训练模型,学习规律。
  • 测试集(20%~30%):用于评估模型泛化能力。

标准表示:x_train / x_test(特征),y_train / y_test(标签)


四、机器学习四大算法分类

1. 有监督学习(有标签)

模型从带标签的数据中学习:

  • 分类:预测离散值(好坏瓜、猫狗识别、垃圾邮件)
  • 回归:预测连续值(房价、薪资、销量)

2. 无监督学习(无标签)

从无标签数据中发现结构:

  • 聚类:按相似度分组(用户分群、异常检测)
  • 降维:减少特征数量,保留核心信息

3. 半监督学习

少量标注数据 + 大量未标注数据

  • 大幅降低标注成本
  • 适合标注困难的场景

4. 强化学习

智能体通过与环境交互,获得最大奖励来学习策略:

  • 典型场景:AlphaGo、游戏AI、自动驾驶

五、标准机器学习建模流程(固定顺序)

1. 获取数据
   ↓
2. 数据基本处理(缺失值、异常值、去重)
   ↓
3. 特征工程
   ↓
4. 模型训练(选择算法、拟合数据)
   ↓
5. 模型评估(测试集验证)
   ↓
6. 在线服务 / 模型预测

注意:数据处理 + 特征工程 最耗时、最影响效果。


六、特征工程:决定模型上限的核心

1. 定义

使用专业知识与技巧处理数据,让模型效果达到最优

2. 核心名言

数据和特征决定机器学习的上限,模型和算法只是逼近这个上限。

3. 五大模块

  • 特征提取:从原始数据抽取有效信息
  • 特征预处理:统一量纲、标准化、归一化
  • 特征降维:降低维度,保留主要信息
  • 特征选择:筛选重要特征,不修改原始数据
  • 特征组合:多个特征合并生成更强特征

七、模型拟合:欠拟合 & 过拟合

1. 欠拟合(Underfitting)

  • 表现:训练集、测试集效果都差
  • 原因:模型太简单、特征太少
  • 解决:增加特征、提升模型复杂度

2. 过拟合(Overfitting)

  • 表现:训练集极好,测试集很差
  • 原因:模型太复杂、数据噪声大、样本少
  • 解决:正则化、特征降维、增加数据、简化模型

3. 泛化能力

模型在从未见过的新数据上的表现能力。


八、AI 发展三要素与工具

1. 三要素

  • 数据:模型学习的基础
  • 算法:学习规律的方法
  • 算力:训练模型的硬件支撑

2. 算力硬件

  • CPU:适合 I/O 密集任务
  • GPU:适合计算密集任务
  • TPU:大模型训练专用

3. 核心工具:scikit-learn

  • Python 机器学习标准库
  • 支持分类、回归、聚类、降维、模型选择
  • 安装:pip install scikit-learn

九、机器学习发展关键节点

  • 1956 年:AI 元年
  • 2012 年:AlexNet 开启深度学习浪潮
  • 2017 年:Transformer 架构出现
  • 2022 年:ChatGPT 引爆 AIGC 时代

十、高频面试题(可直接背诵)

  1. AI、ML、DL 是什么关系?
    包含关系:AI ⊃ ML ⊃ DL。机器学习是AI的实现方法,深度学习是ML的分支。

  2. 什么是特征工程?为什么重要?
    特征工程是处理数据让模型效果最优的过程。数据与特征决定模型上限。

  3. 过拟合和欠拟合的区别?
    欠拟合:训练测试都差,模型太简单。
    过拟合:训练好、测试差,模型太复杂。

  4. 数据集为什么要分训练集和测试集?
    训练集学规律,测试集看泛化能力,避免过拟合。


总结

这篇笔记覆盖了机器学习最核心的入门知识,适合:

  • 零基础入门学习
  • 面试前快速复习
  • 搭建机器学习知识体系

后续我会继续更新 RAG、大模型应用开发、Python 机器学习实战 等内容,欢迎关注交流~

posted @ 2026-05-24 08:44  Petula  阅读(96)  评论(0)    收藏  举报