机器学习的基础
一、基础
1、机器学习(ML)本质上就是让计算机自己在数据中学习规律,并根据所得到的规律对未来数据进行预测,包括如聚类、分类、决策树、贝叶斯、神经网络、深度学习(Deep Learning)等算法。
2、监督学习:从有标签的训练数据中学习模型,然后对某个给定的新数据利用模型预测它的标签。分类标签精确度越高,学习模型准确度越高,预测结果越准确。
监督学习主要用于回归和分类。
回归:预测连续的具体的数值。线性回归、回归树、K近邻、Adaboost、神经网络。
分类:预测非连续的、离散的数据。朴素贝叶斯、决策树、SVM、逻辑回归、K近邻、Adaboost、神经网络。
3、半监督学习:利用少量标注数据和大量无标注数据进行机器学习的模式。
在有监督的分类算法中加入无标记样本来实现半监督分类。
半监督学习算法有Pseudo-Label、Π-Model、Temporal Ensembling、Mean Teacher、VAT、UDA、MixMatch、ReMixMatch、FixMatch等。
4、无监督学习:是从未标注数据中寻找隐含结构的过程。
无监督学习主要用于关联分析、聚类和降维。
常见的无监督学习算法有稀疏自编码(Sparse Auto-Encoder)、主成分分析(Principal Component Analysis, PCA)、K-Means算法(K均值算法)、DBSCAN算法(Density-Based Spatial Clustering of Applications with Noise)、最大期望算法(Expectation-Maximization algorithm, EM)等。
5、强化学习:未使用样本数据进行训练,通过不断试错进行的模式
两个交互对象:智能体和环境
四个核心要素:策略、汇报函数、价值函数、环境模型
场景:机器人避障、棋牌类游戏、广告和推荐等
6、术语
模型:通过应用一些机器学习的算法从数据中学习的特定表示,模型也叫假设。
特征:数据的单独可测量属性。选择信息性、区分性、独立性是有效算法的关键步骤。
目标(标签):模型预测值。
训练:
二、特征工程
三、模型评估
四、拟合
五、机器学习流程
6、机器学习一般应用实现步骤:
问题抽象(现实-》数学)
数据准备 特诊工程
选择与建模
模型训练与评估
预测结果