随笔分类 - ML
摘要:第五节–决策树决策树(decision tree)是一种基本的分类与回归方法.决策树呈树形结构,在分类问题中,表示基于特征对实例进行分类的过程,它可以认为是if-then规则的集合,也可以认为是定义在特征空间与类空间上的条件概率分布,其主要优点是模型具有可读...
阅读全文
摘要:第四节–朴素贝叶斯(Naive Bayes)法朴素贝叶斯(Naive Bayes,NB)法是基于贝叶斯定理与特征条件独立假设的分类方法.对于给定的训练数据集,首先基于特征条件独立假设学习输入/输出的联合概率分布;然后基于此模型,对给定的输入x,利用贝叶斯定理...
阅读全文
摘要:第三节–k近邻算法k近邻法(k-nearest neighbor,KNN)是一种基本分类与回归方法.k近邻法的输入为实例的特征变量,对应于特征空间的点,输出为实例的类别,可以取多类.k近邻法假设给定一个训练数据集,其中的实例类别已定,分类时,对新的实例,根据...
阅读全文
摘要:第二节–感知机感知机(perceptron)是二类分类的线性分类模型,其输入为实例的特征向量,输出为实例的类别,取+1和-1二值.感知机对应于输入空间(特征空间)中将实例划分为正负两类的分离超平面,属于判别模型.感知机学习旨在求出将训练数据进行线性划分的分离...
阅读全文
摘要:第一节–统计学习概论首先介绍统计学习的定义,研究对象和方法;然后叙述监督学习;接着统计学习方法的三要素:模型,策略和算法;介绍模型选择,包括正则化,交叉验证和学习的泛化能力;介绍生成模型与判别模型;最后介绍监督学习方法的应用:分类,标注和回归一.统计学习1....
阅读全文
摘要:ML–XOR问题感知器对线性可分或近似线性可分数据有很好的效果,但对于线性不可分数据的效果不理想.Minsky在1969年出版的中用详细的数学证明了感知器无法解决XOR(异或)分类问题.而我们要说的XOR问题正是线性不可分的一.基本的逻辑运算1.AND运算x...
阅读全文
摘要:Python之ML–人工神经网络识别图像深度学习可以被看作是一组算法的集合,这些算法能够高效地进行多层人工神经网络训练主要知识点如下:理解多层神经网络训练用于图像分类的神经网络实现强大的反向传播算法调试已实现的神经网络一.人工神经网络对复杂函数建模1.单层神...
阅读全文
摘要:Python之ML–聚类分析使用监督学习来构建学习模型,其中训练数据都是事先已知预测结果的,即训练数据中已提供了数据的类标;在本节,我们将转而研究聚类分析,它是一个无监督学习(unsupervised learning),可以在事先不知道正确结果(即无类标信...
阅读全文
摘要:Python之ML–回归分析预测连续型目标变量监督学习的另一个分支:回归分析(regression analysis).回归模型(regression model)可用于连续型目标变量的预测分析主要知识点如下:数据集的探索与可视化实现线性回归模型的不同方法训...
阅读全文
摘要:Python之ML–情感分析深入研究自然语言处理(natual language processing,NLP)领域的一个分支–情感分析(sentiment analysis)主要知识点如下:清洗和准备数据基于文本文档构建特征向量训练机器学习模型用于区分电影...
阅读全文
摘要:Python之ML–模型评估与参数调优主要知识点如下:模型性能的无偏估计处理机器学习算法常见问题机器学习模型调优使用不同的性能指标评估预测模型一.基于流水线的工作流本节使用scikit-learn中的Pipline类.它使得我们可以拟合出包含任意多个处理步骤...
阅读全文
摘要:Python之ML–数据预处理机器学习算法最终学习结果的优劣取决于两个主要因素:数据的质量和数据中蕴含的有用信息的数量.因此,在将数据集应用于学习算法之前,对其进行检验及预处理是至关重要的主要知识点如下:数据集中缺少数据的删除和填充数据格式化模型格式化模型构...
阅读全文
摘要:Python之ML–机器学习分类算法介绍最早以算法方式描述的分类机器学习算法:感知器(perceptron)和自适应线性神经元(adaptive linear neuron).我们将使用python循序渐进地实现一个感知器,并且通过训练使其具备对鸢尾花数据集...
阅读全文
摘要:Python之ML–计算机学习数据的能力主要知识点:机器学习的一般概念机器学习方法和三种类型和基本术语构建机器学习系统所需的模块一.机器学习的三种不同方法介绍三种不同类型的机器学习方法:监督学习(supervised learning),无监督学习(unsu...
阅读全文
摘要:ML–文本数据处理一直以来,自然语言处理(Natual Language Processing,NLP)作为人工智能的重要分支之一,其研究的内容是如何实现人与计算机之间用自然语言进行有效的通信。自然语言处理中的基础知识–如何对文本数据进行处理主要涉及的知识点...
阅读全文
摘要:ML–模型评估与优化主要涉及的知识点有:使用交叉验证对模型进行评估使用网络搜索寻找模型的最优参数对分类模型的可信度进行评估一.使用交叉验证进行模型评估在前面的内容中,我们常常使用scikit-learn中的train_test_split功能来将数据集拆分成...
阅读全文
摘要:ML–数据表达与特征工程主要涉及的知识点有:使用哑变量对类型特征进行转化对数据进行装箱处理几种常用的数据"升维"方法常用的自动特征选择方法一.数据表达1.使用哑变量转化类型特征哑变量(Dummy Variables),也被称为虚拟变量,是一种在统计学和经济领...
阅读全文
摘要:ML–数据预处理,降维,特征提取及聚类主要涉及的知识点有:几种常见的数据预处理工具PCA主成分分析用于数据降维PCA主成分分析和NMF非负矩阵分解用于特征提取几种常用的聚类算法一.数据预处理1.使用StandardScaler进行数据预处理# 导入numpy...
阅读全文
摘要:ML–神经网络主要涉及的知识点有:神经网络的前世今生神经网络的原理和非线性矫正神经网络的模型参数调节使用神经网络训练手写数字识别模型一.神经网络的前世今生其实神经网络并不是什么新鲜事物了,早在1943年,美国神经解剖家沃伦.麦克洛奇(Warren McCul...
阅读全文
摘要:ML–支持向量机SVMSVM算法专门解决线性不可分主要涉及的知识点有:支持向量机的基本原理和构造支持向量机的核函数支持向量机的参数调节支持向量机实例–对波士顿房价进行回归分析一.支持向量机SVM基本概念1.支持向量机SVM的原理# 导入numpyimport...
阅读全文

浙公网安备 33010602011771号