随笔分类 - 机器学习
摘要:转自:http://www.cnblogs.com/jerrylead/archive/2011/03/05/1971867.html1 摘要 本报告是在学习斯坦福大学机器学习课程前四节加上配套的讲义后的总结与认识。前四节主要讲述了回归问题,回归属于有监督学习中的一种方法。该方法的核心思想是从连续型统计数据中得到数学模型,然后将该数学模型用于预测或者分类。该方法处理的数据可以是多维的。 讲义最初介绍了一个基本问题,然后引出了线性回归的解决方法,然后针对误差问题做了概率解释。之后介绍了logistic回归。最后上升到理论层次,提出了一般回归。2 问题引入 这个例子来自http://www.cnb
阅读全文
摘要:1. 贝叶斯定理 英国数学家托马斯·贝叶斯(Thomas Bayes)在1763年发表的一篇论文中,首先提出了这个定理。 A,B表示在一个样本空间中的两个事件,在事件B发生的情况下,事件A发生的概率用P(A|B)表示,它等于事件A,B同时发生的概率除以事件B发生的概率。 因为:P(AB) = P(A|B) P(B) P(BA) = P(B|A) P(A),所以:P(A|B) P(B) = P(B|A) P(A),即 假设样本空间是A与A’的和(A’是A的补集),则P(B) = P(B∩A) + P(B∩A’),代入贝叶斯定理即得全概率公式:P(B) = P(B|A)P(A) + P(
阅读全文
摘要:给定一个训练数据集,其中的实例类别已定。要确定新的实例类别时,根据训练数据集中k个最邻近的实例的类别,通过多数表决等方式进行预测。k近邻实际是利用训练数据集对特征向量空间进行划分,不具有显式的学习过程。 特征空间中两个实例点的距离是两个实例点相似程度的反映,k近邻模型一般使用欧式距离,但也可以是其他距离,如Lp距离、Minkowski距离。在应用中,k值一般去一个比较小的值,通常采用交叉验证法来选取最优的k值。 最简单的实现方法是线性扫描,这时要计算输入实例与每一个训练实例的距离。当训练集很大时,这种方法是不可行的。为了提高搜索效率,可以采用kd树方法。 kd树是k-dimensio...
阅读全文
摘要:感知机(perceptron)是Frank Rosenblatt在1957年就职于Cornell航空实验室(Cornell Aeronautical Laboratory)时发明的一种人工神经网络,是一种二元线性分类器。 定义:输入空间(特征空间),输出空间是。由输入空间到输出空间的函数称为感知机。sign是符号函数,即 数据集,其中(xi为n维实数向量),,i=1,2, … , N。如果存在某个超平面(hyperplane)S:,对于所有的实例i有;对于所有的实例i有,则称数据集T为线性可分;否则称数据集T线性不可分。 学习策略:输入空间任一点x0到超平面S的距离为,对于误分类的数...
阅读全文

浙公网安备 33010602011771号