Mahalanobis距离、Regression的理解

Mahalanobis距离就是MVN中的指数部分中的距离项,MVN用其度量xmean之间的距离,用来影响概率密度p(x)。实际上该距离就是将两个高维空间中的点(xmean)之间的欧氏距离进行了扩展,扩展到其中一个点(x here)是随机变量的情况。且将x各维度之间的相关性考虑进去,当x各维度之间彼此独立时该距离退化成欧氏距离。

Regression解决的实际上是寻找两个随机变量之间联系的问题。即,有两个随机变量x和y,两者之间有所关联,但又不能完全确定,因为有随机性(因此没必要也不应该试图将给定的(x,y) pairs完全拟合)。因此给定x我们并不能完全确定y,而只能推知p(y|x),我们希望由此得出y关于x的条件期望E[y|x],这是一个由x到y的映射函数,也就是我们要找的回归函数——Regression Function。

Regression

问题:给定训练集a lot pairs of input variable x and target value t,试图为新的x预测t。

Intuition:input variable x和target value t之间有一定关系,但又不确定,有随机性存在,即真正的模型应该是p(t|x)这样一个分布,而我们要做的预测应该是在p(t|x)下的最优预测,称为回归函数,记为h(x)。通常做法是认为p(t|x)是一个以y(x)为均值的高斯分布,即一个由x确定的函数y(x)加上高斯噪音。所以要想求得p(x|t)就需要求得y(x)。若用Linear Model来对y(x)建模的话,则y(x)=wT*phi(x)=Sumj {wj*phij(x)}。phi(x)是basis functions。总之,要想确定p(t|x)这个分布需要确定很多参数,wT和precision,有了wT就有了mean,再加上precision高斯分布就确定下来了。确定这些参数的方法是根据训练集D来maximum likelihood或者说,等价地,minimizing the sum-of-squares error。有了参数之后,就认为我们掌握了p(t|x),就相当于掌握了x和t之间的所有信息,接下来要做的就是对新的x的target value t做预测了。所能做出的最优预测称为regression function,记为h(x)。什么预测最好呢?评价标准是使Loss function的期望最小。如果选square loss function即L=(h(x)-t)2,则最优预测应该是h(x)=E[t|x]=intergraltt*p(t|x)dt。对于前面的以y(x)为mean的高斯假设来说,这一期望就是y(x)。

注意sum-of-squares error和square loss function的区别,前者是在确定模型阶段(Inference Stage)用来求模型参数的目标函数,后者是当模型确定好之后做预测阶段(Decision Stage)用来指导该做什么预测的目标函数。

模型的表现用Loss function的期望来衡量,即E[L]=intergralt{y(x)-t}2dt=intergralt{y(x)-h(x)}2+{h(x)-t}2dt(cross compenents vanished by intergral)。这里y(x)代表对t的预测,h(x)是回归函数,是知道p(x,t)后所能做出的最优预测。注意积分中的第二项是与y(x)无关的,即无论我们做什么样的预测都避免不了的Loss quantity,这是由t本身内在的随机性(或曰噪音)所决定的,我们只能尽量减小第一项,即尽量让我们的预测逼近回归函数。

posted @ 2013-01-15 17:22  ChrisMachineLearning  阅读(363)  评论(0)    收藏  举报