贝叶斯决策

读了这么多的书,觉得真正有很大帮助的并不多,贝叶斯决策理论算是其中的一个。就我拙劣的眼光,再也没有什么学科,比统计学更好地揭示了世界的内涵。贝叶斯理论,正是统计学的入门知识之一。
 
贝叶斯理论很简单,可以说我们的每一次决策的过程,都是对该理论的一个有意无意的运用过程。它的大致意思是说:在拿到一个问题之前,根据常识和经验,我们就有了一个对可能的答案的推测,这叫做先验推测。然后随着对问题的不断了解,我们会对该推测进行不断的修正,形成一个后验推测。这个后验推测,是结合了我们以前的经验和这次对问题的观察的,是比较深入和准确的,因此可以用来做决策。
 
举个例子,我们遇见一个韩国人,要去判断他的姓氏。如果没有更多信息,那么会猜他姓金李朴崔等,具体来讲姓金的可能性是XX%,姓李的可能性是XX%等等。如果只能猜一次,当然会猜韩国第一大姓金。这就是先验判断,是在对他缺乏更多信息的情况下做的。然后进一步了解,知道他太太姓金,由于韩国人一般同姓不婚,所以此人姓金的可能性大大减小,上面各姓的可能性就要做调整,于是会猜他姓第二大姓李。这个深入了解的过程可以一直持续下去。比如再了解,知道他父亲姓崔,这下我们觉得他姓崔的可能性是非常高了,所以断定他姓崔。当然,也有可能他其实是跟母姓,姓完颜。
 
贝叶斯理论里面有几个关键点:
 
1,所有的问题都是概率性的。这个观点看起来简单,实际上却很容易被忽略。我们思维里面确定性的观念太强,以至于一不小心就忽略了问题事实上的概率性。比如我们出门,总是假定自己不会被陨石砸死,其实这种可能性还是存在的。从最极端的角度来讲,所有的宏观运动都是由大量微观粒子的随机运动合成的,所以世界本质上就是统计的,是概率性的,绝对的事情也许是绝对不存在的。当然,我们有限的精力要用在刀刃上,上面这些并不否认明确决策的必要性,只是要做更准确的决策而已。
 
2,不能只用经验解决问题。经验,也就是先验概率,通常是不够准确的,不足以做出低风险的决策。所以我们要保持一种战战兢兢的心态,认真面对问题本身,深入仔细地分析每一个个案。尤其是在判断一些复杂问题时,比如判断一个人的人格,要越发的保持慎重。如果不是非常必要,在没有足够的信息时,是可以不下结论的。
 
3,经验是有用的。这个不用说了,经验是构成判断的基础。这次的判断就是下次的经验。如果无视经验,无视自己和他人的劳动成果,文明也就不用传承了。
 
 
 

在【前一个例子】中已经举例说明了如何用贝叶斯公式计算后验概率,然后依据后验概率来做决策。

1、什么是行为?

但是,有时候,后验概率本身只能说明具有特征x的样本属于ωi类的可能性有多少,却没能表示如果将样本分到ωi类时的代价有多大。

在此,引入行为的概念

分类器的设计初衷很简单,就是进行“分类”这一动作。假设现在来了一个具有特征x的样本,如果将“把样本分入ωi类”这一行为记为动作ai的话,我们将有不少于类别种类(假设有c类)的行为(因为除了将样本分入不同类别外,还可能拒绝作出判断,因此动作集的大小一般大于类别种类)。

2、什么是风险?

为方便说明,令{ω1,...,ωc}表示有限个类别集,{a1,...,aa}表示有限的a中可能采取的动作集,风险函数λ(aij)描述类别状态为ωj时采取行动ai所产生的风险。(行为导致风险,不同的行为也会使风险的大小不同

3、什么是损失函数?

已知使用【贝叶斯公式】可以通过先验概率P(ωj)、概率密度函数(似然函数)p(x|ωj)以及证据因子p(x)可以求出后验概率P(ωj|x):

假设,样本具有特征值x,并且我们将采取ai行动,而样本的真是归属类别为ωj,那么将可能造成损失λ(aij),而贝叶斯公式求出的后验概率P(ωj|x)表示了特征值为x时,样本属于类别ωj的概率,因此,与行为ai相关的损失为:

R(ai|x)称为与行为ai相关的损失函数。计算损失函数可以展开为以下步骤:

step 1:通过将特征值、似然函数、先验概率带入贝叶斯公式,求出具有特征值x的样本分属各个不同类别的可能性(后验概率)。

step 2:将样本属于各个不同类别的可能性乘上将样本误判到这一类别所需付出的代价。

step 3:将step2的结果相加即可得出对具有特征值x的样本进行ai操作所可能产生的损失。

显然,要计算损失函数,则先验概率、似然函数、风险函数都必须是已知的。

注意,风险函数是λ(aij),损失函数(也称条件风险)是R(ai|x),两者是不同的。

4、什么是贝叶斯决策规则?

     为了最小化总风险,对所有的i=1,...,a计算条件风险R(ai|x),并选择行为ai使R(ai|x)最小化。最小化后的总风险值称为贝叶斯风险,记为R*,它是可获得的最优风险。那么,为什么贝叶斯决策规则所得出的风险是最小的呢?

     假设判决规则为函数a(x),它用来说明对于特征值x应采取哪种行为(即,a1,...,aa中选择哪个行为)。如果有一种规则,使得损失函数R(ai|x)对每个特征值x都尽可能的小,那么对所有可能出现的特征值x,总风险将会降到最小。

     而这一理想的规则就是贝叶斯决策

“对所有的i=1,...,a计算条件风险R(ai|x),并选择行为ai使R(ai|x)最小化”

     通俗的说,就是对特征值x,计算所有行为所导致的损失们(即把R(a1|x),...,R(aa|x)都算出来),然后从中选择损失最小的一个ak作为结果,这样对于每个样本,都可以做的损失最小。假设有一批样本,其中的每一个都做到损失最小的话,对这一批样本而言,总体的损失就是最小的了。

     不过这是一种非常理想的情况,通常是没有那么多已知条件的(实际情况中很少出现如此理想的情况)。不过贝叶斯决策理论倒是为我们提供了一个与其他分类器做对比的评价依据,也就是说贝叶斯决策很多情况下是作为对比对象而存在的。

 

posted on 2014-07-14 17:07  alexanderkun  阅读(519)  评论(0)    收藏  举报

导航