[博弈论]耶鲁博弈论笔记

整理一些关于博弈论的总结性文字:

1.不做严格劣势策略、也不要做弱劣势策略

2. 收益是很重要的

3. 学会换位思考

4. 共同知识的定义是严格的,而相互知识(双方至少有一人戴的是粉帽子)并不是。共同知识定义为博弈参与者能够互相知道彼此的想法并且无限循环这个过程。简单来说,相互知识是参赛者主观的浅薄知识,而共同知识是严格客观的。

5.迭代剔除即迭代删除严格劣势策略,举例说明有选民问题1、10为劣势区,或猜数问题,三分之二的选择的数获胜,最终答案严格迭代为1,但在实际过程中考虑误差,实际结果为10左右。

6.最佳对策(Best response),回顾(严格)劣势策略,就是无论对手的策略是什么,我的策略的收益都(严格)比对手的收益低。但是当一个博弈中不存在劣势策略时,之前所学的经验结论就不适用了。在进行最佳对策时,需要计算预期收益,这里也是统计数学中的期望(值概率+值概率的形式)

巧妙利用数值转换成数轴,并且领悟交点的含义是很有必要的一种直观数据展示方式。

7.不要选择任何信念下都是非最佳对策的策略,比如点球博弈中,你永远都不要选择踢中间

现在,原本我们无法由“你永远不要选择劣势策略”而剔除劣势策略时,转变为你可以剔除“由中间射门”这一策略了。

8.最佳策略的两种数学化定义:

(1)player i ‘s strategy Si(hat),is a BR to the strategy 
S-i of other players if  my payoff from choosing Si(hat) against S-i is weakly bigger than that from choosing Si' against S-i.(weakly bigger 相当于 大于等于),this chcice is better than every choices i could choose.

(2) it maximizes my payoff against S-i which is my opponent choose

这里强调一个预期收益的概念,需要计算预期收益,这里也是统计数学中的期望(值概率+值概率的形式)

8.在2人合作的工作中,我的每一份努力,都承担了多付出的全部边际成本,但我却只能得到一半的边际收益,因为利润是均分的。这会导致大家都减少付出。

纳什均衡点:经济学里的一个交点,意味着每一个参与者都不想偏离那个点,简而言之,就是参加者们如果选择的策略是两条线,在纳什均衡点相交处,他们选择的策略是最优的。此时他们的线都是BR

9.Go to movies(battle of sexes) && 古诺双寡头模型

在策略不多的博弈中找到纳什均衡(通过去除劣势策略减少策略数量)

纵轴表示公司B的产量(BTW 产品质量一样的情况下,产量为主要考虑对象)红线表示在公司B任意产量下,公司A的最优收益产量。黄线则是公司A在任意产量下,公司B的最优产量。BTW,两条线的与坐标轴的交点是(a-c)/2b 与(a-c)/b ,老师图画的不咋地。
红黄交点就是纳什均衡点。总结:互补策略是一种此消彼长的关系,我越多,你越少,才最优。当双方想通过协商55分账收益的时候,这时的情况就有点类似囚徒困境了,显而易见的情况是,双方都会背叛对方而选择最优策略。

10.伯川徳模型注重价格,而古诺模型注重产量。也就是说,这次的策略是定价的合理性。

候选人选民模型
唯一基本策略,投票或不投票,选民均匀分布在一个横轴上,如果选择投票,将选择距离最近的候选者投票。
三个基本规则,如果当选,则获得奖励B;如果投票,则扣除成本C,B=2C 如果其他人当选,将扣除你和获胜候选人之间距离的绝对值-|X-Y|
3个例子

(1)如果X 参选并且获胜,他的收益是B-C
(2)如果X参选但Y获胜,他的收益是-C-|X-Y|
(3)如果X未参选但Y获胜,他的收益是-|X-Y|

随后在课堂上进行情景模拟。得出结论

1.此模型会有多个纳什均衡点,且并不是所有候选人都是中立
2.如果左派新加入一个候选人,可能使得右派获胜概率增大;相反有类似的结论。

二级结论:

处于纳什均衡点的两位候选者必须处于左右对称的位置,并且都处于中间位置的两边。
如果候选人距离中心距离太远,那么处于中心的候选人会获胜。那么他们到底可以距离中心多远并且获胜呢?
结论是 将整个数轴	6等分,两个候选者只能处于六分之一和六分之五的位点上,距离中点再远,他们就会输。(因为在这两个点,3人,包括中点的候选人,平分选票各得三分之一)
技巧性结论:先猜测后证明,但是需要系统的,没有疏漏的猜测和证明,这点需要考虑许多情况。

11.选址模型

东西小镇,高矮人种
如果同镇中的人种五五开,每人都获得 1 的收益
如果同镇中的人种处于大多数又不是全部,每人都获得 1/2 的收益
如果同镇中的人种是全部,每人都获得 0 的收益

结果将是种族隔离,高矮分开了。为了获取1/2的收益,人们最终会选择抱团
这是一个弱纳什均衡,不是严格的,涉及到稳定性:一人之过,满盘皆输

小结:一共找出3个均衡
其中两个是纳什均衡是种族隔离,即大个子住在东镇小矮子住在西镇反之依然,整个均衡是严格的,由于参与人具有严格不愿变动的特点。
而对于混居均衡,是不严格的。因为只要有一小部分人移居,最终会将导致种族隔离。

临界点-谢林:我们可以人为地破坏一个均衡,然后博弈又会逐渐回到原均衡状态
还有一种情况,如果所有人选择东镇,并接受随机分配,其结果根据大数法则(多次试验后得出的规律性现象),结果会趋于混居策略,结果比自己主动选择要好

其他的结论:整个模型得出的种族隔离结论不能作为人们喜欢被隔离的理由,即不可凭借看到的现象武断地下结论;除了自上而下的随机分配,也可以采用自下而上的随机分配

12.混合策略

加权平均数一定处于最大值和最小值之间。
如果一个混合策略是一个最佳策略,那么混合策略中的每个(被赋予正值的,意味着被选中的,被执行的)纯策略,也必须是最佳策略,也就是说他们的收益必须相同.可以用反证法来理解,如果混合策略中的纯策略不是最优的,那么只要把这个策略剔除出去,这样的混合策略会是更优的。

引出一个定义,

一个混合策略组合,P1*,P2*...,PN*是一个混合策略纳什均衡 当且仅当,对于任意参与人I 在面对 P-i*时,他的混合策略Pi*是最优策略 且Pi*其中的任一被赋予正概率的纯策略也必须是最优的

12.2 如果不存在改选纯策略的有利改变,也就不纯在改选混合策略的有利改变。

13 纳税纳什均衡混合策略

纳税人的均衡策略是由审议员的收益决定的,这就会出现一个很有意思的结论

当纳税政策由正常,变更为对逃税人加倍处罚的情况下,纳税人的交税策略并没有更想多交税来规避处罚,反而是不变,理由是审议员的收益没有改变,那么自然,纳税人的纳税意愿也不会改变。
所以,我们要提高审查员的收益或是减少审查成本,才能提高纳税人的纳税意愿。
还有一个结论,富人们未必喜欢偷逃税款,尽管他们逃税的收益要更大,实际情况是他们更容易被审查。
如果我们改变了纵列参与人的收益,就会改变横列参与人的混合均衡。
如果我们改变了横列参与人的收益,就会改变纵列参与人的混合均衡。

14.进化遗传与博弈

专注种族内的竞争,采用相对成功策略的个体数量会增长,反之会下降

种群中所有个体采用的策略是S,我们要研究的是突然有一部分个体采用S‘ ,我们想知道S’的这部分个体,最终是消亡了,还是继续繁衍下去了。 如果消亡了,说明S是稳定进化的。

如果这个群体是进化稳定的,那么突变个体应该最终灭绝
计算两种策略的平均收益,如果一种策略的收益大于另一种,那么利用这种策略的群体就不会灭绝。那么另一种策略就不是稳定进化的。实际上 背叛的突变模型是稳定进化的策略。但这是针对无性繁殖的群体,他们的基因不会重组。

结论:

自然选择的结果是很糟糕而低效的
如果一个策略是严格劣势策略,那么它不是稳定进化策略
如果(S,S)不是纳什均衡,那就说明有其他的严格有利变动,例如S‘,作为变异,入侵就一定会获胜。
如果一个策略是稳定进化策略,那么它也一定是一个纳什均衡,反之不一定不成立。
当我们观察某个纳什均衡时,	如果它严格优于其他纯策略,那么它一定时ES进化稳定的,此时称为严格纳什均衡。

15.序列博弈

贷款与租赁
担保的价值不仅仅给借出者一定的资金保障,更重要的是它给租赁者带来了负收益。
担保降低了你不偿还贷款的收益,但却让你过得更好了,因为它改变了其他人的行为,这对你是有益的行为。
激励设计、逆向归纳法、许诺设计(担保的思想,要让对方知道)

16.利用序列博弈分析古诺模型--斯塔克伯格博弈模型

到底是先手好还是后手好?
先手。

一阶导数就是切线斜率,当切线向右上时为正,向左上时为负。
二阶导数是一阶导数的导数,反映的是切线斜率的变化,
当切线斜率变大时为正,当切线斜率变小时为负,此时为凸函数。

我们所说的同时还是序列模型和时间关系不大,而和信息到达的时间有关,有关谁知道什么,而谁又知道对方知道什么,有关。

有时更多信息会害了你,因为有可能是错误的信息

17.但是有些情况也不一定是先下手为强,也可能后手有优势,比如 手头剪刀布

NIM游戏,有时先手有利,有时后手有利。不管先手还是后手,只需要凑齐必胜条件即可。谁取走最后一块石头谁就获胜。

18.zermelo

在不同条件下,将导致三种结局i, 1号win loss or tie
策略核心思想为,无论2号如何做,1号都可以绝对获得这3种结果。

分析:1.如果两堆石头一开始数量不相等,1号能取胜
2.如果相等,2号能取胜
归纳证明:
从博弈的最大长度N,类似于树的最长路径。当结论对N成立,那么对N+1也成立。
当N=1时,
能赢则赢,不赢逼平。
现在假设这个命题对所有这样的博弈,在长度为N时都成立。
我们想要证明,所有博弈在N+1时都成立
比如一个深度为4的树中,N=3 则N+1=4
根据归纳假设,我们可以知道N=2<3,所以子博弈有解
这时可以把原来的博弈转换成一个简单的博弈,分治的思想,把N=4的博弈逐渐转换为N=1的博弈,which 我们可以知道结论的博弈

小结:我们首先假设所有长度为三或者更小的子博弈有解,我们可以把所有N+1的博弈看成先走一步,和之后的长度为N或者更少的子博弈,每个长度为N或者更少的步数的博弈都有解,那么参与人只要在这些子博弈中选择一个最佳的,证明结束。类似的,可以类推长度为2,长度为3的博弈都有解。
来看看一个5行3列的拿石子游戏,每拿一颗石子,就将石子的上方右方和东北方的全部石子都拿走,拿到最后一颗石子的玩家失败。

根据Zermelo理论,无论N, M等于多少,这个博弈都有解

定义一个完全信息博弈:在任一个节点上,或者说每个节点上的被轮中的参与者都知道自己处在整个博弈的哪个节点的博弈。这也暗示着他知道整个博弈是怎么进行到他这的。
定义纯策略:在完全信息博弈,一号参与人的纯策略,是一个完整的行动计划,一号在每个节点上,一号将要采取怎样的行动

由于纯策略会告诉你参与人在每个节点上的行动,无论他能不能走到每一个节点。

复习找到纳什均衡的步骤,由博弈,画出矩阵,列出每种情况下参与者的选择,当一个方格(一种策略)内的选择被双方都选中时,那么这个策略是纳什均衡。
找到纳什均衡后可以再用逆向归纳推均衡,一般会找到纳什均衡中更优的策略。当纳什均衡中的一个策略建立在一个不足信的基础上,他基本上会被排除。

19.

即使是一个很小小的概率,会影响整个序列博弈的结果,比如这个小概率事件是”好斗者“
会导致后续的参与者不敢进场博弈,而选择非最优选择,”围观“

决斗博弈

20.最后通牒和议价

在使用逆向方法推断时,要注意现实世界中的“公平”,和尊严因素。
议价:一方提出资金分配,另一方要选择接受与否,不接受,则双方角色对调,由对方进行资金分配,重复这个过程,知道有一方接受价格分配为止。需要注意的是,要分配的金钱是有折损的,
第一次资金分配如果是1块钱,那么第二次就是0.9元,第三次是0.9*0.9=0.81元,这里的折损参数取0.9

在进行复杂分析时,不需要从头到尾计算,只需要从简单的部分,倒推,找规律即可。
在无限期的议价中,你可以无限地提出自己的条件,因为只要你自己不满意,拒绝对方的条件就行了,这样就会可能导致一个死循环。
而议价博弈的优势完全在于给出条件的一方。
结论:议价可能会一直进行下去,而且折损不是很大,折损不是很大意味着条件可以很快给出,也就是说没有折损,又或者说在迅速报价,如果对于每个报价,你都要一年时间,那么折损就非常大了。
假设其中的参与者很不耐烦,而另一个参与者很耐心,那么耐心的一方是有利的。

21.子博弈的正式定义(博弈中的博弈)

子博弈是博弈的一部分,非正式的说法是像树图里的一个博弈,他有三个性质:

第一,他必须从单个节点开始,
第二,它包含该节点的所有后代节点
第三,它不能破坏任何信息集合

如图上述三个画圈部分都不算子博弈。它们或许破坏了信息集合,或许不是由同一个节点而来。

定义,一个纳什均衡(S1,S2...SN*),他如果能在任意子博弈中达到纳什均衡,那么它称为子博弈完美均衡

posted @ 2020-11-13 17:20  saku  阅读(1832)  评论(0)    收藏  举报