博弈论
《博弈论》全课程精讲
博弈论不是"算计别人的学问",而是一套关于策略互动的数学语言。它回答一个朴素的问题:当我的最优选择取决于你的选择、而你的最优选择又取决于我的选择时,我们该怎么做?整门课听下来,你只会反复见到同一个画面——每个人站在自己的立场上,环顾四周,心里想的是:"只要没人愿意单方面偏离,这个局面就是稳定的。"所有高大上的均衡概念,都是在给这句话加上更精确的前提条件。考前请记住:模型是树或矩阵,均衡是"不偏离",概念升级的动力是"信息全不全、行动先不先"。
一、课程大纲
| 模块 | 章节 | 核心内容 |
|---|---|---|
| 基础 | 1. 导论 | 博弈要素(参与者/策略/支付)、博弈分类(合作与非合作、静态与动态、完全与不完全信息) |
| 完全信息 | 2. 完全信息静态博弈 | 占优策略、严格劣策略迭代剔除、纯/混合策略纳什均衡、均衡存在性 |
| 完全信息 | 3. 完全信息动态博弈 | 扩展式与博弈树、逆向归纳法、子博弈精炼纳什均衡(SPNE)、承诺与可信威胁 |
| 不完全信息 | 4. 不完全信息静态博弈 | 海萨尼转换、类型与先验信念、贝叶斯纳什均衡(BNE) |
| 不完全信息 | 5. 不完全信息动态博弈 | 信号博弈、信息甄别与信号传递、精炼贝叶斯均衡(PBE)、混同与分离均衡 |
| 重复互动 | 6. 重复博弈 | 有限次/无限次重复、触发策略、无名氏定理、合作与惩罚 |
| 延伸 | 7. 讨价还价与合作博弈 | 鲁宾斯坦讨价还价、核(Core)、沙普利值 |
| 应用 | 8. 应用专题 | 拍卖理论、机制设计、演化博弈初步 |
二、一条主线
理性人之间的策略互动。整门课就是"均衡"概念的一次次精化:信息是否完全、行动是否同时,决定用哪种均衡——纳什均衡→子博弈精炼纳什均衡→贝叶斯纳什均衡→精炼贝叶斯均衡。所有模型都是"支付矩阵或博弈树"的变体,所有均衡都是"没人愿意单方面偏离"这个思想的严格化。
可以把这条主线记成一张"体检表":
- 所有人同时出手、信息全都看得见 → 静态完全信息 → 纳什均衡(NE)
- 有先后、动作被对手看见 → 动态完全信息 → 加入"不可信威胁要被剔掉" → 子博弈精炼纳什均衡(SPNE)
- 同时出手、但我不知道你的"底牌" → 静态不完全信息 → 引入"类型+先验",对期望支付求最优 → 贝叶斯纳什均衡(BNE)
- 既有先后、又不知道底牌(看行动能猜类型) → 动态不完全信息 → 把"后验推理"也纳入均衡 → 精炼贝叶斯均衡(PBE)
一句话版:信息(完全→不完全)× 时序(静态→动态),四个象限对应四种均衡。 任何一道题,先判象限,再上对应均衡概念。
三、逐章精讲
第一章 导论:博弈是什么
这一章在干什么
给"博弈"下定义、搭好分析框架。全章没有难题,但所有后续章节的词汇都在这章被第一次使用——博弈三要素、信息结构、分类标准。这一章唯一要防的坑是概念辨析题。
核心内容
(1)博弈的三要素
- 参与者(players) \(i\in\{1,\dots,n\}\):决策主体,关键是"他的目标独立,且利益与他人交织"。\(n=2\) 是最常考的特例。
- 策略(strategies) \(s_i\in S_i\):一个策略是"完整的行为计划",哪怕到不了的信息集,也要规定好到时候怎么走。动态博弈里"策略 vs 行动"的区别是常考点:策略是"如果……那么……"的完备预案。
- 支付(payoff) \(u_i(s_1,\dots,s_n)\):各策略组合下参与人得到的效用,一般要求理性人偏好支付最大化。
三要素合起来,就是"规则"。谁的规则清晰、支付明确,谁就能用博弈论分析。
(2)分类标准(四个象限的核心)
| 维度 | 分类 | 说明 |
|---|---|---|
| 合作性 | 合作博弈 / 非合作博弈 | 合作博弈强调"联盟能拿到多少、怎么分";非合作博弈强调"每人单独行动如何选"。本课主体是非合作博弈 |
| 时序 | 静态 / 动态 | 静态=同时或"无法观察对方先行动";动态=有先后、后手能观察先手行动 |
| 信息 | 完全 / 不完全 | 完全=每个人的支付函数(类型)都是公共知识;不完全=有人藏着底牌 |
| 随机性 | 确定 / 混合 | 是否允许随机化策略 |
(3)其他基本概念
- 理性(rationality):追求自己支付最大化(含期望)。共同知识(common knowledge):不只知道某事,还知道"他知道我知道他知道……"。共同知识是把"理性+理性推理"递归下去的前提。
- 策略组合、支付矩阵、最优应对(best response):\(BR_i(s_{-i})=\arg\max_{s_i}u_i(s_i,s_{-i})\)。最优应对是后面一切均衡定义的原料。
典型题型/考点
- 判断给定场景属于哪个象限(如"两家企业同时定产"→ 完全信息静态)。
- 概念辨析:行动≠策略;理性≠自私(理性是自利的、目标一致的,不等于损人利己)。
- 给场景补全三要素。
为什么这一章重要
这一章的"分类"直接决定后面用哪种均衡,是全课程的地图。同时"理性+共同知识"是经济学方法论的核心假设,理解它才能理解为什么博弈论能进入计算机科学(多智能体系统、算法博弈论本质就是"多个理性程序互相适应")。
第二章 完全信息静态博弈:纳什均衡
这一章在干什么
在"同时出手、信息完全"的最干净环境里,回答:什么是理性的稳定结果?答案是纳什均衡。全章围绕它的定义、求解、存在性展开。囚徒困境在本章登场,它可能是整个博弈论最重要的一张 2×2 矩阵。
核心内容
(1)占优策略与囚徒困境
若存在 \(s_i^*\) 使得对任意 \(s_{-i}\) 都有 \(u_i(s_i^*,s_{-i})\ge u_i(s_i,s_{-i})\),则 \(s_i^*\) 是占优策略:无论别人怎么选,它都最好。囚徒困境中,坦白对两人都是严格占优,于是均衡是(坦白,坦白),但(沉默,沉默)对两人都更好——个体理性与集体理性冲突的经典例证。
记住它的教训:均衡不一定是"好结果",纳什均衡只是一个稳定的自利结果,不是帕累托最优。
(2)严格劣策略迭代剔除(IESDS)
策略 \(s_i\) 是严格劣于 \(t_i\):对一切 \(s_{-i}\),\(u_i(s_i,s_{-i})<u_i(t_i,s_{-i})\)。理性人不会用严格劣策略,于是不断剔除、缩小博弈,剩下的组合即为均衡。注意:必须是"严格"劣才能保证合理性;弱劣策略的剔除需要小心(可能误删均衡)。
(3)纯策略纳什均衡
即:每个参与人的策略都是对其他所有人策略的最优应对,任何单方面偏离都无利可图。求解方法:
- 划线法:对每个对手策略,标出己方最优应对,划线;双方都划线的格子就是纯策略 NE。
- 注意:纳什均衡是"同时最优应对",不是"整体最优"。协调博弈(如约定开车靠左还是靠右)、性别之战(Battle of the Sexes)都出现多重均衡;猎鹿博弈(Stag Hunt)则是"安全 vs 高效"的冲突。
性别之战(丈夫想去看球赛、妻子想去看芭蕾):
两个纯策略 NE:(球赛,球赛)、(芭蕾,芭蕾)。问题来了:均衡不唯一时,哪个会被选?这就引出混合策略与精炼。
(4)混合策略纳什均衡
当没有纯策略 NE 或 NE 不唯一时,允许参与人以概率分布随机选择。混合策略是 \(S_i\) 上的概率分布。均衡条件是:每个人以正概率选择的每个纯策略,其期望支付都相等,且不小于没选纯策略的期望支付。典型的"石头剪刀布""抛硬币(Matching Pennies)"都没有纯策略均衡,只存在混合均衡。
抛硬币博弈(A 猜中 B 的硬币面赢 1,否则输 1)中,令 A 猜正概率为 \(p\)、B 出正概率为 \(q\),均衡解为 \(p=q=\frac12\)。
混合均衡的"不偏离"含义更微妙:支付相等的条件保证参与人任意混合都不会更好。考点之一:利用"对手的混合概率使我的两个纯策略无差异"来列方程求解。
(5)纳什均衡的存在性(纳什定理)
定理(纳什,1950):任何有限博弈(参与者有限、每个策略集有限)都存在至少一个纳什均衡(允许混合策略)。证明用的是不动点定理(Kakutani/Brouwer):最优应对映射是连续的、凸值的,不动点即均衡。考试不会要求证明,但要能说出思路:均衡=最优应对映射的不动点。
典型题型/考点
- 给出 2×2(或 3×3)支付矩阵,求纯策略 NE、混合策略 NE。
- 用划线法找 NE;说明"划线相同的格"。
- IESDS 后剩下的策略组合。
- 判断某组合是否为 NE;讨论均衡的效率(囚徒困境/猎鹿博弈)。
- 概念题:NE 与占优策略均衡的关系(占优均衡一定是 NE,反之不然)。
为什么这一章重要
纳什均衡是整个非合作博弈论的基石,是后面所有均衡概念的"母版本"。它是算法博弈论的核心对象(求 NE、估计均衡的复杂性都是热点),也是经济学"市场均衡"在策略情境下的推广。学会"最优应对不动点"这一视角,等于掌握了整门课的分析语法。
第三章 完全信息动态博弈:承诺与威胁
这一章在干什么
从"同时"走向"先后"。一旦有先后,先手要考虑后手的反应,后手的某些"威胁"是不可信的。本章用博弈树描述先后决策,用逆向归纳法求解,得到比纳什均衡更强的子博弈精炼纳什均衡(SPNE)。
核心内容
(1)扩展式与博弈树
把博弈画成一棵树:节点=决策点(标注轮到谁行动)、枝=行动、末端=支付;还要标注信息集——同一信息集内的节点,行动者分辨不出自己在哪个节点(不完全信息时才有非单点信息集)。策略 vs 行动在这里格外重要:策略是"每个信息集上选什么"的完整计划。
(2)逆向归纳法与海盗分金
逆向归纳(Backward Induction):从最后一个决策节点往前推,在每一步假设"该节点上的理性人会选对自己最优的行动",并把最优结果"结算"回前一个节点。这是动态博弈最重要的求解技术。
海盗分金(经典题):5 个海盗要分 100 枚金币,提案人提出方案,若至少半数(含自己)投赞成则通过,否则提案人喂鲨鱼,由下一个人继续提案。逆向归纳结果出人意料:5 号海盗能拿到 98 枚。思路:从只剩 1 人(5 号)倒推——只剩 4、5 号时,4 号必须拿自己一票,方案(0,100)才能过……逐层倒推即可得到 5 号的收买名单。关键考点:被喂鲨鱼的威胁对提案人不可怕时,买票成本会变得极低。
(3)子博弈精炼纳什均衡(SPNE)
子博弈:从某个信息集为单点(决策者知道自己在哪)的节点开始,取其后所有部分构成的博弈。SPNE:纳什均衡,且其策略在每一个子博弈上都构成纳什均衡。换句话说:不是"纸面威胁",而是"事后我真的会执行"。逆向归纳求出的就是 SPNE。
(4)承诺与可信威胁——蜈蚣博弈与市场进入
蜈蚣博弈(Centipede):两个参与人轮流选"拿/让",拿了就结束,让则钱翻倍;最后一步不拿也结束。逆向归纳得出:第一步就有人拿——尽管"都让到底"能让总支付极大。这就是"理性倒推导致坏结果"的生动例子,也是实验经济学家常拿来打脸的博弈。
可信威胁的经典场景——市场进入(Entry Deterrence):在位者威胁"你进来我就降价拼到底",但真的打起来双方都亏;进入者若判断这个威胁不可信,就会进入。在位者要让它可信,必须预先做出不可逆的承诺:比如预先投下大产能(沉没成本)、与工会签下高工资协议。承诺的关键是"烧掉自己的退路",让"惩罚"变成事后最优。还有"承诺让失控的暴脾气替你行动"(如谈判中让别人无法撤回),都围绕同一思想:把不可信的威胁变成可信的。
(5)策略性先行者优势(先手优势)
Stackelberg 竞争里,先定产量者获得先手优势——因为后手的最优反应会被先手"预支"进自己的决策。反过来,也有后发优势的场景。核心是:动态博弈的价值在于谁有耐心、谁能把自己的选择变成既定事实。
典型题型/考点
- 用逆向归纳法求扩展式博弈的 SPNE,并写出两方完整策略。
- 判断某个"威胁"是否可信;设计承诺使其可信(如"提高沉没成本")。
- 海盗分金、蜈蚣博弈等经典题。
- 画博弈树、写出策略集合、指出子博弈。
- 计算 Stackelberg 均衡产量。
为什么这一章重要
"可信承诺"直接通向社会与经济学现象:威慑、进入壁垒、合同与抵押、谈判拖延。在计算机/人工智能领域,"逆向归纳 + 完备策略"是序贯决策(博弈树搜索、AlphaGo 的最小最大/蒙特卡洛树搜索)的思想源头。SPNE 把"空头威胁"从模型里剔除,是均衡概念第一次"精化"。
第四章 不完全信息静态博弈:贝叶斯纳什均衡
这一章在干什么
引入"底牌":我行动时不知道你的类型(成本、偏好、私有信息),只知道你有先验概率分布。本章的任务是把"不确定的静态博弈"翻译成"确定类型下的博弈",然后定义贝叶斯纳什均衡(BNE)。
核心内容
(1)类型与海萨尼转换
- 类型(type) \(\theta_i\):参与人私有的、决定其支付函数的特征。
- 海萨尼转换(Harsanyi transformation):把"信息不对称的静态博弈"转化为"自然界(Nature)先按共同先验 \(p\) 为每个人抽取类型、然后大家同时行动"的等价博弈。这样,原有的"不完全信息"就被改写成"不完全信息下的动态博弈(但动作同时)",模型由此变得可分析。
转换后的关键是:每个人知道自己类型,但不知道别人类型;所有人的先验是共同知识。 参与人最大化的是期望支付(对自己类型取平均)。
(2)贝叶斯纳什均衡(BNE)
每个参与人(在每个类型下)选择使自己期望支付最大化的策略,给定其他人的策略(同样按类型行事)。
更形式化:策略 \(\sigma_i(\theta_i)\) 使
最大化。注意关键点:BNE 是"每个类型一个行动"的完整计划——对手不知道你的类型,所以你的策略必须针对"如果你是某种类型会怎么选"来定义。别人凭你对信号的反应来反推你的类型,这在下一章会成为重点。
(3)一个可考的经典例子
不完全信息 Cournot 博弈:企业 1 成本已知,企业 2 的成本是"高"或"低",企业 1 只知道概率。均衡中,企业 2 高成本、低成本分别产出 \(q_2^H,q_2^L\),企业 1 依据期望利润定 \(q_1\),最后解一组联立的最优反应方程即可。核心手法:对方"按类型行事"的策略让自己无法用单一数字概括,只能对期望支付求最优。
典型题型/考点
- 给出类型与先验,求 BNE 中每个类型的选择。
- 画"自然+类型"的博弈树并说明海萨尼转换。
- 判断策略是否构成 BNE("没有人能在任何类型下通过单边偏离改善")。
- 辨析:不完全信息 vs 不完美信息(不完全=不知支付/类型;不完美=不知已发生的行动,如洗牌后看不到结果)。
为什么这一章重要
海萨尼转换把"信息"变成了可以建模的随机变量,为整个机制设计与信息经济学铺路:拍卖、逆向选择(二手车市场)都在此框架内。计算机科学里,"类型=私有数据",BNE 是分布式算法与机制设计中激励兼容分析的标准工具。
第五章 不完全信息动态博弈:信号与甄别
这一章在干什么
在"有底牌 + 有先后"的世界里,先手可能主动泄露信息(发信号),后手则据行动推断类型(甄别/筛选)。本章引入最强、最常用的均衡概念:精炼贝叶斯均衡(PBE),并研究两种典型结果:分离均衡与混同均衡。经典案例是二手车市场(柠檬市场)和教育信号。
核心内容
(1)从 BNE 到 PBE:加上"后验信念"
PBE 包含三样东西:① 策略组合(每个信息集上的行动);② 信念(belief)——每个信息集上"对手属于各类型的概率";③ 要求策略在给定信念下是每个信息集的最优应对,且信念与均衡策略一致(用贝叶斯规则更新)。
精髓:均衡要能解释你凭什么相信对方是那种类型——信念从行动中"读"出来。与 BNE 的区别:BNE 只有事前先验,PBE 多了事后更新(沿均衡路径用贝叶斯公式;脱均衡路径上信念可自由设定,但要能支持均衡)。这正是"信息×时序"矩阵的最后一块拼图。
(2)信号传递与二手车市场
二手车市场(Akerlof 柠檬市场):卖者知道车况(好/坏),买者只知"好车占比 \(p\)"。若信息完全透明,好车卖高价、坏车卖低价;但买者只能用平均质量出价,好车卖不划算就退出市场 → 市场里只剩坏车("柠檬")→ 逆向选择,市场萎缩甚至崩溃。这就是"信息不对称会把好产品赶出市场"的著名结论。
信号传递(signaling):好车卖者主动提供承诺式信号(如保修期、第三方检测)来区分自己。信号要可信,必须满足分离条件——对不同类型"发送信号的代价"不同(好车提供保修便宜,坏车很贵),代价差异正是信号能分离类型的原因。教育经济学用它解释"文凭是信号"。
(3)混同均衡与分离均衡
- 分离均衡(separating):不同类型选择不同信号,后手完全看穿类型。例:高能力者读名校、低能力者不读,企业看学历就知道能力。
- 混同均衡(pooling):不同类型选择相同信号,后手无法区分,只能按先验平均出价。例:所有人都不读研,企业只能按平均能力给工资。
- 半分离(semi-separating):部分区分。
判定题型中常见的坑:脱均衡路径的信念不能乱设——分离均衡中"选择另类信号"者的信念必须支持"不偏离";若设定了让偏离有利的信念,均衡就不成立。还要用直觉标准(Intuitive Criterion) 等精炼剔除"离谱信念"(概念了解即可)。
(4)信息甄别(screening)
甄别是接收信号一方主动设计"菜单"让类型自我选择。经典:保险公司提供多档合同(高保费高赔付 vs 低保费低赔付),让高风险客户自动挑贵的那档,实现风险分层;雇主设计合同菜单筛选员工。关键区别:信号传递=信息优势方主动亮牌;信息甄别=信息劣势方设计筛选机制。两者是"主动 vs 被动"的关系。
典型题型/考点
- 给定信号博弈,求 PBE 并判断是分离还是混同均衡。
- 写出后验信念,验证"策略在均衡路径上最优、信念用贝叶斯更新"。
- 二手车市场数值题:求市场崩溃的临界比例 \(p^*\)。
- 设计甄别合同让不同类型自我选择(激励相容条件)。
- 判断某信号是否有效(信号代价须与类型负相关)。
为什么这一章重要
信号与甄别是信息经济学的核心,解释广告、文凭、金融监管、保险分层等大量现实。机制设计与算法博弈论中的真实性(truthfulness)同样依赖"让不同类型的报告者说真话"的分离机制。PBE 也是现代博弈论中使用最广的均衡概念之一。
第六章 重复博弈:合作如何在惩罚中存活
这一章在干什么
把同一个"阶段博弈"玩很多次。单次博弈里无法实现的合作(囚徒困境),在重复中可以通过"胡萝卜+大棒"实现。本章的核心结论是无名氏定理(民间定理):只要你有耐心,几乎任何"个人理性"的结果都可以成为均衡。
核心内容
(1)有限次重复:结局悲观的逆向归纳
囚徒困境玩有限 \(T\) 次:用逆向归纳,最后一期一定背叛(单期占优);既然最后一期无论如何都背叛,倒数第二期也没理由合作……合作彻底瓦解。有限次重复囚徒困境的唯一均衡是每期都背叛。这就是著名的"有限期合作悖论"。
注意区分:若阶段博弈存在多重均衡(如协调博弈),有限次重复也能支撑一定合作(用"最后一期的多重均衡"做奖惩杠杆),但囚徒困境不行。
(2)无限次重复与贴现
无限次重复中博弈没有"最后一期",逆向归纳失效。用贴现因子 \(\delta\)(耐心程度,\(\delta=\frac{1}{1+r}\))折算未来支付,总支付为:
(3)触发策略与"冷酷/宽恕"
触发策略(Trigger Strategy):
- 冷酷触发(Grim Trigger):先合作;一旦对方背叛,从此永远背叛。"永远"的惩罚要重到让对方不敢赌。
- 针锋相对(Tit-for-Tat):模仿对手上一期行为。简单、报复及时、容易原谅,是迭代囚徒困境锦标赛冠军。
(4)无名氏定理(Folk Theorem)
定理:在无限次重复博弈中,若 \(\delta\) 足够接近 1,则任何可行且个人理性(每人的平均支付不低于其最小最大支付 \(\underline{v}_i=\max_{s_i}\min_{s_{-i}}u_i\))的支付向量,都可以由某个子博弈精炼均衡实现。
含义:只要有耐心(\(\delta\) 够大),"任何合理结果都能被均衡支撑"。惩罚机制(如"永远背叛")作为可信的威胁,把偏离者拉回合作。考试常考:给定 \(\delta\) 与参数,求"合作可持续"的临界贴现率 \(\delta^*\)——即"合作一次的好处 vs 背叛一次的好处再被惩罚"的临界值。
计算模板:囚徒困境中合作支付 \(c\)、背叛期即时收益 \(b\)、惩罚期支付 \(p\),合作可持续当且仅当
(5)合作与惩罚的现实注脚
卡特尔合谋、OPEC、企业之间的"默契价格",都可用无名氏定理解释。社会学/政治学里"声誉"(reputation)本质也是无限次重复中的合作均衡。惩罚力度与耐心是两个决定性参数。
典型题型/考点
- 给定阶段博弈和 \(\delta\),判断冷酷触发策略是否构成均衡,求临界 \(\delta^*\)。
- 有限次重复的逆向归纳论证。
- 计算最小最大支付 \(\underline{v}_i\),判断某支付向量可否被均衡支撑。
- 比较不同触发策略的稳定性(冷酷 vs 针锋相对 vs 宽容)。
为什么这一章重要
重复博弈是合作行为为什么能在利己者之间存在的最有力解释,也是机制设计、拍卖理论、区块链共识(激励相容)、声誉系统(电商信用)的理论基础。它告诉你:约束 + 可信惩罚 = 合作。
第七章 讨价还价与合作博弈
这一章在干什么
两个"选边站"的世界:一是讨价还价(双方轮流报价、有耐心博弈的谈判);二是合作博弈(联盟怎么分钱才算"公平又稳定")。本章偏进阶,以概念与计算为主。
核心内容
(1)鲁宾斯坦讨价还价(Rubinstein Bargaining)
两个人分一块大小为 1 的蛋糕,轮流报价:A 先报,B 接受则成交,拒绝则轮换由 B 报,直到成交。每次拒绝都要付出等待成本,用贴现因子 \(\delta_A,\delta_B\) 刻画耐心。
均衡结论(用逆向归纳解无穷回合):第一份报价 A 拿走
剩下给 B。直觉:越有耐心(\(\delta\) 越大),分得越多;若 \(\delta_A=\delta_B=\delta\),则 A 拿 \(\frac{1}{1+\delta}\),先手有优势。核心考点:用"马尔可夫策略 + 逆向归纳"列方程求解,而非穷举。
(2)合作博弈的基本元素
- 特征函数 \(v(S)\):联盟 \(S\) 在不与外部合作时能保证获得的总支付。
- 核(Core):所有分配 \(x=(x_1,\dots,x_n)\)(满足 \(\sum x_i = v(N)\),且任何子联盟 \(S\) 都无理由出走:\(\sum_{i\in S}x_i \ge v(S)\))。核里的分配是"稳定"的,但核可能为空(\(n\ge3\) 的多数表决博弈就没有核)。
(3)沙普利值(Shapley Value)
沙普利值是给每个参与者分配支付的一种公理化规则,满足三条公理:有效性(\(\sum \phi_i = v(N)\))、对称性(同贡献者同价值)、可加性。公式:
含义:\(i\) 在所有"加入顺序"中对联盟边际贡献的平均。可结合例子手算(如三人多数表决 \(v(S)=1\) 当 \(|S|\ge2\):两个"关键少数"各得 \(1/2\),第三人得 \(0\),或三人权重不同时给出相应值)。它公平地奖励"边际贡献",也是机器学习中特征重要性(SHAP)的理论来源。
典型题型/考点
- 鲁宾斯坦谈判:列方程求均衡分配;说明耐心与先手优势。
- 求给定特征函数下的核,判断核是否为空。
- 用沙普利值公式对小型 \(n=3\) 博弈手算分配。
- 概念辨析:合作博弈关注"怎么分",非合作博弈关注"怎么选"。
为什么这一章重要
讨价还价解释谈判、罢工、价格战;合作博弈的核与沙普利值用于成本分摊、电力市场结算、拍卖收益分配,并直接催生了算法博弈论中的公平分配(fair division)。了解它们,是从"策略"走向"分配/机制"的桥梁。
第八章 应用专题:拍卖、机制设计与演化博弈
这一章在干什么
把前面所有工具用在三个真实舞台上:买者竞价(拍卖)、设计者逆推(机制设计)、群体自适应(演化博弈)。这几块在近年考题中占比上升,值得认真过一遍。
核心内容
(1)拍卖理论
- 四种基本拍卖:英式(公开喊价,逐步加价)、荷式(由高到低降价)、一级价格密封拍卖(密封报价,出价最高者按自己的报价付款)、二级价格密封拍卖/维克里拍卖(出价最高者赢,但付第二高价)。
- 关键结论:收益等价定理(Revenue Equivalence)——在私有价值、对称、风险中性、独立类型下,四种拍卖给卖者的期望收益相同。
- 一级价格密封拍卖中,理性出价应低于估值(要留利润空间、又要赢),均衡出价 \(b(v)=\frac{n-1}{n}v\)(均匀分布、\(n\) 个竞买人时)。二级价格密封拍卖的优美之处:"说实话"是占优策略——你的出价只决定你赢不赢,不决定你付多少。
- 共同价值 vs 私有价值:前者(如油田)里有"赢者诅咒"——赢家往往出价过高。
(2)机制设计:设计"说实话"的规则
机制设计是"反向的博弈论":不是给定规则求均衡,而是给定想要的结果,设计规则让自利参与者自愿实现它。
- 显示原理(Revelation Principle):任何均衡结果都可以用一个"直接显示机制"实现——参与者直接报类型,机制决定结果,且报真实类型构成均衡。它让分析退化为"直接机制"。
- 激励相容(Incentive Compatibility):说真话对每个人都是最优;个体理性/参与约束:参与者愿意参加(拿到不少于外部机会)。
- VCG 机制:拍品/公共项目分配中,"按真实价值竞价 + 赢者付社会成本"能同时做到真实与有效率(分配与支付分开定价)。
(3)演化博弈初步
放弃"完全理性",改问:如果策略靠复制(遗传/模仿)传播,什么策略能在群体中长期存活?
- 鹰鸽博弈(Hawk–Dove):争夺资源时"鹰"好斗、"鸽"退缩。纯群体全是鹰时,鸽反而能趁虚而入;纯群体全是鸽时,鹰入侵赚翻。演化稳定策略(ESS):一个策略若被少量突变"入侵"时仍不劣,就是 ESS。鹰鸽博弈的 ESS 通常是混合策略(鹰比例与资源价值、打架成本有关)。
- 计算 ESS 的途径:\(\pi(x,x) \ge \pi(y,x)\)(且等号时有更严条件)——即"当大家都用 \(x\) 时,突变 \(y\) 没有更高适应度"。
- 复制者动态(Replicator Dynamics):\(\dot x_i = x_i(\pi_i - \bar\pi)\),适应度高于平均者频率上升。ESS 是复制者动态的渐近稳定点(反过来不成立)。
典型题型/考点
- 求一级价格密封拍卖的均衡出价函数。
- 证明维克里拍卖中"报真实估值是占优策略"。
- 判断某个机制是否激励相容、是否个体理性。
- 求鹰鸽博弈的 ESS(混合)。
- 用复制者动态判断某状态是否稳定。
为什么这一章重要
拍卖与机制设计是理论直接变成产业的地方(频谱拍卖、广告竞价、供应链、区块链),VCG 是"经济学→计算机"最著名的桥梁;演化博弈则把博弈论从"人"推广到"基因/算法/社会习俗",是理解合作涌现的进化视角。
四、全书收尾
理性人策略互动(主线)
│
┌────────────┴────────────┐
信息完全 信息不完全
│ │
┌────┴────┐ ┌────┴────┐
静态 动态 静态 动态
│ │ │ │
纳什均衡 子博弈精炼 贝叶斯纳什 精炼贝叶斯
(NE) 纳什均衡 均衡(BNE) 均衡(PBE)
(SPNE) │
(逆向归纳/承诺) 分离/混同/信号甄别
│
┌──────────┴──────────┐
重复博弈(合作/触发/无名氏定理) 讨价还价与合作博弈(核/沙普利值)
│
┌──────┴──────┐
拍卖 / 机制设计 / 演化博弈(应用与延伸)
几句话总结:
- 一条主线:从"没人愿意单方面偏离"出发,随信息(完全→不完全)与时序(静态→动态)两大维度逐步精化均衡概念——NE → SPNE → BNE → PBE。
- 四大工具:矩阵(静态)、博弈树 + 逆向归纳(动态)、类型 + 先验(不完全信息)、信念 + 贝叶斯更新(信号)。
- 一组母题:囚徒困境(个体 vs 集体)、性别之战(多重均衡)、海盗分金/蜈蚣博弈(逆向归纳的反直觉)、二手车市场(逆向选择)、鹰鸽博弈(演化稳定)。
- 两条升华:重复博弈证明"惩罚+耐心能产生合作";机制设计证明"规则能让人自愿说真话"。
复习权重建议:第 2 章(NE 计算)★★★★★ → 第 3 章(逆向归纳/SPNE)★★★★★ → 第 5 章(信号博弈/PBE)★★★★ → 第 6 章(无名氏定理与临界贴现率)★★★★ → 第 4 章(BNE)★★★ → 第 8 章(拍卖/ESS 计算)★★★ → 第 7 章(沙普利值/鲁宾斯坦)★★ → 第 1 章(概念)★。
祝考试顺利——记住那句话:永远问自己:"如果我站在对方的每一个信息集上,还愿不愿意按这个策略走下去?" 这就是博弈论的全部精髓。

浙公网安备 33010602011771号