01 · FUNDAMENTALS博弈基本概念
- 参与者 (Players):理性决策者,目标是最大化自身收益
- 策略 (Strategies):每个参与者的行动空间 Si
- 收益 (Payoffs):函数 ui(s1, s2, …) 描述策略组合下的效用
静态:同时行动,信息同步(Normal Form,收益矩阵)
动态:先后行动,后者可观察前者(Extensive Form,博弈树)
完全信息:所有收益函数是公开知识(common knowledge)
不完全信息:部分私有信息(类型 type),引入 Bayes-Nash 均衡
02 · DOMINANCE占优策略
ui(si, s-i) > ui(si′, s-i)
理性人永远不会选择被严格占优的策略 → 可迭代删除(IESDS)。
设A、B两家公司各自选择投放广告(Advertise)或不投放(No Ad):
| B: Advertise | B: No Ad | |
|---|---|---|
| A: Advertise | (3, 3) | (5, 1) |
| A: No Ad | (1, 5) | (4, 4) |
对A:无论B选什么,Advertise ≥ No Ad(3>1 且 5>4)→ Advertise 严格占优
对B:同理,Advertise 严格占优
结论:均衡 (Advertise, Advertise),收益 (3,3)——典型囚徒困境结构。合作(No Ad, No Ad)可以给双方更高收益(4,4),但均衡是次优的。
03 · NASH EQUILIBRIUM纳什均衡(纯策略)
ui(si*, s-i*) ≥ ui(si, s-i*) ∀ si ∈ Si
即:在对手策略不变的前提下,没有人有单独偏离的动机。
| B: Left | B: Right | |
|---|---|---|
| A: Up | (2, 1) | (0, 0) |
| A: Down | (0, 0) | (1, 2) |
• A的最优反应:B选Left → A选Up(2>0);B选Right → A选Down(1>0)
• B的最优反应:A选Up → B选Left(1>0);A选Down → B选Right(2>0)
纯策略NE:(Up, Left) 和 (Down, Right) —— 两个均衡,是典型协调博弈。
注意:还存在一个混合策略NE(见Section 4)。
04 · MIXED STRATEGIES混合策略均衡
A选正/反,B猜正/反。猜对B赢1元,猜错A赢1元(零和博弈):
| B: 猜正 | B: 猜反 | |
|---|---|---|
| A: 正 | (-1, +1) | (+1, -1) |
| A: 反 | (+1, -1) | (-1, +1) |
无纯策略NE(无论哪个格,某方想偏离)。
求混合NE:设 A 以概率 p 出正;B 以概率 q 猜正。
均衡:双方各以 1/2 随机选择,期望收益均为 0。
| B: Left | B: Right | |
|---|---|---|
| A: Up | (4, 2) | (0, 3) |
| A: Down | (3, 0) | (1, 4) |
无纯策略NE(请验证:每格都有人想偏离)。
求 A 的混合策略:让 B 对 Left/Right 无差异。设 A 以概率 p 选 Up:
Wait: 让 B 无差异需要调整 A 的混合。重新:
这说明矩阵中 B 实际上有占优策略:Right 弱占优(2 vs 3, 3 vs 4),等等——
删除 B:Left,A 在 (Up:0, Down:1) 中选 Down。
唯一纯策略NE = (Down, Right),收益 (1,4)。这说明先用 IESDS 再找NE 更高效。
夫妻二人选择看足球(F)或看歌剧(O):
| B: 足球(F) | B: 歌剧(O) | |
|---|---|---|
| A: 足球(F) | (2, 1) | (0, 0) |
| A: 歌剧(O) | (0, 0) | (1, 2) |
纯策略NE:(F,F) 和 (O,O)。
混合策略NE:设 A 以概率 p 选 F,B 以概率 q 选 F:
总结:3个均衡 — (F,F), (O,O), 和混合策略(2/3, 1/3)。
05 · CLASSIC GAMES囚徒困境
| B: 合作(C) | B: 背叛(D) | |
|---|---|---|
| A: 合作(C) | (R, R) = (3,3) | (S, T) = (0,5) |
| A: 背叛(D) | (T, S) = (5,0) | (P, P) = (1,1) |
参数条件:T > R > P > S,且 2R > T + S(合作总和更优)
做市商之间存在囚徒困境结构:若所有做市商都把 spread 缩到极小,利润极低(类似 P,P);若某人保持较宽 spread 其他人缩小,后者抢走订单(T vs S)。
但在重复博弈中(每天持续交易),触发策略(Grim Trigger)可维持合作——若有人压缩 spread,其他人立刻报复,使压缩者长期收益下降。因此现实中 spread 保持在某个有利润的水平,不会竞争到零。
06 · COORDINATION猎鹿博弈 · 协调博弈
| B: 猎鹿(S) | B: 猎兔(H) | |
|---|---|---|
| A: 猎鹿(S) | (4, 4) | (0, 3) |
| A: 猎兔(H) | (3, 0) | (3, 3) |
(S,S):帕累托最优均衡,但需要信任对方合作
(H,H):风险占优均衡,更"安全"(guaranteed 3)
Pareto Dominant NE vs Risk Dominant NE:
现实中协调失败 → 陷入次优均衡,需沟通/承诺机制
07 · ANTI-COORDINATION胆小鬼博弈 · Chicken Game
| B: 直行(D) | B: 转向(C) | |
|---|---|---|
| A: 直行(D) | (-10,-10) 撞车 | (+1, -1) |
| A: 转向(C) | (-1, +1) | (0, 0) |
- 两个纯策略NE,均为反协调:(D,C) 和 (C,D)
- 存在混合策略NE:设对称,令对手无差异
- 先承诺优势(First-mover advantage):先公开宣布"我不会转向"可获得优势
- 金融应用:双寡头价格战、银行救助博弈(谁先认亏)
设 A 以概率 p 选直行(D),让 B 对 D/C 无差异:
由对称性 q = 1/10。混合NE:双方各以1/10概率直行,9/10概率转向。
期望收益:B = -1/10 = -0.1(小负数,但好过撞车)
08 · CLASSIC GAMES性别之战 Battle of Sexes
已在 Section 4 混合策略部分详细讲解。核心要点:
- 两个纯策略NE + 一个混合策略NE(共3个)
- 混合NE期望收益 = 2/3 < 纯策略NE(1或2),混合NE 帕累托劣于纯NE
- 如何协调?→ 先行承诺、沟通机制、重复博弈中的惯例形成
09 · DYNAMIC GAMES序贯博弈 · 逆向归纳
在位者(I) vs 进入者(E):E 先决定进入(In)或不进(Out),I 然后决定对抗(F)或默许(A)。
逆向归纳:
SPNE = (In, Accommodate),收益 (1, 1)
注意:I 威胁"你进来我就打"是不可信威胁,因为真进来后 I 自己也受损,不会执行。SPNE 消除了这种威胁。
A和B轮流决定:在自己回合选 Stop(S) 或 Pass(P)。每轮 Pass 使总收益增长但分配给下一个人更多。
逆向归纳:
SPNE:A 在第一回合就 Stop,收益(2,0)。
Stackelberg 领导者博弈(产量竞争):
Leader 先设产量 q₁,Follower 观察后设 q₂。市场价格 P = 100 - q₁ - q₂,零成本。
Cournot(同时)均衡:q₁=q₂=100/3≈33.3,各得约1111。
先动优势:Leader 收益 1250 > Cournot 1111,先行承诺有利。
10 · REPEATED GAMES重复博弈 · 触发策略
若有限次重复,逆向归纳推回:每轮均衡是单次博弈均衡。合作无法维持。
(除非有多个均衡,或者存在信誉效应)
贴现因子 δ∈(0,1),当 δ 足够大(玩家足够有耐心),合作均衡可以用触发策略支撑。
无限重复囚徒困境,收益:合作(C,C)得 R=3,背叛得 T=5,惩罚得 P=1。
Grim Trigger 策略:从合作开始,一旦有人背叛,永远背叛。
结论:当贴现因子 δ ≥ 1/2(即玩家足够有耐心),Grim Trigger 可维持合作均衡。
11 · AUCTIONS拍卖理论
最高出价者获胜,支付自己报价。
策略:低报(shading)— 报价低于真实估值以获取正剩余
最高出价者获胜,支付第二高出价。
策略:如实出价(dominant strategy)
直觉:虽然一价拍卖出价低但更经常赢,二价出价高但少赢,期望收益抵消。
n=2,v~U[0,100],最优报价公式:
即:出自己估值的一半。
验证:对手报价 b' = v'/2,v'~U[0,100],期望收益:
卖家期望收益 = E[第二高估值] = E[min(v₁,v₂)] = 100/3 ≈ 33.3
(与二价拍卖等价,验证RET)
场景:石油开采权拍卖,真实价值 V 对所有人相同但未知。每个竞标者得到含噪声的信号 sᵢ = V + εᵢ,其中 εᵢ~N(0,σ²) 独立。
Winner's Curse:赢得拍卖意味着你的信号是最高的,而最高信号往往高估了真实价值。
金融中的 Winner's Curse:
- IPO 认购:机构对热门 IPO 的分配往往意味着机构不想要该股票(逆向选择)
- 并购溢价:收购成功往往意味着你出价最高,可能高估了协同效应
- 做市商:成交说明对方有信息优势(Adverse Selection)
12 · MARKET MAKING做市商博弈
- Bid(买价):做市商愿意买入的价格
- Ask/Offer(卖价):做市商愿意卖出的价格
- Spread = Ask - Bid:做市商利润来源
- 做市商面临:逆向选择风险(对方知道真实价值)+ 库存风险
参与者:知情交易者(Insider)、噪声交易者(Noise Traders)、做市商(MM)。
均衡性质:
- 内幕交易者分散交易(不一次性全押),以免价格过快反映信息
- 做市商根据观察到的总订单流(知情+噪声)推断信息,调整价格
- 均衡价格线性:P = μ + λ·Q(λ = 市场冲击系数,Kyle's Lambda)
资产价值 = 掷一个公平骰子的点数,真实期望 = (1+2+3+4+5+6)/6 = 3.5。
基础报价:Bid = 3.0,Ask = 4.0(spread = 1)
追问:对手下注方向有信息时如何调整?
- 若对方反复买(Ask方向),可能他知道点数高 → 上调 Bid/Ask
- 若对方反复卖(Bid方向),可能他知道点数低 → 下调 Bid/Ask
- 贝叶斯更新:若有人买,P(点数≥4|买) > 0.5 → 提升中心估计
假设:以概率 μ 遇到知情交易者,以概率 1-μ 遇到噪声交易者。
资产真实值:高概率时为 V_H,低概率时为 V_L,先验期望 E[V] = V₀。
关键结论:逆向选择越严重(μ↑)或资产不确定性越大(V_H-V_L↑),最优spread越宽。
13 · POKER & BLUFFING扑克与 Bluffing 博弈
- 不完全信息博弈 (Incomplete Information):不知道对手牌
- Mixed strategy 的自然应用:需要以一定频率 Bluff,否则对手会 fold 所有 Bluff
- 最优 Bluff 频率:由底池赔率(Pot Odds)决定
River bet:底池100,你下注50(总底池变150)。
对手视角的底池赔率:call 50 赢 150,需要胜率 ≥ 50/150 = 1/3。
即对手在你 Bluff 概率 > 1/3 时应该 call;≤1/3 时 fold 是正确的。
2人,各有1张牌,J/Q/K等概率各1/3。下注规则:可 Bet 1 或 Check。只有一轮下注。
高牌赢1元。问:持有Q的玩家应以多大概率 Bet?
这类题的关键不在精确计算,而在于展示博弈论思维:识别强/弱/中间手牌的不同策略角色,用混合NE分析最优频率。
14 · BAYESIAN GAMES贝叶斯博弈 · 不完全信息
卖家拍卖物品,买家估值 v ∈ {高:10, 低:5},各概率1/2,私有信息。一价密封拍卖,两个买家。
BNE = {高类型出5,低类型出2.5}。
强类型(S)和弱类型(W)求职者,以概率0.5各出现。发信号:大学学历(E)或不上学(N),教育本身无生产价值。雇主决定高薪(H)或低薪(L):
Spence 信号博弈的核心洞见:成本优势使得高类型能通过"昂贵信号"与低类型区分。
15 · SIG CLASSICS经典脑筋急转弯 / 快问快答
100人各猜0-100的整数,猜中所有人猜测平均值2/3的获胜。你猜多少?
实验结果:大多数人在 Level 2-3,答案在 22-33 区间。纳什均衡是0,但实际人不到那个层次。
金融应用:"股票价格不是资产真实价值,而是市场对他人预期的预期。"(Keynes 选美理论)→ 动量、泡沫形成的理论基础。
100个按级别排序的海盗分1000枚金币。最高级提方案,严格多数通过则执行,否则他被扔海里,下一个提。问:第1个海盗怎么提才能存活并最多得金币?
答案:海盗1提 (1,0,1,0,...,1,0,951),给所有偶数位置各1枚,自己拿951。
关键:逆向归纳 + 每人只需要刚好超过半数的票。
A命中率=100%,B=75%,C=50%。轮流射击,先被击中的出局。问:C的最优策略?
教训:在多方博弈中,最弱者通过"让强者先互斗"可以提高生存率。
二手车市场(Lemons Problem,Akerlof 1970):
- 好车价值8000,坏车(lemon)价值4000,各占50%
- 买家不能区分,愿意出均值 = 6000
- 好车卖家知道自己车好,6000 < 8000 → 不卖
- 市场上只剩坏车 → 买家调低期望到4000 → 好车进一步退出
- 市场失灵:逆向选择导致好车无法在市场上交易
解决方案:信号(保修、车检)、担保机制(信誉)、第三方认证
你和陌生人需要在纽约市见面,但无法联系。你们会在哪里?什么时间?
经典答案:中央车站,正午12:00。
这就是 Schelling Point:在没有沟通的情况下,理性人会选择"显著"的答案,因为他们预期对方也会选它。
所有参与者都支付自己的出价,只有最高出价者获奖。(如选举广告、研发竞赛、诉讼)
直觉:all-pay 下每人出价更保守(知道必须付钱),恰好抵消了输家也付钱的额外收益,期望总付款不变。
你面前有两个信封,一个金额是另一个的2倍。你打开一个,里面是100元。要不要换?
面试中展示对悖论的清醒认识比"换"或"不换"更重要。
SUMMARY博弈类型快速对照
| 博弈类型 | 经典例子 | NE特征 | SIG相关性 |
|---|---|---|---|
| 囚徒困境 | 价格战、广告竞争 | 社会次优,背叛占优 | 做市 spread 竞争 |
| 协调博弈 | 猎鹿、市场标准 | 多个NE,协调问题 | 市场惯例形成 |
| 反协调博弈 | Chicken,产品差异化 | 多个NE,混合NE | 做市策略差异化 |
| 序贯博弈 | 进入博弈,Stackelberg | SPNE,逆向归纳 | 先动/后动优势分析 |
| 重复博弈 | 长期合作关系 | δ≥阈值时合作 | 长期客户关系 |
| 一价拍卖 | 政府采购 | 低报,b=v(n-1)/n | ★ 高频考点 |
| 二价拍卖 | eBay, Google AdWords | 如实出价占优 | ★ 高频考点 |
| 信号博弈 | 教育、分红、信誉 | 分离/混同均衡 | IPO承销,逆向选择 |
| 做市博弈 | Kyle模型,GM模型 | 最优spread,贝叶斯更新 | ★★ SIG核心 |