01 · FUNDAMENTALS博弈基本概念

博弈的三要素
  • 参与者 (Players):理性决策者,目标是最大化自身收益
  • 策略 (Strategies):每个参与者的行动空间 Si
  • 收益 (Payoffs):函数 ui(s1, s2, …) 描述策略组合下的效用
静态博弈 vs 动态博弈

静态:同时行动,信息同步(Normal Form,收益矩阵)

动态:先后行动,后者可观察前者(Extensive Form,博弈树)

完全信息 vs 不完全信息

完全信息:所有收益函数是公开知识(common knowledge)

不完全信息:部分私有信息(类型 type),引入 Bayes-Nash 均衡

SIG 面试中几乎所有题目默认理性人假设 + 共同知识。若题目给出不对称信息,要立刻识别为 Bayesian game。

02 · DOMINANCE占优策略

严格占优 (Strict Dominance)
策略 si 严格占优于 si′,若对所有对手策略组合 s-i
ui(si, s-i) > ui(si′, s-i)

理性人永远不会选择被严格占优的策略 → 可迭代删除(IESDS)。

📘 例题:两家公司广告博弈 — 找出占优策略

设A、B两家公司各自选择投放广告(Advertise)或不投放(No Ad):

B: AdvertiseB: No Ad
A: Advertise (3, 3) (5, 1)
A: No Ad (1, 5) (4, 4)

对A:无论B选什么,Advertise ≥ No Ad(3>1 且 5>4)→ Advertise 严格占优

对B:同理,Advertise 严格占优

结论:均衡 (Advertise, Advertise),收益 (3,3)——典型囚徒困境结构。合作(No Ad, No Ad)可以给双方更高收益(4,4),但均衡是次优的。

03 · NASH EQUILIBRIUM纳什均衡(纯策略)

定义
策略组合 (s₁*, s₂*, …, sₙ*) 是纳什均衡,当且仅当对每个参与者 i:

ui(si*, s-i*) ≥ ui(si, s-i*) ∀ si ∈ Si

即:在对手策略不变的前提下,没有人有单独偏离的动机。

面试快速寻找方法:在收益矩阵中,对每列找行最大值画圈(Row player BR),对每行找列最大值画方块(Col player BR)。同时被圈又被框的格子就是纯策略NE。
📘 例题:以下矩阵有几个纯策略纳什均衡?
B: LeftB: Right
A: Up (2, 1) (0, 0)
A: Down (0, 0) (1, 2)

• A的最优反应:B选Left → A选Up(2>0);B选Right → A选Down(1>0)

• B的最优反应:A选Up → B选Left(1>0);A选Down → B选Right(2>0)

纯策略NE:(Up, Left) 和 (Down, Right) —— 两个均衡,是典型协调博弈。

注意:还存在一个混合策略NE(见Section 4)。

04 · MIXED STRATEGIES混合策略均衡

核心原理:无差异条件
在混合策略均衡中,参与者对其支撑集内的每个纯策略无差异(expected payoff相等),否则会去掉差的策略。
📘 例题(经典):猜硬币游戏 — 求混合策略均衡

A选正/反,B猜正/反。猜对B赢1元,猜错A赢1元(零和博弈):

B: 猜正B: 猜反
A: 正(-1, +1)(+1, -1)
A: 反(+1, -1)(-1, +1)

无纯策略NE(无论哪个格,某方想偏离)。

求混合NE:设 A 以概率 p 出正;B 以概率 q 猜正。

B的无差异条件(对猜正/猜反期望相等): A出正让B猜正期望 = p·(+1) + (1-p)·(-1) = 2p - 1 A出正让B猜反期望 = p·(-1) + (1-p)·(+1) = 1 - 2p 令 2p-1 = 1-2p → p = 1/2 A的无差异条件(对称):q = 1/2

均衡:双方各以 1/2 随机选择,期望收益均为 0。

📘 例题:非对称收益矩阵的混合策略(SIG常考类型)
B: LeftB: Right
A: Up(4, 2)(0, 3)
A: Down(3, 0)(1, 4)

无纯策略NE(请验证:每格都有人想偏离)。

求 A 的混合策略:让 B 对 Left/Right 无差异。设 A 以概率 p 选 Up:

B选Left的期望: 2p + 0·(1-p) = 2p B选Right的期望: 3p + 4·(1-p) = 4 - p 令 2p = 4 - p → 3p = 4 → p = 4/3 ??

Wait: 让 B 无差异需要调整 A 的混合。重新:

B选Left期望 = 2p + 0·(1-p) = 2p B选Right期望 = 3p + 4(1-p) = 4 - p 2p = 4 - p → p = 4/3 (>1,不合法)

这说明矩阵中 B 实际上有占优策略:Right 弱占优(2 vs 3, 3 vs 4),等等——

检查 B:Left vs Right A=Up: B(Left)=2, B(Right)=3 → Right 更好 A=Down: B(Left)=0, B(Right)=4 → Right 更好 B 的严格占优策略:Right!

删除 B:Left,A 在 (Up:0, Down:1) 中选 Down

唯一纯策略NE = (Down, Right),收益 (1,4)。这说明先用 IESDS 再找NE 更高效。

面试技巧:求混合NE前先检查有无占优策略/IESDS,能大幅简化。
📘 例题:Battle of Sexes 的三个均衡

夫妻二人选择看足球(F)或看歌剧(O):

B: 足球(F)B: 歌剧(O)
A: 足球(F)(2, 1)(0, 0)
A: 歌剧(O)(0, 0)(1, 2)

纯策略NE:(F,F) 和 (O,O)。

混合策略NE:设 A 以概率 p 选 F,B 以概率 q 选 F:

让 B 无差异: B选F期望 = 1·p + 0·(1-p) = p B选O期望 = 0·p + 2·(1-p) = 2-2p p = 2-2p → p = 2/3 让 A 无差异: A选F期望 = 2q + 0(1-q) = 2q A选O期望 = 0·q + 1·(1-q) = 1-q 2q = 1-q → q = 1/3 混合NE:A选F概率=2/3,B选F概率=1/3 期望收益:A = 2·(1/3) = 2/3,B = 1·(2/3) = 2/3

总结:3个均衡 — (F,F), (O,O), 和混合策略(2/3, 1/3)。

05 · CLASSIC GAMES囚徒困境

收益矩阵(经典形式)
B: 合作(C)B: 背叛(D)
A: 合作(C)(R, R) = (3,3)(S, T) = (0,5)
A: 背叛(D)(T, S) = (5,0)(P, P) = (1,1)

参数条件:T > R > P > S,且 2R > T + S(合作总和更优)

核心悖论:背叛 D 是严格占优策略,但均衡 (D,D) 对双方都比 (C,C) 差。个人理性 ≠ 集体最优。
寡头定价 军备竞赛 公地悲剧 双边报价扩张
📘 SIG 面试口头题:为什么市场上买卖价差不会被竞争压缩到零?

做市商之间存在囚徒困境结构:若所有做市商都把 spread 缩到极小,利润极低(类似 P,P);若某人保持较宽 spread 其他人缩小,后者抢走订单(T vs S)。

但在重复博弈中(每天持续交易),触发策略(Grim Trigger)可维持合作——若有人压缩 spread,其他人立刻报复,使压缩者长期收益下降。因此现实中 spread 保持在某个有利润的水平,不会竞争到零。

06 · COORDINATION猎鹿博弈 · 协调博弈

B: 猎鹿(S)B: 猎兔(H)
A: 猎鹿(S)(4, 4)(0, 3)
A: 猎兔(H)(3, 0)(3, 3)
两个纯策略NE

(S,S):帕累托最优均衡,但需要信任对方合作

(H,H):风险占优均衡,更"安全"(guaranteed 3)

均衡选择问题

Pareto Dominant NE vs Risk Dominant NE:

现实中协调失败 → 陷入次优均衡,需沟通/承诺机制

💡 金融应用:市场标准(clearing协议、合约格式)的形成是协调博弈——一旦某标准成为焦点(Schelling focal point),即使存在更优标准也难以迁移。

07 · ANTI-COORDINATION胆小鬼博弈 · Chicken Game

B: 直行(D)B: 转向(C)
A: 直行(D)(-10,-10) 撞车(+1, -1)
A: 转向(C)(-1, +1)(0, 0)
关键特征
  • 两个纯策略NE,均为反协调:(D,C) 和 (C,D)
  • 存在混合策略NE:设对称,令对手无差异
  • 先承诺优势(First-mover advantage):先公开宣布"我不会转向"可获得优势
  • 金融应用:双寡头价格战、银行救助博弈(谁先认亏)
📘 求 Chicken Game 的混合策略NE

设 A 以概率 p 选直行(D),让 B 对 D/C 无差异:

B选直行(D)期望 = -10p + 1·(1-p) = 1 - 11p B选转向(C)期望 = -1·p + 0·(1-p) = -p 令 1-11p = -p → 1 = 10p → p = 1/10

由对称性 q = 1/10。混合NE:双方各以1/10概率直行,9/10概率转向。

期望收益:B = -1/10 = -0.1(小负数,但好过撞车)

混合NE下撞车概率 = p·q = 1/100 = 1%,不为零!相互威慑中存在真实事故风险。

08 · CLASSIC GAMES性别之战 Battle of Sexes

已在 Section 4 混合策略部分详细讲解。核心要点:

  • 两个纯策略NE + 一个混合策略NE(共3个)
  • 混合NE期望收益 = 2/3 < 纯策略NE(1或2),混合NE 帕累托劣于纯NE
  • 如何协调?→ 先行承诺、沟通机制、重复博弈中的惯例形成

09 · DYNAMIC GAMES序贯博弈 · 逆向归纳

子博弈精炼纳什均衡 (SPNE)
在每一个子博弈中构成NE的策略组合。消除了非可信威胁(non-credible threats)。 求法:从博弈树末端向前逆推(Backward Induction)。
📘 例题:进入博弈 (Entry Game)

在位者(I) vs 进入者(E):E 先决定进入(In)或不进(Out),I 然后决定对抗(F)或默许(A)。

博弈树: E选In → I选Fight: (E=-1, I=-1) E选In → I选Accommodate: (E=+1, I=+1) E选Out: (E=0, I=+3)

逆向归纳

若 E 选了 In,I 面临 Fight(-1) vs Accommodate(+1) → I 选 Accommodate
E 预判 I 会 Accommodate → In 得 +1 > Out 得 0 → E 选 In

SPNE = (In, Accommodate),收益 (1, 1)

注意:I 威胁"你进来我就打"是不可信威胁,因为真进来后 I 自己也受损,不会执行。SPNE 消除了这种威胁。

📘 例题:三层 Centipede Game(蜈蚣博弈)

A和B轮流决定:在自己回合选 Stop(S) 或 Pass(P)。每轮 Pass 使总收益增长但分配给下一个人更多。

回合1(A行动): S→(2,0); P→回合2 回合2(B行动): S→(1,3); P→回合3 回合3(A行动): S→(4,2); P→(3,5)

逆向归纳

回合3: A选S(4)>P(3) → A选Stop,A得4,B得2
回合2: B预判回合3 A选S → B现在 S(3) vs P(B得2) → B选Stop,B得3,A得1
回合1: A预判回合2 B选S → A现在 S(2) vs P(A得1) → A选Stop,A得2,B得0

SPNE:A 在第一回合就 Stop,收益(2,0)。

实验中人们不会在第一回合就停,这挑战了理性人假设。蜈蚣博弈常被用来讨论有限理性、利他主义、以及理性的共同知识失效。
📘 例题:先动优势 vs 后动优势

Stackelberg 领导者博弈(产量竞争):

Leader 先设产量 q₁,Follower 观察后设 q₂。市场价格 P = 100 - q₁ - q₂,零成本。

Follower 的 BR(给定 q₁): max q₂(100 - q₁ - q₂) → q₂* = (100 - q₁)/2 Leader 逆向归纳代入: π₁ = q₁(100 - q₁ - (100-q₁)/2) = q₁(50 - q₁/2) d/dq₁: 50 - q₁ = 0 → q₁* = 50 q₂* = (100-50)/2 = 25 收益:π₁ = 50×25 = 1250,π₂ = 25×25 = 625

Cournot(同时)均衡:q₁=q₂=100/3≈33.3,各得约1111。

先动优势:Leader 收益 1250 > Cournot 1111,先行承诺有利。

10 · REPEATED GAMES重复博弈 · 触发策略

有限重复博弈

若有限次重复,逆向归纳推回:每轮均衡是单次博弈均衡。合作无法维持。

(除非有多个均衡,或者存在信誉效应)

无限重复博弈

贴现因子 δ∈(0,1),当 δ 足够大(玩家足够有耐心),合作均衡可以用触发策略支撑。

📘 例题:Grim Trigger 维持合作的条件

无限重复囚徒困境,收益:合作(C,C)得 R=3,背叛得 T=5,惩罚得 P=1。

Grim Trigger 策略:从合作开始,一旦有人背叛,永远背叛。

合作收益(折现求和): V(Cooperate) = R + δR + δ²R + ... = R/(1-δ) = 3/(1-δ) 背叛收益: V(Deviate) = T + δP + δ²P + ... = T + δP/(1-δ) = 5 + δ·1/(1-δ) 合作优于背叛的条件: 3/(1-δ) ≥ 5 + δ/(1-δ) 3 ≥ 5(1-δ) + δ 3 ≥ 5 - 5δ + δ 3 ≥ 5 - 4δ 4δ ≥ 2 δ ≥ 1/2

结论:当贴现因子 δ ≥ 1/2(即玩家足够有耐心),Grim Trigger 可维持合作均衡。

💡 Folk 定理:在无限重复博弈中,只要δ足够大,几乎任何帕累托改进均衡都可以被支撑。这解释了为什么长期关系中合作更容易出现。

11 · AUCTIONS拍卖理论

★ SIG 高频考点 — 拍卖是 SIG 文化核心
一价密封拍卖 (First-Price Sealed Bid)

最高出价者获胜,支付自己报价。

策略:低报(shading)— 报价低于真实估值以获取正剩余

n个对称bidder,估值v~U[0,1]: 最优报价 b(v) = v·(n-1)/n n=2时:b(v) = v/2 n=3时:b(v) = 2v/3
二价密封拍卖 (Second-Price / Vickrey)

最高出价者获胜,支付第二高出价。

策略:如实出价(dominant strategy)

为什么如实出价是占优策略? 设真实估值 v,对手最高报价 b*: 情形1:v > b*(赢得有利) 诚实出价v → 赢,净收益 v-b* > 0 ✓ 低报 < b* → 输,净收益 0 ✗ 情形2:v < b*(赢了亏损) 诚实出价v → 输,净收益 0 ✓ 高报 > b* → 赢,净收益 v-b* < 0 ✗
收益等价定理 (Revenue Equivalence Theorem)
在标准条件下(独立私人价值、对称、风险中性),所有标准拍卖(英式、荷式、一价、二价)给卖家带来相同期望收益

直觉:虽然一价拍卖出价低但更经常赢,二价出价高但少赢,期望收益抵消。

📘 例题:两人一价密封拍卖,估值 U[0,100],最优出价策略?

n=2,v~U[0,100],最优报价公式:

b(v) = v·(n-1)/n = v·1/2 = v/2

即:出自己估值的一半。

验证:对手报价 b' = v'/2,v'~U[0,100],期望收益:

期望收益 = (b > b') × (v - b) 最优化 FOC → b(v) = v/2

卖家期望收益 = E[第二高估值] = E[min(v₁,v₂)] = 100/3 ≈ 33.3

(与二价拍卖等价,验证RET)

📘 例题(SIG 真题风格):Winner's Curse — 共同价值拍卖

场景:石油开采权拍卖,真实价值 V 对所有人相同但未知。每个竞标者得到含噪声的信号 sᵢ = V + εᵢ,其中 εᵢ~N(0,σ²) 独立。

Winner's Curse:赢得拍卖意味着你的信号是最高的,而最高信号往往高估了真实价值。

E[V | 赢得拍卖] = E[V | sᵢ = max(s₁,...,sₙ)] < E[V | sᵢ] 理性出价:应对信号做下调,b(sᵢ) < E[V | sᵢ]

金融中的 Winner's Curse

  • IPO 认购:机构对热门 IPO 的分配往往意味着机构不想要该股票(逆向选择)
  • 并购溢价:收购成功往往意味着你出价最高,可能高估了协同效应
  • 做市商:成交说明对方有信息优势(Adverse Selection)

12 · MARKET MAKING做市商博弈

★ SIG 课堂级考点 — 面试现场可能真实做市
做市商基础模型
  • Bid(买价):做市商愿意买入的价格
  • Ask/Offer(卖价):做市商愿意卖出的价格
  • Spread = Ask - Bid:做市商利润来源
  • 做市商面临:逆向选择风险(对方知道真实价值)+ 库存风险
📘 例题:Kyle (1985) 内幕交易模型的直觉

参与者:知情交易者(Insider)、噪声交易者(Noise Traders)、做市商(MM)。

均衡性质

  • 内幕交易者分散交易(不一次性全押),以免价格过快反映信息
  • 做市商根据观察到的总订单流(知情+噪声)推断信息,调整价格
  • 均衡价格线性:P = μ + λ·Q(λ = 市场冲击系数,Kyle's Lambda)
λ = σᵥ / (2σᵤ) 其中 σᵥ = 资产价值标准差(信息量) σᵤ = 噪声交易量标准差(流动性) λ↑:流动性低,信息冲击大,价格更敏感
📘 面试场景题:你是做市商,骰子1-6,如何报价?

资产价值 = 掷一个公平骰子的点数,真实期望 = (1+2+3+4+5+6)/6 = 3.5。

基础报价:Bid = 3.0,Ask = 4.0(spread = 1)

追问:对手下注方向有信息时如何调整?

  • 若对方反复买(Ask方向),可能他知道点数高 → 上调 Bid/Ask
  • 若对方反复卖(Bid方向),可能他知道点数低 → 下调 Bid/Ask
  • 贝叶斯更新:若有人买,P(点数≥4|买) > 0.5 → 提升中心估计
SIG 面试现场会真实进行多轮做市游戏。要保持 spread 合理,根据成交流更新中心价格,不要被对手的大手笔单方向交易骗走大量仓位。
📘 例题:逆向选择与最优 spread(Glosten-Milgrom模型)

假设:以概率 μ 遇到知情交易者,以概率 1-μ 遇到噪声交易者。

资产真实值:高概率时为 V_H,低概率时为 V_L,先验期望 E[V] = V₀。

做市商零利润条件: Ask(A) 满足: (1-μ)/2·(A-V₀) = μ/2·(V_H - A) → A = V₀ + μ(V_H - V₀) / (1 - μ/2 + μ/2)... 简化近似:A ≈ V₀ + μ(V_H - V₀) Bid(B) 类似:B ≈ V₀ - μ(V₀ - V_L) Spread ≈ μ(V_H - V_L)(正比于信息不对称程度)

关键结论:逆向选择越严重(μ↑)或资产不确定性越大(V_H-V_L↑),最优spread越宽。

13 · POKER & BLUFFING扑克与 Bluffing 博弈

★ SIG 核心文化 — 扑克思维与期望值计算
扑克的博弈论本质
  • 不完全信息博弈 (Incomplete Information):不知道对手牌
  • Mixed strategy 的自然应用:需要以一定频率 Bluff,否则对手会 fold 所有 Bluff
  • 最优 Bluff 频率:由底池赔率(Pot Odds)决定
📘 例题:最优 Bluff 频率

River bet:底池100,你下注50(总底池变150)。

对手视角的底池赔率:call 50 赢 150,需要胜率 ≥ 50/150 = 1/3。

即对手在你 Bluff 概率 > 1/3 时应该 call;≤1/3 时 fold 是正确的。

你的最优策略(让对手无差异): Bluff 频率 = 下注额 / (下注额 + 底池) = 50 / (50 + 100) = 1/3 即:每3次下注中,2次有货(Value bet),1次是Bluff。 这样对手无论 call 还是 fold 期望收益均为0,是混合NE。
这就是混合策略均衡的完美应用:最优 Bluff 频率让对手恰好无差异,不能利用你。
📘 例题:简化扑克(SIG 面试真实题型)

2人,各有1张牌,J/Q/K等概率各1/3。下注规则:可 Bet 1 或 Check。只有一轮下注。

高牌赢1元。问:持有Q的玩家应以多大概率 Bet?

持K者(强牌):永远 Bet(Value bet) 持J者(弱牌):有时 Bluff,频率设为 b 持Q者(中间牌):需要计算 Q持有者 Bet 的期望: 对手有K:输(K > Q),-1 对手有J:赢(Q > J),+1 期望 = 0(对称) Q持有者 Check 的期望: 对手会Check back(J不敢Bet),双方摊牌 → 取决于J的Bluff频率 最优解:Q应 Check(作为"bluff catcher",让K的value bet和J的bluff 都打进来,然后再决定 call/fold)

这类题的关键不在精确计算,而在于展示博弈论思维:识别强/弱/中间手牌的不同策略角色,用混合NE分析最优频率。

14 · BAYESIAN GAMES贝叶斯博弈 · 不完全信息

Bayes-Nash 均衡
每个参与者的策略是其类型(type)的函数,且在给定信念(Belief)和对手策略下,每种类型下各自最优化期望收益。信念需与均衡策略贝叶斯一致
📘 例题:两类型买家的出价博弈

卖家拍卖物品,买家估值 v ∈ {高:10, 低:5},各概率1/2,私有信息。一价密封拍卖,两个买家。

对称BNE: 高类型出价 b_H,低类型出价 b_L,b_H > b_L 高类型期望收益: P(赢) × (v_H - b_H) = P(对手出价 < b_H) × (10 - b_H) = [1/2·I(b_L b_L:= 1/2 × (10 - b_H) [只赢低类型] 最优化:max_{b_H} 1/2(10-b_H)·1 → b_H 不影响胜率? 更精细分析(连续类型近似): b(v) = v/2(标准公式n=2), b_H = 10/2 = 5,b_L = 5/2 = 2.5

BNE = {高类型出5,低类型出2.5}。

📘 例题:啤酒-奶酪博弈(信号博弈 Signaling Game)

强类型(S)和弱类型(W)求职者,以概率0.5各出现。发信号:大学学历(E)或不上学(N),教育本身无生产价值。雇主决定高薪(H)或低薪(L):

收益矩阵: 强类型真实产出 = 3,弱类型 = 1 高薪 = 2,低薪 = 1 教育成本:强类型 c_S=1,弱类型 c_W=3 分离均衡 (Separating Equilibrium): 强类型选E,弱类型选N → 雇主看到E → 判断是强类型 → 给高薪(2>1) → 雇主看到N → 判断是弱类型 → 给低薪 强类型读书激励:2-1=1 > 1(不读书低薪)✓ 弱类型读书激励:2-3=-1 < 1(不读书低薪)✓ (弱类型不愿模仿) → 分离均衡存在!教育作为信号有效,尽管本身无价值。

Spence 信号博弈的核心洞见:成本优势使得高类型能通过"昂贵信号"与低类型区分。

💡 金融应用:公司分红(分红是昂贵信号,质量差的公司负担不起),承销商信誉背书,IPO定价中的承销商筛选。

15 · SIG CLASSICS经典脑筋急转弯 / 快问快答

★ SIG 面试题风格汇总
💡 美女博弈 (Beauty Contest Game / Keynesian Game)

100人各猜0-100的整数,猜中所有人猜测平均值2/3的获胜。你猜多少?

Level 0(非理性):均匀分布 → 均值 50 Level 1(猜Level 0理性):2/3 × 50 = 33 Level 2:2/3 × 33 = 22 Level 3:2/3 × 22 = 15 ... Nash均衡:反复迭代 → 0

实验结果:大多数人在 Level 2-3,答案在 22-33 区间。纳什均衡是0,但实际人不到那个层次。

金融应用:"股票价格不是资产真实价值,而是市场对他人预期的预期。"(Keynes 选美理论)→ 动量、泡沫形成的理论基础。

💡 100个海盗分金币(Pirate Game)

100个按级别排序的海盗分1000枚金币。最高级提方案,严格多数通过则执行,否则他被扔海里,下一个提。问:第1个海盗怎么提才能存活并最多得金币?

逆向归纳: 2人:海盗2提 1000:0,自己投赞成 → 通过,自得1000 3人:海盗3需要另外1票。海盗1在2人情况得0,现在给1枚就投赞成 → 海盗3提 (1, 0, 999) → 通过 4人:海盗4需另外1票。海盗2在3人情况得0,给1枚 → (0, 1, 0, 999) 5人:海盗5需另外2票。1和3在4人情况各得0,各给1枚 → (1, 0, 1, 0, 998) 规律:第1个海盗(即第一级)提出方案: 偶数海盗(2,4,6...)得0 奇数海盗(1,3,5...,排在后面但在5人局中处于弱势)得1 自己得 1000 - 49 = 951(给排名2,4,...,98的各1枚)

答案:海盗1提 (1,0,1,0,...,1,0,951),给所有偶数位置各1枚,自己拿951。

关键:逆向归纳 + 每人只需要刚好超过半数的票。

💡 三人决斗 (Truel) — 最弱者生存概率最高

A命中率=100%,B=75%,C=50%。轮流射击,先被击中的出局。问:C的最优策略?

C的最优策略:第一枪故意打空! 分析: • 若C射A:B(75%)会先射A,C剩1v1对B → C生存 = 50%/(50%+75%) ≈ 40% • 若C射B:A(100%)会先射B,C剩1v1对A → C生存 = 50%/(50%+100%) ≈ 33% • 若C打空:A和B先互打,因为他们是对方的更大威胁。 B死于A手(概率 100%/175%)→ C对A:50%/(50%+100%) ≈ 33% A死于B手(概率 75%/175%)→ C对B:50%/(50%+75%) ≈ 40% C打空后生存概率 ≈ (100/175)×33% + (75/175)×40% ≈ 19%+17% = 36% 但有更精确分析:A优先射B,B优先射A 打空后期望生存率 > 直接出手,故打空是最优策略。

教训:在多方博弈中,最弱者通过"让强者先互斗"可以提高生存率。

💡 价格猜测博弈:卖方与买方信息不对称

二手车市场(Lemons Problem,Akerlof 1970):

  • 好车价值8000,坏车(lemon)价值4000,各占50%
  • 买家不能区分,愿意出均值 = 6000
  • 好车卖家知道自己车好,6000 < 8000 → 不卖
  • 市场上只剩坏车 → 买家调低期望到4000 → 好车进一步退出
  • 市场失灵:逆向选择导致好车无法在市场上交易

解决方案:信号(保修、车检)、担保机制(信誉)、第三方认证

💡 Schelling 焦点 (Focal Point) — 无沟通协调

你和陌生人需要在纽约市见面,但无法联系。你们会在哪里?什么时间?

经典答案:中央车站,正午12:00。

这就是 Schelling Point:在没有沟通的情况下,理性人会选择"显著"的答案,因为他们预期对方也会选它。

💡 金融应用:整数价格关卡(100, 1000 等)作为支撑/阻力位;市场对话语权极强的分析师预测的自我实现;资产泡沫中的"显著"价格点。
💡 All-Pay 拍卖 — 每人都付出竞争成本

所有参与者都支付自己的出价,只有最高出价者获奖。(如选举广告、研发竞赛、诉讼)

两人对称均衡(v~U[0,1]): b(v) = v²/2(而非一价拍卖的v/2) 期望总支付 = E[v₁²/2] + E[v₂²/2] = 2·∫₀¹ v²/2 dv = 2·(1/6) = 1/3 一价拍卖卖家收益:E[第二高估值] = 1/3 RET 成立:All-Pay 与一价拍卖收益相同!

直觉:all-pay 下每人出价更保守(知道必须付钱),恰好抵消了输家也付钱的额外收益,期望总付款不变。

💡 正确推理题:100个等级信封

你面前有两个信封,一个金额是另一个的2倍。你打开一个,里面是100元。要不要换?

直觉谬误:另一个要么50要么200,期望=125>100,换! 正确分析(信封悖论): 这是一个概率模型设定问题。 若金额分布是均匀的,"另一个是50还是200"不能都有50%概率 ——因为不存在(0,∞)上的均匀分布。 正确模型:事先确定两个信封金额(x, 2x),x由某分布决定。 打开后看到100,则x=50(概率p)或x=100(概率1-p) 若 p > 2/3:期望换后 < 100,不换 若 p < 2/3:换 没有额外信息时,两种情况概率各半是不一致的先验!

面试中展示对悖论的清醒认识比"换"或"不换"更重要。

SUMMARY博弈类型快速对照

博弈类型 经典例子 NE特征 SIG相关性
囚徒困境 价格战、广告竞争 社会次优,背叛占优 做市 spread 竞争
协调博弈 猎鹿、市场标准 多个NE,协调问题 市场惯例形成
反协调博弈 Chicken,产品差异化 多个NE,混合NE 做市策略差异化
序贯博弈 进入博弈,Stackelberg SPNE,逆向归纳 先动/后动优势分析
重复博弈 长期合作关系 δ≥阈值时合作 长期客户关系
一价拍卖 政府采购 低报,b=v(n-1)/n ★ 高频考点
二价拍卖 eBay, Google AdWords 如实出价占优 ★ 高频考点
信号博弈 教育、分红、信誉 分离/混同均衡 IPO承销,逆向选择
做市博弈 Kyle模型,GM模型 最优spread,贝叶斯更新 ★★ SIG核心