本页目录

博弈论 I · 策略型博弈与 Nash 均衡

两个人各自选最有利的动作,结果是否也对两个人都好?本页用同一张收益表区分三个问题:谁能单方面改进、两人合起来能否改进、随机化以后还有哪些均衡。最后解释为什么有限博弈总有混合均衡,以及这个存在性结论没有承诺什么。

囚徒困境的单方面改进箭头,以及协调博弈的两个纯均衡和一个混合均衡。

图 game-01.1左图只沿一个玩家能改变的方向比较收益;右图把两个纯格放到概率方形的角上,再补上 p=q=1/3 的内点。纯格里找不到的均衡,可能在概率空间里。

学习层:先固定对手,再问自己能多得多少

1. 从一张已经看得见的收益表开始

两人同时选择“合作”或“背叛”。收益对的第一个数属于行玩家,第二个数属于列玩家;数越大越好。这里的数是模型中约定的效用,暂时不把它解释为真实货币或社会福利。

行玩家 列玩家 合作 \(C_0\) 背叛 \(C_1\)
合作 \(R_0\) \((3,3)\) \((0,5)\)
背叛 \(R_1\) \((5,0)\) \((1,1)\)

先固定列玩家合作。行玩家比较的是同一列的第一分量:合作得 3,背叛得 5。再固定列玩家背叛:合作得 0,背叛得 1。因此行玩家无论面对哪一列,都严格偏好背叛。列玩家也如此,只是要沿同一行比较第二分量。

所以双方背叛时没人能独自换动作获益。但是一起改为合作,会把两人的收益都从 1 提高到 3。这里已经出现本页的核心区别:没有有利的单方面偏离,不等于没有共同改进的机会。

2. 先预测,再核对完整结果

实验始终先显示收益矩阵。选择预设或修改八个整数收益后,回答:

  1. 全部 Nash 均衡是恰好一个、有限多个,还是连续无穷多个?
  2. 有没有双方都使用两种动作的均衡,即 \(0<p,q<1\)?
  3. 当前收益和最大的每个纯格都是 Nash 均衡吗?

核对后先看逐格最佳回应,再看概率方形与精确范围表。最后拖动一人的概率,固定另一人的概率,观察“最大可增加收益”有没有变成正数。试着把协调博弈的 \(1/3\) 改成 \(33/100\):图上很近,数学上却已经是不同的策略。

无 JavaScript 时的完整读法:以下收益按 \(R_0C_0,R_0C_1,R_1C_0,R_1C_1\) 排列。令 \(p=P(R_0)\)、\(q=P(C_0)\),两人独立随机化。

预设 四个收益对 全部均衡集合 \((p,q)\)
A \((3,3),(0,5),(5,0),(1,1)\) 只有 \((0,0)\),即双方背叛
B \((4,4),(0,0),(0,0),(2,2)\) \((0,0),(1,1),(1/3,1/3)\),共三个
C \((1,-1),(-1,1),(-1,1),(1,-1)\) 只有 \((1/2,1/2)\),没有纯均衡
D \((1,3),(1,0),(1,3),(1,0)\) \([0,1]\times\{1\}\),整条顶边
E \((0,1),(0,0),(0,0),(0,1)\) \([0,1/2]\times\{0\}\)、\([1/2,1]\times\{1\}\)、\(\{1/2\}\times[0,1]\) 的并集
F 四格都是 \((1,1)\) 整个 \([0,1]^2\)

在 A 的均衡处,两人的当前收益、两个纯动作收益、最大可增加收益分别为:

玩家 当前收益 改为动作 0 改为动作 1 最大可增加收益
行 1 0 1 0
列 1 0 1 0

A 的收益和最大格是 \((R_0,C_0)\),总和为 6,却不是均衡。C 的每格收益和都是 0,四个纯格都不是均衡;这不妨碍它有唯一的混合均衡。D 的两端也是纯均衡,但整条线包含连续无穷多个均衡,不能把端点另加一次。

3. 把图读成条件

收益表的四个格,分别对应概率方形的四个角:

纯策略组合 概率点
\(R_0,C_0\) \((1,1)\)
\(R_0,C_1\) \((1,0)\)
\(R_1,C_0\) \((0,1)\)
\(R_1,C_1\) \((0,0)\)

边上的非角点表示一人随机化、另一人确定选一个动作;方形内部表示两人都随机化。实验的绿色集合可以是点、线段或区域。完整分数范围比像素位置更精确;很短的线段不会因为屏幕上看起来像点,就变成唯一均衡。

1. 从策略型博弈到最佳回应

一个有限策略型博弈包括有限玩家集合 \(N\)、每人的非空有限纯策略集 \(S_i\),以及实值收益函数

\[ u_i:\prod_{j\in N}S_j\longrightarrow\mathbb R. \]

一次纯策略组合 \(s=(s_i,s_{-i})\) 指定所有人的选择。符号 \(s_{-i}\) 收集除了 \(i\) 以外的选择。所谓单方面偏离,就是只替换 \(s_i\),把 \(s_{-i}\) 固定不动。

玩家 \(i\) 的最佳回应集合为

\[ BR_i(s_{-i})=\operatorname*{argmax}_{t_i\in S_i}u_i(t_i,s_{-i}). \]

它可能包含多个动作:收益相同的最优动作都应保留。二人矩阵里,行玩家逐列比较自己的收益,列玩家逐行比较自己的收益。不能在整个矩阵里给一个玩家挑最大数,因为他无法单方面决定对手选哪一列或哪一行。

严格优势与严格劣策略。如果动作 \(a_i\) 面对对手每种纯策略组合,都比 \(b_i\) 收益严格更高,那么 \(b_i\) 被 \(a_i\) 严格支配。对任意对手混合策略取期望,严格不等式仍成立,因此 \(b_i\) 不可能出现在 Nash 均衡的正概率支持中。支配它的也可以是一个固定的混合策略。

有限博弈中可以据此逐轮删除严格劣策略,再检查剩余博弈。这个步骤保留原博弈的 Nash 均衡;它通常不能把答案缩到一个格。把“严格”改成“弱”就要小心:弱劣策略面对某些对手选择可能同样好,可能出现在均衡中,删除它可能删去均衡。

2. Nash 均衡只排除有利的单方面偏离

定义。策略组合 \(s^*\) 是纯策略 Nash 均衡,当且仅当

\[ \boxed{ u_i(s_i^*,s_{-i}^*)\ge u_i(t_i,s_{-i}^*), \qquad \forall i,\ \forall t_i\in S_i. } \]

等价地,每个人都在回应同一个实际策略组合:\(s_i^*\in BR_i(s_{-i}^*)\)。矩阵中双方最佳回应标记的交集,就是全部纯均衡。

这里允许相等。均衡中的玩家可能愿意在几个同样好的动作间切换;定义没有说他绝不行动,也没有说受到扰动以后系统会回到原点。动态稳定性需要另给学习或调整规则,再分析那套规则。

“Pareto 改进”则是另一个条件:换到另一个结果后,没有人变差,至少一人严格变好。开头的双方背叛是 Nash 均衡,却被双方合作严格 Pareto 改进。现实中的合作困难可以借这种机制建模,但价格战、公共品、军备竞赛等问题需要分别写出参与者、信息、行动与收益,不能因为现象相似就断言都是同一张 \(2\times2\) 表。

收益和的单位也要交代。每位玩家各自采用正仿射变换

\[ \widetilde u_i=\alpha_i u_i+\beta_i,\qquad \alpha_i>0, \]

不会改变其期望收益的大小关系,因此保留全部 Nash 均衡。但不同玩家取不同的 \(\alpha_i\),相当于改变“收益和”中的权重,可能改变收益和最大的位置。实验的金色格只表示当前单位下的收益和最大;没有额外的效用可比性假设,就不把它称作社会福利的绝对最优。

3. 混合策略:为什么只需比较纯动作

混合策略 \(x_i\in\Delta(S_i)\) 是纯策略上的概率分布,纯策略本身就是概率集中在一个动作上的特例。本页采用各玩家独立的私人随机化;二人博弈的期望收益为

\[ U_i(x,y)=\sum_{a\in S_1}\sum_{b\in S_2}x_a y_b\,u_i(a,b). \]

固定对手策略后,自己的期望收益是自己纯动作收益的加权平均。因此最大的纯动作收益,就是允许任意混合偏离时能够达到的最大收益;随机混合不会超过平均数中的最大项。

这同时给出完整的支持条件:

所以“令两个动作收益相等”只适用于这两个动作都以正概率使用的情形;它不是脱离支持条件的通用口诀。

用最大可增加收益把定义变成一份账:

\[ \boxed{ \rho_i(x)= \max_{a_i\in S_i}U_i(a_i,x_{-i})-U_i(x_i,x_{-i}) \ge0. } \]

\(\rho_i\) 非负是因为当前混合收益是纯动作收益的平均。组合 \(x\) 是 Nash 均衡,当且仅当所有 \(\rho_i=0\)。如果只知道所有 \(\rho_i\le\varepsilon\),得到的是按当前收益单位定义的加性 \(\varepsilon\)-均衡,不能直接说“精确均衡”;缩放收益也会缩放这个误差尺度。

4. 完整解一个 \(2\times2\) 博弈

令行收益矩阵为 \(A=\begin{pmatrix}a&b\\c&d\end{pmatrix}\),列收益矩阵为 \(B=\begin{pmatrix}e&f\\g&h\end{pmatrix}\),并固定 \(p=P(R_0),q=P(C_0)\)。两人的纯动作收益差是

\[ D_R(q)=q(a-c)+(1-q)(b-d), \qquad D_C(p)=p(e-f)+(1-p)(g-h). \]

行玩家选 \(R_0\) 比 \(R_1\) 好,恰好对应 \(D_R(q)>0\)。完整条件为:

玩家概率 必须满足的最佳回应条件
\(p=1\) \(D_R(q)\ge0\)
\(p=0\) \(D_R(q)\le0\)
\(0<p<1\) \(D_R(q)=0\)
\(q=1\) \(D_C(p)\ge0\)
\(q=0\) \(D_C(p)\le0\)
\(0<q<1\) \(D_C(p)=0\)

内点公式的来历与边界

如果双方都使用两种动作,就解 \(D_R(q)=D_C(p)=0\),得到

\[ q=\frac{d-b}{a-b-c+d},\qquad p=\frac{h-g}{e-f-g+h}. \]

注意:\(p\) 由列玩家的无差异条件确定,\(q\) 由行玩家的条件确定。先检查分母非零,再检查 \(0<p,q<1\)。负概率、超过 1 的概率都不是可行策略;也不能把它们截到边界,就宣布获得一个均衡。

分母为零时,对应的收益差是常数:非零常数没有无差异点,零常数则在整个区间无差异。仍然回到上表求交,便能处理边界与连续族。

为什么实验能列出完整集合

每人有三种情况:确定选动作 0、确定选动作 1、两个动作都是最佳回应。枚举这 \(3\times3=9\) 对情况,每一对都化为关于 \(p\) 和 \(q\) 的一元线性等式或不等式,再与 \([0,1]\) 求交。

在“两个动作都是最佳回应”这一种中,允许概率也取端点不会加入错误均衡:既然两个动作同样最好,确定选其中一个当然也是最佳回应。这使结果都能写成闭区间的笛卡尔积。删除被其他集合完全包含的重复部分,再取并集,就得到完整均衡集合。它可以是若干点、线段或二维区域,不能只数内点公式的解。

例如 D 中行玩家总得 1,因此任何 \(p\) 都是最佳回应;列玩家无论面对什么 \(p\),选左得 3、选右得 0,因此必须 \(q=1\)。答案就是 \([0,1]\times\{1\}\),而不是“分母为零,无法求解”。

协调不一定只有两个答案

预设 B 的两个纯均衡是一起选左和一起选右。内点处,行玩家两种动作的收益分别为 \(4q\) 与 \(2(1-q)\),故

\[ 4q=2(1-q)\Longrightarrow q=1/3. \]

列玩家同理给出 \(p=1/3\)。混合均衡的每人期望收益为 \(4/3\),小于两个纯均衡中的收益 4 和 2。存在多个均衡并不自带选择机制,也不保证独立随机化能实现大家希望的协调。

5. 有限博弈为什么总有混合均衡

Nash 存在性定理。有限玩家、每人非空有限纯策略集、每个结果对应有限实数收益时,至少存在一个混合策略 Nash 均衡。

证明的关键不是在纯格中不断找更好的格,而是把概率空间补齐。所有混合策略组合构成

\[ X=\prod_i\Delta(S_i), \]

它非空、紧、凸。固定对手策略时,自己的期望收益是连续仿射函数,所以最佳回应集合非空、紧且凸。

还需说明最佳回应不会在极限处“失效”。若 \(x^m\to x\)、\(y^m\to y\),且每个 \(y^m\) 都是对 \(x^m\) 的最佳回应,把定义中的每条收益不等式取极限,连续性保证 \(y\) 仍是对 \(x\) 的最佳回应。因此最佳回应对应具有闭图;在这里的紧空间中,这给出所需的上半连续性。

于是乘积最佳回应对应 \(BR:X\rightrightarrows X\) 满足 Kakutani 不动点定理的条件,存在 \(x^*\in BR(x^*)\)。这个不动点恰好就是每个人都在最佳回应的策略组合。

存在性没有额外承诺:不保证纯均衡、不保证唯一、不保证高效率,也不保证某种学习算法收敛。本页的固定 \(2\times2\) 模型可以通过上面的九种情况直接求解;更大博弈的计算问题还需另给输入规模、精确或近似目标与算法。

6. 三个继续算得下去的例子

偏好不同,但都希望见面

两人可选活动 0 或 1。一起选 0 得 \((2,1)\),一起选 1 得 \((1,2)\),错开都得 0。两个纯均衡显然存在。令 \(p=P(R_0),q=P(C_0)\),内点无差异条件是

\[ 2q=1-q,\qquad p=2(1-p). \]

所以 \(q=1/3,p=2/3\),两人的期望收益都是 \(2/3\)。两人各自以 \(2/3\) 选择自己偏好的活动,但由于独立随机化,仍可能错开。若允许一个共同信号建议大家去同一个地方,就改变了信息与相关结构,需要进一步学习相关均衡,不能直接沿用独立分布 \(x_a y_b\)。

猜硬币:没有纯均衡仍可有唯一混合均衡

预设 C 中两面相同则行赢 1、列输 1,否则相反。任一纯格都有人能通过改变自己的动作严格获益;纯均衡不存在。无差异方程给 \(p=q=1/2\),行玩家的期望收益为 0。

在零和结构下,这个概率同时让行玩家保证至少 0,让列玩家把行收益压到至多 0。上下界一致,才得到值为 0 的鞍点证书。一般和博弈中不能用一位玩家的收益表替代另一位玩家的偏好。

公共品:私人增量与总体增量分开算

\(n\ge1\) 人各选 \(c_i\in\{0,1\}\),总贡献翻倍后均分,个人效用为

\[ u_i(c)=\frac2n\sum_{j=1}^n c_j-c_i. \]

固定别人,只把自己的贡献从 0 改为 1,效用增量为 \(2/n-1\)。因此 \(n>2\) 时不贡献严格占优,唯一均衡是所有人不贡献,混合策略也不会增加别的均衡。与此同时,

\[ \sum_i u_i(c)=\sum_i c_i, \]

按这套效用单位,全部贡献使总和最大;当 \(n>2\) 时也让每人从全不贡献时的 0 提高到 1。

边界必须分开:\(n=2\) 时私人增量为 0,每个纯或混合策略组合都是均衡;\(n=1\) 时增量为 1,唯一均衡是贡献。这个模型解释一种激励冲突,具体制度的效果还要另建包含成本、执行与信息的模型。

7. 练习:用条件验算,不只记名称

练习 1:在协调预设 B 中,p=q=1/3 与 p=q=33/100 相差很小。后者仍是均衡吗?

取 \(p=q=33/100\)。行玩家全选 \(R_0\) 得 \(4q=33/25=1.32\),全选 \(R_1\) 得 \(2(1-q)=67/50=1.34\),所以 \(R_1\) 严格更好。

当前混合收益为

\[ \frac{33}{100}\frac{33}{25} +\frac{67}{100}\frac{67}{50} =\frac{6667}{5000}. \]

最大可增加收益为

\[ \rho_R=\frac{67}{50}-\frac{6667}{5000} =\frac{33}{5000}>0. \]

由对称性 \(\rho_C\) 相同,所以不是精确均衡;它是按当前单位的 \(33/5000\)-均衡。\(p=q=1/3\) 时两种纯动作收益都为 \(4/3\),两项可增加收益才严格为零。

练习 2:预设 E 为什么不是只有 p=1/2 这一条线?

行玩家所有格都得 0,所以任意 \(p\) 都是对任意 \(q\) 的最佳回应。列玩家选 \(C_0\) 得 \(p\),选 \(C_1\) 得 \(1-p\)。

当 \(p<1/2\),列玩家必须选 \(C_1\),即 \(q=0\);当 \(p>1/2\),必须 \(q=1\);当 \(p=1/2\),任意 \(q\) 都行。因此全部集合是

\[ \left([0,1/2]\times\{0\}\right) \cup\left(\{1/2\}\times[0,1]\right) \cup\left([1/2,1]\times\{1\}\right). \]

三部分在两个端点相交。只列双方无差异的方程,会漏掉底边和顶边上列玩家严格偏好某个动作的均衡。

练习 3:把囚徒困境中行玩家的全部收益乘以 100,均衡与收益和最大格各发生什么变化?

行玩家的全部收益比较都乘以正数,所以最佳回应不变;列玩家收益不变。唯一均衡仍是 \((R_1,C_1)\)。四格的新收益和按行优先顺序为

\[ 303,\quad5,\quad500,\quad101. \]

最大格从原来的 \((R_0,C_0)\) 变成 \((R_1,C_0)\)。这不是均衡发生变化,而是加总时给行玩家的收益加了更大权重。若两人的收益都乘以同一个正数,再分别加常数,每格总和发生同一个正仿射变换,最大格才保持不变。

8. 从这里通向后续课程

本页建立的是“固定对手,检查单方面偏离”的静态语言。下一页把零和鞍点与线性规划对偶接起来,再加入先后行动、重复互动与机制设计。学习动态要问概率怎样随时间变化;相关均衡要问公共信号怎样影响条件决策;不完全信息博弈要把类型与信念写进策略。这些问题都需要新假设,存在一个 Nash 均衡本身并不能替它们作答。

延伸阅读。Nash 的1950 年存在性论文给出有限博弈的混合均衡存在性;Muhamet Yildiz 的 MIT 博弈论讲义第 2 章区分理性化、Nash 均衡与相关均衡,附录介绍所用的不动点工具。