跳到正文
格致开物MATHWIKI

纳什均衡

纳什均衡(Nash equilibrium)是一组策略,其中每个人在别人策略不变时,都不能靠自己单独换策略提高收益。它回答的是“此时谁还想单方面改选”,不是“结果是否公平”或“是否对所有人最好”。

设参与者 i 的策略为 si,其他人的策略合写为 s−i。策略组合 s∗ 是纳什均衡,当且仅当对每个 i 和他所有可选的 ti,都有 ui(si∗,s−i∗)≥ui(ti,s−i∗). 式中的“其他人不变”至关重要:它只比较单人偏离,不能据此断言两人一起调整后的收益。

用最佳回应读收益表

下面的数是两个参与者在一次博弈中的教学收益;每格先写甲,后写乙。

甲\乙 猎鹿 猎兔
猎鹿 (4,4) (0,3)
猎兔 (3,0) (3,3)

若乙猎鹿,甲猎鹿得 4,猎兔得 3,甲的最佳回应是猎鹿;若乙猎兔,甲猎鹿得 0,猎兔得 3,最佳回应变为猎兔。对乙作同样比较,可知(猎鹿,猎鹿)与(猎兔,猎兔)都是纳什均衡;另外两个格子至少有一人愿意改选。前一个均衡双方收益较高,后一个却可能因担心配合失败而维持。详细的信念门槛见猎鹿博弈。

求有限表格中的纯策略均衡,逐列找甲收益最大格,逐行找乙收益最大格,两种标记重合处便是均衡。若出现并列最大值,两个都要保留。“找两个最大数所在格”会把不属于同一条件比较的收益混在一起。

没有纯策略均衡时

在零和博弈的“同面得一分”游戏中,甲想让两枚硬币同面,乙想让它们异面。若两枚同面,乙愿意换;若两枚异面,甲愿意换,因而四个纯策略组合都不是均衡。

允许混合策略后,甲以概率 p 选正面,乙以概率 q 选正面。甲选择正面的期望收益是 2q−1,选反面是 1−2q;甲只有在 q=1/2 时才愿意以正概率使用两种行动。乙同理只有在 p=1/2 时无差别。因此 (p,q)=(1/2,1/2) 是混合策略均衡。随机化的计算用的是期望收益,并非声称每局都平手。

纳什在 1950 年证明:参与者与纯策略集合都有限时,只要允许混合策略,至少存在一个纳什均衡。这是存在结论,不保证均衡唯一,不提供哪一个一定会在现实中出现,也不说每个人必然懂得所有收益。若某人观察到前一步行动才决策,还需考察每个后续局面中的理性选择;有限完全信息树常用逆向归纳寻找子博弈精炼均衡,见蜈蚣博弈。

均衡与集体改进的区别

在囚徒困境中,双方背叛互为最佳回应,但双方合作会让两人都获得更高收益。这个例子说明“没有人想单独改选”不等于“没有办法让所有人变得更好”。前者是纳什均衡,后者涉及帕累托改进;两种问题必须分开问。

参考资料