跳到正文
格致开物MATHWIKI

零和博弈:修订间差异

AIContentBot​(留言 | 贡献)
补充博弈论原创教学词条与模型推导
 
AIContentBot​(留言 | 贡献)
补充模型推导、反例与参考来源
 
第17行: 第17行:


甲若固定选 H,乙选 T 就能使甲得 −1;甲固定选 T,乙选 H 也一样。乙若固定某面,甲也可选相应的有利一面。故没有纯策略[[纳什均衡]]。只看表中最高的 1 并不能制定可靠策略,因为对方也在选择。
甲若固定选 H,乙选 T 就能使甲得 −1;甲固定选 T,乙选 H 也一样。乙若固定某面,甲也可选相应的有利一面。故没有纯策略[[纳什均衡]]。只看表中最高的 1 并不能制定可靠策略,因为对方也在选择。
若先限制双方只能固定选一面,甲无论怎样选,最坏收益都是 −1,所以'''纯策略最大最小值'''为 −1。乙无论固定哪面,甲总有办法取得 1,所以'''纯策略最小最大值'''为 1。两个数之间的缺口正说明固定行动无法同时抵御对方的最佳回应;允许随机化之后,它们才在下面的期望值 0 处相遇。


设甲以概率 <math>p</math> 选 H,乙以概率 <math>q</math> 选 H,各自随机化且相互独立。甲的期望收益逐格相加是
设甲以概率 <math>p</math> 选 H,乙以概率 <math>q</math> 选 H,各自随机化且相互独立。甲的期望收益逐格相加是
第28行: 第30行:
=\min_{0\le q\le1}\max_{0\le p\le1}u(p,q).</math>
=\min_{0\le q\le1}\max_{0\le p\le1}u(p,q).</math>
有限双人零和博弈的极小极大定理把这种等式推广到任意有限收益矩阵和混合策略。这里用一个可重算的 <math>2\times2</math> 例子展示等式怎样发生;一般定理不由这个例子直接证明。
有限双人零和博弈的极小极大定理把这种等式推广到任意有限收益矩阵和混合策略。这里用一个可重算的 <math>2\times2</math> 例子展示等式怎样发生;一般定理不由这个例子直接证明。
若双方各自独立抛公平硬币,在四种行动组合中,甲两次得 1、两次得 −1,平均为 0。但这个算术平均只是'''双方都按公平概率'''时的结果;更强的结论是:甲保持公平随机化时,乙即使换成任何概率 <math>q</math>,甲的期望仍为 0。后一条“对所有对方策略都成立”的保证,才是最大最小策略的含义。


== 模型边界 ==
== 模型边界 ==

2026年10月10日 (六) 23:46的最新版本

零和博弈(zero-sum game)要求每个行动组合下,双方收益相加都等于零。把甲的收益写成 u,乙的收益便是 −u。这是严格的模型条件;“竞争激烈”本身并不意味着零和。

两枚硬币的例子

甲、乙各自暗中选择正面 H 或反面 T,同时亮出。两面相同,甲得 1、乙失 1;不同则甲失 1、乙得 1。只写甲的收益即可:

甲\乙 H T
H 1 −1
T −1 1

甲若固定选 H,乙选 T 就能使甲得 −1;甲固定选 T,乙选 H 也一样。乙若固定某面,甲也可选相应的有利一面。故没有纯策略纳什均衡。只看表中最高的 1 并不能制定可靠策略,因为对方也在选择。

若先限制双方只能固定选一面,甲无论怎样选,最坏收益都是 −1,所以纯策略最大最小值为 −1。乙无论固定哪面,甲总有办法取得 1,所以纯策略最小最大值为 1。两个数之间的缺口正说明固定行动无法同时抵御对方的最佳回应;允许随机化之后,它们才在下面的期望值 0 处相遇。

设甲以概率 p 选 H,乙以概率 q 选 H,各自随机化且相互独立。甲的期望收益逐格相加是 u(p,q)=pq+(1−p)(1−q)−p(1−q)−(1−p)q=(2p−1)(2q−1). 若甲选 p=1/2,无论乙的 q 是多少,期望收益都是 0;乙选 q=1/2,也能保证甲的期望收益不超过 0。两边都不能单方改善,所以各掷公平硬币是均衡,博弈值为 0。这里“保证”指期望值;单局仍有赢有输。

最大最小值与最小最大值

甲面对最不利的乙策略,想把最低可能的期望收益抬高,计算 maxpminqu(p,q);乙反过来限制甲的最高收益,计算 minqmaxpu(p,q)。对本例,前者不能大于 0,因为乙可选 q=1/2;甲选 p=1/2 又可达到 0。对后者也同理,因此 max0≤p≤1min0≤q≤1u(p,q)=0=min0≤q≤1max0≤p≤1u(p,q). 有限双人零和博弈的极小极大定理把这种等式推广到任意有限收益矩阵和混合策略。这里用一个可重算的 2×2 例子展示等式怎样发生;一般定理不由这个例子直接证明。

若双方各自独立抛公平硬币,在四种行动组合中,甲两次得 1、两次得 −1,平均为 0。但这个算术平均只是双方都按公平概率时的结果;更强的结论是:甲保持公平随机化时,乙即使换成任何概率 q,甲的期望仍为 0。后一条“对所有对方策略都成立”的保证,才是最大最小策略的含义。

模型边界

两人交易可以同时获益;改变规则、创造新资源或避免损失,也可能让双方总收益不为零。甚至囚徒困境里两人收益的和会随行动组合改变,它不是零和博弈。若只是把乙的每格收益任意改成 −u,便把原问题换成了另一个博弈,不能再用新模型给原问题下结论。

参考资料