囚徒困境
囚徒困境(prisoner's dilemma)是一种两人同时决策的博弈:每个人都能从单方背叛得到眼前好处,但两人都这样做,比两人都合作更差。故事里的“囚徒”只是模型比喻,关键是收益的相对次序。
用 C 表示合作、D 表示背叛。下面四格是教学收益,不是刑期;每格先甲后乙:
| 甲\乙 | 合作 C | 背叛 D |
|---|---|---|
| 合作 C | (3,3) | (0,5) |
| 背叛 D | (5,0) | (1,1) |
看甲:乙合作时,甲选 D 得 5 而选 C 得 3;乙背叛时,甲选 D 得 1 而选 C 得 0。两次比较都偏向 D,所以 D 是甲的严格占优策略。乙的表格对称,也选 D。于是(D,D)是唯一纳什均衡,双方各得 1;(C,C)虽各得 3,却不能在一次同时行动的博弈里靠个人自愿保持:只要对方 C,改选 D 就能从 3 升至 5。
一般收益条件
通常把背叛合作方所得记为 ,共同合作所得记为 ,共同背叛所得记为 ,合作而遭背叛所得记为 。上表分别是 。满足 时,对方合作就有 ,对方背叛就有 ,所以 D 严格占优;又有 ,说明共同合作优于共同背叛。这三处不等式分别负责三段论证,少一处便不能照搬结论。有时还加 ,用于排除交替“占便宜—吃亏”比持续合作更好的情形;它不是一次博弈占优策略论证所必需的条件。
不是所有合作问题都是囚徒困境
猎鹿博弈也讨论合作,但其中对方选择合作时,自己也愿意合作,因此会有(合作,合作)这个均衡。囚徒困境恰恰相反:即便对方已经合作,单方仍有背叛诱因。两类博弈的政策含义不同:前者偏向解决协调与信任,后者须改变激励或行动环境。
把同一博弈玩许多轮,可以让本轮行动影响今后的回应;重复博弈给出持续合作的精确条件。那不是推翻本页的一次博弈结论,而是增加了未来收益和可观察的历史。
参考资料
- MIT:策略式博弈与纳什均衡讲义,囚徒困境矩阵与单方偏离。
- Jonathan Levin:〈Repeated Games I〉,一次与无限重复的区别。