重复博弈
重复博弈(repeated game)是同一阶段博弈进行多轮;本轮的行动会进入历史,使下一轮的选择可以取决于过去。它和“把一次博弈的收益乘以轮数”不同,因为完整策略要规定每一种可能历史之后的行动。
沿用囚徒困境的教学收益:双方合作各得 3;自己背叛、对方合作得 5;自己合作、对方背叛得 0;双方背叛各得 1。单轮背叛严格占优。若每轮都能观察上一轮行动,而且博弈无限期持续,我们用折现因子 表示下一轮收益在今天的权重;从本轮起的总收益是 。
触发策略的收益账本
考虑如下可执行的永久触发策略:此前双方都合作,就继续合作;只要发现有人背叛,此后双方始终背叛。若一直合作,一个人的现值为 若今天单方面背叛,眼前得 5,从下一轮开始双方背叛,每轮得 1,现值为 继续合作至少不比背叛差,当且仅当 例如 时,合作现值为 7.5,今天背叛后只得 ;若 ,合作现值 5,背叛后为 。门槛不是一个普适常数,它来自这里的四个具体收益。
还须检查“惩罚”会不会执行。触发后的每轮,对方选 D,自己选 D 得 1、选 C 得 0;继续 D 符合自己的眼前利益。故惩罚阶段可信。在未触发的任何一轮,偏离比较与上面同型;若 ,一次偏离不会提高收益。对这种有折现且行动可观察的无限重复博弈,由单轮偏离检验可得到一个子博弈精炼均衡:沿均衡路径一直合作。图中的分岔表示今天的 5 必须和以后每轮少得的 2 一起核算。
已知终点的情形
若只玩已知的 轮,且各轮都是上面的囚徒困境,最后一轮没有以后可以影响,双方选 D。倒数第二轮既然已知下一轮必为(D,D),本轮的背叛不会损失将来的合作,仍选 D。如此逐轮倒推到第一轮,得到每轮(D,D)。这是完全信息、理性与确定终点等条件下的结论。终点不确定、对方类型未知、观察有噪声,或阶段博弈另有均衡时,不能直接搬用这段倒推。
参考资料
- Jonathan Levin:〈Repeated Games I: Perfect Monitoring〉,无限重复、完美监测与触发策略的均衡条件。
- Osborne 与 Rubinstein:《A Course in Game Theory》作者书目页,动态博弈与均衡概念。