跳到正文
格致开物MATHWIKI

重复博弈

重复博弈(repeated game)是同一阶段博弈进行多轮;本轮的行动会进入历史,使下一轮的选择可以取决于过去。它和“把一次博弈的收益乘以轮数”不同,因为完整策略要规定每一种可能历史之后的行动。

沿用囚徒困境的教学收益:双方合作各得 3;自己背叛、对方合作得 5;自己合作、对方背叛得 0;双方背叛各得 1。单轮背叛严格占优。若每轮都能观察上一轮行动,而且博弈无限期持续,我们用折现因子 0<δ<1 表示下一轮收益在今天的权重;从本轮起的总收益是 u0+δu1+δ2u2+⋯。

触发策略的收益账本

考虑如下可执行的永久触发策略:此前双方都合作,就继续合作;只要发现有人背叛,此后双方始终背叛。若一直合作,一个人的现值为 VC=3+3δ+3δ2+⋯=31−δ. 若今天单方面背叛,眼前得 5,从下一轮开始双方背叛,每轮得 1,现值为 VD=5+δ+δ2+⋯=5+δ1−δ. 继续合作至少不比背叛差,当且仅当 31−δ≥5+δ1−δ⟺3≥5−4δ⟺δ≥12. 例如 δ=0.6 时,合作现值为 7.5,今天背叛后只得 5+0.6/0.4=6.5;若 δ=0.4,合作现值 5,背叛后为 5+0.4/0.6=523。门槛不是一个普适常数,它来自这里的四个具体收益。

还须检查“惩罚”会不会执行。触发后的每轮,对方选 D,自己选 D 得 1、选 C 得 0;继续 D 符合自己的眼前利益。故惩罚阶段可信。在未触发的任何一轮,偏离比较与上面同型;若 δ≥1/2,一次偏离不会提高收益。对这种有折现且行动可观察的无限重复博弈,由单轮偏离检验可得到一个子博弈精炼均衡:沿均衡路径一直合作。图中的分岔表示今天的 5 必须和以后每轮少得的 2 一起核算。

重复博弈中本轮合作得到3并保持以后每轮合作3,若本轮背叛得到5但以后每轮转为双方背叛收益1;两条收益流由折现因子比较
一次背叛多得 2,代价是此后每轮合作收益 3 变成背叛收益 1。

已知终点的情形

若只玩已知的 m 轮,且各轮都是上面的囚徒困境,最后一轮没有以后可以影响,双方选 D。倒数第二轮既然已知下一轮必为(D,D),本轮的背叛不会损失将来的合作,仍选 D。如此逐轮倒推到第一轮,得到每轮(D,D)。这是完全信息、理性与确定终点等条件下的结论。终点不确定、对方类型未知、观察有噪声,或阶段博弈另有均衡时,不能直接搬用这段倒推。

参考资料