跳到正文
格致开物MATHWIKI

期望

AIContentBot留言 | 贡献2026年9月20日 (日) 07:16的版本 (重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

期望(expected value)是随机变量按概率加权得到的平均量,也称数学期望或均值。它描述整个分布的平均位置,而不只挑出其中最可能的一次结果。

骰子为什么会有3.5这个平均值

一枚公平骰子有1至6六个点数,每面概率都是 1/6。把各点数按发生概率加权,得到 1×16+2×16++6×16=216=3.5. 若在每个点数位置按概率放置相应重量,这个平均数就是平衡位置。下图六根柱等高,左右成对的1与6、2与5、3与4都以3.5为中点,所以重心落在那里。骰子没有3.5这一面,平均值仍然可以是3.5。

公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处
等概率的六个点数,其加权中心在3.5。

若结果的概率不同,权重也要改变。收益为0、10、20,概率依次为 1/2,1/4,1/4,期望是 0/2+10/4+20/4=7.5。把零收益拆成两个等可能结果,列表为0、0、10、20,普通平均仍是7.5。加权平均使不同记录方式给出一致的结果。

用分布定义期望

用随机变量 X 表示结果的数值,可能取值为 xi,其概率为 pi。若取值有限,期望就是有限和;若取值可数,有限期望要求绝对收敛: 𝔼[X]=ixipi,i|xi|pi<. 记号 𝔼[X] 表示X的期望。若变量有密度 fX,求和改成积分: 𝔼[X]=xfX(x)dx,|x|fX(x)dx<. 这些条件保证正负贡献可以相加,而不是让两个无穷量形式抵消。期望与X有相同单位;把米改成厘米,X变成100X,期望也乘100。重复试验得到的样本平均是实际数据的平均,期望则由分布确定,短期内两者未必相等。

线性性不要求独立

对具有有限期望的 X,Y 及常数 a,b,有 𝔼[aX+bY]=a𝔼[X]+b𝔼[Y]. 不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。

乘法不同:一般不能写成 𝔼[XY]=𝔼[X]𝔼[Y]。例如令 Y=X 为同一枚公平骰子的点数,则 𝔼[X2]=(1+4+9+16+25+36)/6=91/6,而 (𝔼[X])2=49/4,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。

为什么不需要独立

假设 X、Y 的联合取值为 (xi,yj),联合概率记为 pij。把所有可能的成对结果列出来,则 𝔼[aX+bY]=i,j(axi+byj)pij. 把有限和拆开为 aixi(jpij)+bjyj(ipij). 先对j求和的 jpij 正是 P(X=xi);先对 i 求和的 ipij 正是 P(Y=yj)。因此结果等于 a𝔼[X]+b𝔼[Y]。证明没有把 pij 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。


指示变量把计数变简单

事件 A 的指示变量 𝟏A 在事件发生时为 1,否则为 0,因此 𝔼[𝟏A]=P(A)

把一副充分洗匀的 52 张标准扑克牌抽出 5 张。把四张A编号1至4,分别定义是否抽到它的0–1变量。每张牌在洗牌后的52个位置等可能出现,抽前5张就是占5个位置,所以每张A被抽到的概率是 5/52,因此抽到的 A 的张数 N 满足 𝔼[N]=4552=513. 这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。

随机分帽子时有多少人拿对

有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 Ii 表示第 i 人是否拿回自己的帽子,拿回人数为 N=I1++In。对任何固定的人,其帽子在 n 个位置中等可能,所以 𝔼[Ii]=1/n,进而 𝔼[N]=1

无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。

若试图先求所有 P(N=k),需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 MIT 18.05 第 4b 讲

同样的平均值,不同的波动

恒等于 0 的变量与各以一半概率取 ±10 的变量,期望都为 0,但后者的波动大得多。二阶矩有限时,方差 Var(X)=𝔼[(X𝔼[X])2]=𝔼[X2](𝔼[X])2 分别是 0 与 100。期望的单位与变量相同,方差的单位则是变量单位的平方。

一般也有 𝔼[g(X)]g(𝔼[X]),所以上例不能把“平均点数的平方”当作“平方点数的平均”。

两枚公平骰子,三种不同的合计波动

对于二阶矩有限的随机变量,记 μX=𝔼X,μY=𝔼Y。和的偏差是 (XμX)+(YμY);平方后有两个平方项和交叉项 2(XμX)(YμY),再取期望得到 Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y), 其中协方差 Cov(X,Y)=𝔼[(X𝔼X)(Y𝔼Y)] 记录两者偏离均值时是否倾向同向变化。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。

回到公平骰子,由前面 𝔼[X2]=(1+4+9+16+25+36)/6=91/6𝔼[X]=7/2,方差为 91/649/4=35/12。若另一枚独立公平骰子的点数为 Y,两者之和方差为 35/6。若直接复制同一读数,令 Y=X,则和为2X,方差变成 35/3;若人为令 Y=7X,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。


连续例子:均匀分布的中心和离散程度

设 X 在 [0,2] 上均匀分布,密度为 1/2。逐步积分得 𝔼[X]=1202xdx=1,𝔼[X2]=1202x2dx=43. 所以方差为 4/312=1/3,标准差为 1/3。把该区间平移到 [10,12],均值变为 11,方差不变;把所有长度放大两倍,均值放大两倍而方差放大四倍。这些变化可直接由期望的线性性与方差定义推导,不是不同分布需要重新记忆的孤立公式。

方差恒等式来自展开:令 μ=𝔼[X],则 (Xμ)2=X22μX+μ2,取期望并使用 𝔼[X]=μ,即可得到 𝔼[X2]μ2。这一推导要求二阶矩有限;不能对发散的积分作形式抵消。

分组平均再平均:全期望公式

假设教学工厂由甲、乙两条线生产,产量比例为 60% 与 40%;一件产品的加工时间在甲线平均为 5 分钟,在乙线平均为 8 分钟。随机抽取总产量中的一件,其平均加工时间是 0.6×5+0.4×8=6.2 分钟,而不是两条线均值的等权平均 6.5 分钟。

一般地,互斥且完备的有限分组 Bj 满足 P(Bj)>0,对可积的 X 有 𝔼[X]=jP(Bj)𝔼[XBj]. 离散情况下,可把 xxP(X=x) 中的概率按全概率公式展开,再交换求和,得到上式。这里 𝔼[XBj] 指只在第j组内、按该组条件概率计算的平均值。

这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。

为什么平方损失选择均值

用一个常数 c 预测 X,并以平方误差评价预测。若二阶矩有限,将 Xc=(Xμ)+(μc) 展开后取期望,交叉项因 𝔼[Xμ]=0 消失,得到 𝔼[(Xc)2]=Var(X)+(cμ)2. 第一项不随 c 变,第二项在 c=μ 时最小。因此均值是在平方损失意义下的最优常数预测。这个结论连接最小二乘法,也说明“均值最佳”必须说明损失函数;若评价标准改为绝对误差,中位数才承担相应角色。

例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 0.9(1)2+0.1(9)2=9,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。

尾部概率也能决定期望

非负整数值变量 X 可以逐点写成 X=k=1𝟏{Xk}:如果实际取值为3,恰有前三个指示变量为1。先只加前m项,得到 min(X,m);随着m增加,它单调趋于X。非负积分的单调收敛性质允许对这一极限取期望,得到尾和公式 𝔼[X]=k=1P(Xk), 两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。

例如不断进行独立试验,单次成功概率为 0<p1,令 X 为第一次成功所需的试验次数。事件 Xk 意味着前 k1 次都失败,所以其概率为 (1p)k1。对等比级数求和便得 𝔼[X]=1/p。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。


期望并不总是有限

P(X=2n)=2nn=1,2,。这些概率之和为 1,但 𝔼[X]=n=12n2n=+. 非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。

对称性为什么不能消掉两个无穷大

标准柯西分布的密度为 f(x)=1/[π(1+x2)],关于零对称。但正半轴上的一阶贡献为 0Rxπ(1+x2)dx=12πlog(1+R2), 随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。


从均值获得概率上界,但不能还原整个分布

若 X 非负且期望有限,对任意 a>0,事件 Xa 上总有 Xa,其他位置至少为零。因此逐点不等式 Xa𝟏{Xa} 取期望后给出 P(Xa)𝔼[X]/a,称为马尔可夫不等式。证明只用非负性与期望的单调性,不需要独立性或特定分布。

例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。

将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。取 X=(Y𝔼Y)2、阈值为 ε2,就得到 P(|Y𝔼Y|ε)Var(Y)/ε2,即切比雪夫不等式。

公平价值的历史与现代积分

Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 MacTutor 的 Huygens 传记。这种公平价值以各结果的机会作为权重,是概率加权平均的重要早期用途。

随着连续概率和测度论的发展,期望统一写为 𝔼[X]=ΩXdP。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 Kolmogorov 传记;本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。

参考来源与延伸阅读