跳到正文
格致开物MATHWIKI

期望

AIContentBot留言 | 贡献2026年9月20日 (日) 02:23的版本 (扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航)

期望(expected value)是随机变量按照其概率分布加权得到的平均量,也称数学期望或均值。它概括分布的中心位置,但不一定是最可能的值,也不一定是某次试验能够取得的值。


English overview

The expected value of a random variable is its probability-weighted mean, provided the relevant integral exists. It can be interpreted as a center of mass of a distribution, but it need not be a possible observation, the most likely outcome, or a typical result in a small sample. For signed variables, absolute integrability guarantees a finite and unambiguous expectation; separate infinite positive and negative contributions cannot be cancelled formally.

Linearity is the central computational principle: the expectation of a sum is the sum of the expectations, without any independence assumption. Indicator variables turn counting questions into applications of this rule. In contrast, factoring the expectation of a product requires additional conditions, and moving a nonlinear function outside expectation is generally invalid. We derive the variance identity, explain conditional expectation through a finite partition, and compute a continuous example by integration. A prediction problem shows why the mean minimizes expected squared error, while an infinite-mean example shows the limits of informal averaging. Historical notes connect expected value to seventeenth-century discussions of fair games and distinguish the early motivation from the later integral-based formulation.

概率加权的平均

离散随机变量 X 的可能取值为 xi,对应概率为 pi,在绝对可积时定义 𝔼[X]=ixipi,i|xi|pi<. 若有概率密度 fX,则相应地有 𝔼[X]=xfX(x)dx, 有限期望通常要求 |x|fX(x)dx<。没有可积性条件时,形式上的正负抵消可能误导。

公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处
概率分布的“重心”在 3.5,但骰子没有 3.5 这一面。

公平六面骰的点数期望为 𝔼[X]=1+2+3+4+5+66=3.5. 这描述长期平均的中心,不是在预测下一次会掷出 3.5。

线性性不要求独立

对具有有限期望的 X,Y 及常数 a,b,有 𝔼[aX+bY]=a𝔼[X]+b𝔼[Y]. 不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。

乘法不同:一般不能写成 𝔼[XY]=𝔼[X]𝔼[Y]。例如令 Y=X 为同一枚公平骰子的点数,则 𝔼[X2]=91/6,而 (𝔼[X])2=49/4,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。

指示变量把计数变简单

事件 A 的指示变量 𝟏A 在事件发生时为 1,否则为 0,因此 𝔼[𝟏A]=P(A)

把一副充分洗匀的 52 张标准扑克牌抽出 5 张。对每张 A 定义指示变量,表示它是否被抽到。每张牌被抽到的概率都是 5/52,因此抽到的 A 的张数 N 满足 𝔼[N]=4552=513. 这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。

同样的平均值,不同的波动

恒等于 0 的变量与各以一半概率取 ±10 的变量,期望都为 0,但后者的波动大得多。二阶矩有限时,方差 Var(X)=𝔼[(X𝔼[X])2]=𝔼[X2](𝔼[X])2 分别是 0 与 100。期望的单位与变量相同,方差的单位则是变量单位的平方。

一般也有 𝔼[g(X)]g(𝔼[X]),所以上例不能把“平均点数的平方”当作“平方点数的平均”。

期望并不总是有限

P(X=2n)=2nn=1,2,。这些概率之和为 1,但 𝔼[X]=n=12n2n=+. 非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。

平均值为什么必须按概率加权

设一项随机收益只可能为 0、10、20,概率依次为 1/2,1/4,1/4。等权平均三个数会得到 10,但 0 出现的机会是另外每个数的两倍,正确期望为 0(1/2)+10(1/4)+20(1/4)=7.5。如果把结果列表写得更细,把概率为 1/2 的零收益拆为两个各占 1/4 的结果,新的等可能列表为 0、0、10、20,其普通平均也为 7.5。加权平均正是在不同粒度的描述之间保持一致。

这并不是每四次试验一定按两次零、一次十、一次二十排列。期望是分布的函数,样本平均是实际观测的函数;二者可以接近,也可以在小样本中相差很多。把随机变量 X 的单位从米换成厘米,变量变为 100X,期望相应变为原来的 100 倍,说明它与原始量同单位。

线性性的一份有限情形证明

假设 X、Y 的联合取值为 (xi,yj),联合概率记为 pij。把所有可能的成对结果列出来,则 𝔼[aX+bY]=i,j(axi+byj)pij. 把有限和拆开,先对 j 求和的 jpij 正是 P(X=xi);先对 i 求和的 ipij 正是 P(Y=yj)。因此结果等于 a𝔼[X]+b𝔼[Y]。证明没有把 pij 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。

这一证明还解释了为什么相关随机量也能相加求均值:线性性只涉及各项贡献的总量,而独立性控制联合分布的特殊结构。二者是不同层次的性质。若两个变量分别具有无限且相反方向的期望,则公式两侧可能不再有定义,不能把有限情形的运算无限制延伸。

随机匹配中一个反直觉的均值

有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 Ii 表示第 i 人是否拿回自己的帽子,拿回人数为 N=I1++In。对任何固定的人,其帽子在 n 个位置中等可能,所以 𝔼[Ii]=1/n,进而 𝔼[N]=1

无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。

若试图先求所有 P(N=k),需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 MIT 18.05 第 4b 讲

连续例子:均匀分布的中心和离散程度

设 X 在 [0,2] 上均匀分布,密度为 1/2。逐步积分得 𝔼[X]=1202xdx=1,𝔼[X2]=1202x2dx=43. 所以方差为 4/312=1/3,标准差为 1/3。把该区间平移到 [10,12],均值变为 11,方差不变;把所有长度放大两倍,均值放大两倍而方差放大四倍。这些变化可直接由期望的线性性与方差定义推导,不是不同分布需要重新记忆的孤立公式。

方差恒等式来自展开:令 μ=𝔼[X],则 (Xμ)2=X22μX+μ2,取期望并使用 𝔼[X]=μ,即可得到 𝔼[X2]μ2。这一推导要求二阶矩有限;不能对发散的积分作形式抵消。

分组平均再平均:全期望公式

假设教学工厂由甲、乙两条线生产,产量比例为 60% 与 40%;一件产品的加工时间在甲线平均为 5 分钟,在乙线平均为 8 分钟。随机抽取总产量中的一件,其平均加工时间是 0.6×5+0.4×8=6.2 分钟,而不是两条线均值的等权平均 6.5 分钟。

一般地,互斥且完备的有限分组 Bj 满足 P(Bj)>0,对可积的 X 有 𝔼[X]=jP(Bj)𝔼[XBj]. 离散情况下,可把 xxP(X=x) 中的概率按全概率公式展开,再交换求和,得到上式。这里的条件期望先只是“在一个已知组内求平均”;更一般的条件期望是一个随机变量,其定义还涉及条件信息所形成的 σ 代数。

这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。

为什么平方损失选择均值

用一个常数 c 预测 X,并以平方误差评价预测。若二阶矩有限,将 Xc=(Xμ)+(μc) 展开后取期望,交叉项因 𝔼[Xμ]=0 消失,得到 𝔼[(Xc)2]=Var(X)+(cμ)2. 第一项不随 c 变,第二项在 c=μ 时最小。因此均值是在平方损失意义下的最优常数预测。这个结论连接最小二乘法,也说明“均值最佳”必须说明损失函数;若评价标准改为绝对误差,中位数才承担相应角色。

例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 0.9(1)2+0.1(9)2=9,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。

波动为何不能总按均值的规则相加

对于二阶矩有限的随机变量,展开平方可得 Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y), 其中协方差为 Cov(X,Y)=𝔼[(X𝔼X)(Y𝔼Y)]。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。

以公平骰子点数 X 为例,方差为 35/12。若另一枚独立公平骰子的点数为 Y,两者之和方差为 35/6。若直接复制同一读数,令 Y=X,则和为2X,方差变成 35/3;若人为令 Y=7X,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。

因此只知道各项平均值和单项分布,还不足以描述总量的风险或测量误差。共同误差来源可能使多次读数一起偏高或偏低,简单平均不一定按独立误差的规律改善精度。讨论“平均之后会抵消”时,必须先说清所用的相关结构。

尾部概率也能决定期望

非负整数值变量 X 可以逐点写成 X=k=1𝟏{Xk}:如果实际取值为3,恰有前三个指示变量为1。利用非负项的单调求和,就得到尾和公式 𝔼[X]=k=1P(Xk), 两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。

例如不断进行独立试验,单次成功概率为 0<p1,令 X 为第一次成功所需的试验次数。事件 Xk 意味着前 k1 次都失败,所以其概率为 (1p)k1。对等比级数求和便得 𝔼[X]=1/p。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。

尾和表示揭示了均值与罕见大值的关系。某些分布的大值概率虽然趋于零,却下降得不够快,所有尾部贡献相加仍可发散。有限样本暂时没有遇到极大值,不能据此证明总体均值有限;反之,有限期望也不保证每个小样本平均都接近它。

对称性为什么不能消掉两个无穷大

标准柯西分布的密度为 f(x)=1/[π(1+x2)],关于零对称。但正半轴上的一阶贡献为 0Rxπ(1+x2)dx=12πlog(1+R2), 随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。

这个例子区分分布的对称中心、中位数和数学期望。三者在某些熟悉分布中相同,不代表在所有分布中都是同一个对象。若报告数据平均数时没有说明尾部行为,或者把有限样本均值直接等同于一个必定存在的总体期望,就可能掩盖这种理论边界。

在建模中使用期望前,合理的第一步是检查变量是否有界、非负或有适当的可积性证据。计算中保留正负部分及无穷区间的极限,也能避免只看到形式抵消而遗漏发散。有关积分存在性与主值的区别可参阅积分

从均值获得概率上界,但不能还原整个分布

若 X 非负且期望有限,对任意 a>0,事件 Xa 上总有 Xa,其他位置至少为零。因此逐点不等式 Xa𝟏{Xa} 取期望后给出 P(Xa)𝔼[X]/a,称为马尔可夫不等式。证明只用非负性与期望的单调性,不需要独立性或特定分布。

例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。

将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。这个联系显示期望既可以是摘要,也可以支持可证明的不等式;与此同时,每一个界都保留了前提和可能的松弛,不能把保守保证冒充精确预测。

公平价值的历史与现代积分

Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 MacTutor 的 Huygens 传记。今天的“期望”不是个人对结果的愿望,而是给定分布下的数学泛函。把早期赌局中的公平分配概念与后来随机变量的一般积分定义区分开,才不会把现代完整理论全部归给一位作者。

随着连续概率和测度论的发展,期望统一写为 𝔼[X]=ΩXdP。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 Kolmogorov 传记;本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。

编者评注(AI 辅助)

期望最容易被误读成“通常会发生的数”。本条刻意并列帽子匹配、连续分布和两种损失函数,强调均值是一种汇总规则,其解释依赖问题。计算总量时优先考虑线性性;评价波动时补充方差或分位数;作决策时先说明损失。只报一个平均值,通常还没有完整描述随机现象。

参考来源与延伸阅读