跳到正文
格致开物MATHWIKI

期望:修订间差异

AIContentBot留言 | 贡献
扩充定义、推导、算例、边界条件与原创 SVG 配图(AI 辅助整理,算例已复算)
AIContentBot留言 | 贡献
重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范
 
(未显示同一用户的1个中间版本)
第1行: 第1行:
期望是随机变量按照其概率分布加权得到的平均量,也称数学期望或均值。它概括分布的中心位置,但不一定是最可能的值,也不一定是某次试验能够取得的值。
'''期望'''(expected value)是随机变量按概率加权得到的平均量,也称数学期望或均值。它描述整个分布的平均位置,而不只挑出其中最可能的一次结果。


== 概率加权的平均 ==
== 骰子为什么会有3.5这个平均值 ==
离散随机变量 <math>X</math> 的可能取值为 <math>x_i</math>,对应概率为 <math>p_i</math>,在绝对可积时定义
一枚公平骰子有1至6六个点数,每面概率都是 <math>1/6</math>。把各点数按发生概率加权,得到
<math display="block">\mathbb E[X]=\sum_i x_i p_i,\qquad \sum_i |x_i|p_i<\infty.</math>
<math display="block">1\times\frac16+2\times\frac16+\cdots+6\times\frac16=\frac{21}6=3.5.</math>
若有概率密度 <math>f_X</math>,则相应地有
若在每个点数位置按概率放置相应重量,这个平均数就是平衡位置。下图六根柱等高,左右成对的1与6、2与5、3与4都以3.5为中点,所以重心落在那里。骰子没有3.5这一面,平均值仍然可以是3.5。
<math display="block">\mathbb E[X]=\int_{-\infty}^{\infty}x f_X(x)\,dx,</math>
有限期望通常要求 <math>\int |x|f_X(x)\,dx<\infty</math>。没有可积性条件时,形式上的正负抵消可能误导。


[[File:Gezhi-expectation-die.svg|frame|center|alt=公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处|概率分布的“重心”在 3.5,但骰子没有 3.5 这一面。]]
[[File:Gezhi-expectation-die-theme.svg|frame|center|alt=公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处|等概率的六个点数,其加权中心在3.5。]]
公平六面骰的点数期望为
 
<math display="block">\mathbb E[X]=\frac{1+2+3+4+5+6}{6}=3.5.</math>
若结果的概率不同,权重也要改变。收益为0、10、20,概率依次为 <math>1/2,1/4,1/4</math>,期望是 <math>0/2+10/4+20/4=7.5</math>。把零收益拆成两个等可能结果,列表为0、0、10、20,普通平均仍是7.5。加权平均使不同记录方式给出一致的结果。
这描述长期平均的中心,不是在预测下一次会掷出 3.5。
 
== 用分布定义期望 ==
用随机变量 <math>X</math> 表示结果的数值,可能取值为 <math>x_i</math>,其概率为 <math>p_i</math>。若取值有限,期望就是有限和;若取值可数,有限期望要求绝对收敛:
<math display="block">\mathbb E[X]=\sum_i x_i p_i,\qquad\sum_i|x_i|p_i<\infty.</math>
记号 <math>\mathbb E[X]</math> 表示X的期望。若变量有密度 <math>f_X</math>,求和改成积分:
<math display="block">\mathbb E[X]=\int_{-\infty}^{\infty}x f_X(x)\,dx,\qquad\int_{-\infty}^{\infty}|x|f_X(x)\,dx<\infty.</math>
这些条件保证正负贡献可以相加,而不是让两个无穷量形式抵消。期望与X有相同单位;把米改成厘米,X变成100X,期望也乘100。重复试验得到的样本平均是实际数据的平均,期望则由分布确定,短期内两者未必相等。


== 线性性不要求独立 ==
== 线性性不要求独立 ==
第18行: 第22行:
不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。
不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。


乘法不同:一般不能写成 <math>\mathbb E[XY]=\mathbb E[X]\mathbb E[Y]</math>。例如令 <math>Y=X</math> 为同一枚公平骰子的点数,则 <math>\mathbb E[X^2]=91/6</math>,而 <math>(\mathbb E[X])^2=49/4</math>,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。
乘法不同:一般不能写成 <math>\mathbb E[XY]=\mathbb E[X]\mathbb E[Y]</math>。例如令 <math>Y=X</math> 为同一枚公平骰子的点数,则 <math>\mathbb E[X^2]=(1+4+9+16+25+36)/6=91/6</math>,而 <math>(\mathbb E[X])^2=49/4</math>,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。
 
=== 为什么不需要独立 ===
假设 X、Y 的联合取值为 <math>(x_i,y_j)</math>,联合概率记为 <math>p_{ij}</math>。把所有可能的成对结果列出来,则
<math display="block">\mathbb E[aX+bY]=\sum_{i,j}(ax_i+by_j)p_{ij}.</math>
把有限和拆开为
<math display="block">a\sum_i x_i\left(\sum_jp_{ij}\right)+b\sum_jy_j\left(\sum_ip_{ij}\right).</math>
先对j求和的 <math>\sum_jp_{ij}</math> 正是 <math>P(X=x_i)</math>;先对 i 求和的 <math>\sum_ip_{ij}</math> 正是 <math>P(Y=y_j)</math>。因此结果等于 <math>a\mathbb E[X]+b\mathbb E[Y]</math>。证明没有把 <math>p_{ij}</math> 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。
 


== 指示变量把计数变简单 ==
== 指示变量把计数变简单 ==
事件 <math>A</math> 的指示变量 <math>\mathbf1_A</math> 在事件发生时为 1,否则为 0,因此 <math>\mathbb E[\mathbf1_A]=P(A)</math>。
事件 <math>A</math> 的指示变量 <math>\mathbf1_A</math> 在事件发生时为 1,否则为 0,因此 <math>\mathbb E[\mathbf1_A]=P(A)</math>。


把一副充分洗匀的 52 张标准扑克牌抽出 5 张。对每张 A 定义指示变量,表示它是否被抽到。每张牌被抽到的概率都是 <math>5/52</math>,因此抽到的 A 的张数 <math>N</math> 满足
把一副充分洗匀的 52 张标准扑克牌抽出 5 张。把四张A编号1至4,分别定义是否抽到它的0–1变量。每张牌在洗牌后的52个位置等可能出现,抽前5张就是占5个位置,所以每张A被抽到的概率是 <math>5/52</math>,因此抽到的 A 的张数 <math>N</math> 满足
<math display="block">\mathbb E[N]=4\cdot\frac5{52}=\frac5{13}.</math>
<math display="block">\mathbb E[N]=4\cdot\frac5{52}=\frac5{13}.</math>
这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。
这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。
=== 随机分帽子时有多少人拿对 ===
有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 <math>I_i</math> 表示第 i 人是否拿回自己的帽子,拿回人数为 <math>N=I_1+\cdots+I_n</math>。对任何固定的人,其帽子在 n 个位置中等可能,所以 <math>\mathbb E[I_i]=1/n</math>,进而 <math>\mathbb E[N]=1</math>。
无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。
若试图先求所有 <math>P(N=k)</math>,需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class04-prep-b_pdf/ MIT 18.05 第 4b 讲]。


== 同样的平均值,不同的波动 ==
== 同样的平均值,不同的波动 ==
第33行: 第52行:


一般也有 <math>\mathbb E[g(X)]\ne g(\mathbb E[X])</math>,所以上例不能把“平均点数的平方”当作“平方点数的平均”。
一般也有 <math>\mathbb E[g(X)]\ne g(\mathbb E[X])</math>,所以上例不能把“平均点数的平方”当作“平方点数的平均”。
=== 两枚公平骰子,三种不同的合计波动 ===
对于二阶矩有限的随机变量,记 <math>\mu_X=\mathbb EX,\mu_Y=\mathbb EY</math>。和的偏差是 <math>(X-\mu_X)+(Y-\mu_Y)</math>;平方后有两个平方项和交叉项 <math>2(X-\mu_X)(Y-\mu_Y)</math>,再取期望得到
<math display="block">\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y),</math>
其中协方差 <math>\operatorname{Cov}(X,Y)=\mathbb E[(X-\mathbb E X)(Y-\mathbb E Y)]</math> 记录两者偏离均值时是否倾向同向变化。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。
回到公平骰子,由前面 <math>\mathbb E[X^2]=(1+4+9+16+25+36)/6=91/6</math> 与 <math>\mathbb E[X]=7/2</math>,方差为 <math>91/6-49/4=35/12</math>。若另一枚独立公平骰子的点数为 Y,两者之和方差为 <math>35/6</math>。若直接复制同一读数,令 <math>Y=X</math>,则和为2X,方差变成 <math>35/3</math>;若人为令 <math>Y=7-X</math>,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。
== 连续例子:均匀分布的中心和离散程度 ==
设 X 在 <math>[0,2]</math> 上均匀分布,密度为 <math>1/2</math>。逐步积分得
<math display="block">\mathbb E[X]=\frac12\int_0^2x\,dx=1,\qquad \mathbb E[X^2]=\frac12\int_0^2x^2\,dx=\frac43.</math>
所以方差为 <math>4/3-1^2=1/3</math>,标准差为 <math>1/\sqrt3</math>。把该区间平移到 <math>[10,12]</math>,均值变为 11,方差不变;把所有长度放大两倍,均值放大两倍而方差放大四倍。这些变化可直接由期望的线性性与方差定义推导,不是不同分布需要重新记忆的孤立公式。
方差恒等式来自展开:令 <math>\mu=\mathbb E[X]</math>,则 <math>(X-\mu)^2=X^2-2\mu X+\mu^2</math>,取期望并使用 <math>\mathbb E[X]=\mu</math>,即可得到 <math>\mathbb E[X^2]-\mu^2</math>。这一推导要求二阶矩有限;不能对发散的积分作形式抵消。
== 分组平均再平均:全期望公式 ==
假设教学工厂由甲、乙两条线生产,产量比例为 60% 与 40%;一件产品的加工时间在甲线平均为 5 分钟,在乙线平均为 8 分钟。随机抽取总产量中的一件,其平均加工时间是 <math>0.6\times5+0.4\times8=6.2</math> 分钟,而不是两条线均值的等权平均 6.5 分钟。
一般地,互斥且完备的有限分组 <math>B_j</math> 满足 <math>P(B_j)>0</math>,对可积的 X 有
<math display="block">\mathbb E[X]=\sum_jP(B_j)\mathbb E[X\mid B_j].</math>
离散情况下,可把 <math>\sum_xxP(X=x)</math> 中的概率按全概率公式展开,再交换求和,得到上式。这里 <math>\mathbb E[X\mid B_j]</math> 指只在第j组内、按该组条件概率计算的平均值。
这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。
== 为什么平方损失选择均值 ==
用一个常数 c 预测 X,并以平方误差评价预测。若二阶矩有限,将 <math>X-c=(X-\mu)+(\mu-c)</math> 展开后取期望,交叉项因 <math>\mathbb E[X-\mu]=0</math> 消失,得到
<math display="block">\mathbb E[(X-c)^2]=\operatorname{Var}(X)+(c-\mu)^2.</math>
第一项不随 c 变,第二项在 <math>c=\mu</math> 时最小。因此均值是在平方损失意义下的最优常数预测。这个结论连接[[最小二乘法]],也说明“均值最佳”必须说明损失函数;若评价标准改为绝对误差,中位数才承担相应角色。
例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 <math>0.9(1)^2+0.1(9)^2=9</math>,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。
== 尾部概率也能决定期望 ==
非负整数值变量 X 可以逐点写成 <math>X=\sum_{k=1}^{\infty}\mathbf1_{\{X\ge k\}}</math>:如果实际取值为3,恰有前三个指示变量为1。先只加前m项,得到 <math>\min(X,m)</math>;随着m增加,它单调趋于X。非负积分的单调收敛性质允许对这一极限取期望,得到尾和公式
<math display="block">\mathbb E[X]=\sum_{k=1}^{\infty}P(X\ge k),</math>
两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。
例如不断进行独立试验,单次成功概率为 <math>0<p\le1</math>,令 X 为第一次成功所需的试验次数。事件 <math>X\ge k</math> 意味着前 <math>k-1</math> 次都失败,所以其概率为 <math>(1-p)^{k-1}</math>。对等比级数求和便得 <math>\mathbb E[X]=1/p</math>。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。


== 期望并不总是有限 ==
== 期望并不总是有限 ==
第39行: 第97行:
非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。
非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。


== 延伸阅读 ==
== 对称性为什么不能消掉两个无穷大 ==
标准柯西分布的密度为 <math>f(x)=1/[\pi(1+x^2)]</math>,关于零对称。但正半轴上的一阶贡献为
<math display="block">\int_0^R\frac{x}{\pi(1+x^2)}\,dx=\frac1{2\pi}\log(1+R^2),</math>
随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。
 
 
 
== 从均值获得概率上界,但不能还原整个分布 ==
若 X 非负且期望有限,对任意 <math>a>0</math>,事件 <math>X\ge a</math> 上总有 <math>X\ge a</math>,其他位置至少为零。因此逐点不等式 <math>X\ge a\mathbf1_{\{X\ge a\}}</math> 取期望后给出 <math>P(X\ge a)\le\mathbb E[X]/a</math>,称为马尔可夫不等式。证明只用非负性与期望的单调性,不需要独立性或特定分布。
 
例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。
 
将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。取 <math>X=(Y-\mathbb E Y)^2</math>、阈值为 <math>\varepsilon^2</math>,就得到 <math>P(|Y-\mathbb E Y|\ge\varepsilon)\le\operatorname{Var}(Y)/\varepsilon^2</math>,即切比雪夫不等式。
 
== 公平价值的历史与现代积分 ==
Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Huygens/ MacTutor 的 Huygens 传记]。这种公平价值以各结果的机会作为权重,是概率加权平均的重要早期用途。
 
随着连续概率和测度论的发展,期望统一写为 <math>\mathbb E[X]=\int_\Omega X\,dP</math>。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记];本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。
 
== 参考来源与延伸阅读 ==
* [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class06-prep-a_pdf/ MIT 18.05 第 6a 讲:连续随机变量的期望、方差与标准差]。
* [[最小二乘法]] · [[统计推断]]:平方损失与样本均值的后续用途。
* [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/pages/classes-reading-and-in-class-materials/ MIT OpenCourseWare,18.05 阅读材料]:期望、方差与连续随机变量。
* [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/pages/classes-reading-and-in-class-materials/ MIT OpenCourseWare,18.05 阅读材料]:期望、方差与连续随机变量。
* [[概率]] · [[积分]] · [[数学建模]]
* [[概率]] · [[积分]] · [[数学建模]]
[[分类:概率与统计]]
[[分类:概率与统计]]

2026年9月20日 (日) 07:16的最新版本

期望(expected value)是随机变量按概率加权得到的平均量,也称数学期望或均值。它描述整个分布的平均位置,而不只挑出其中最可能的一次结果。

骰子为什么会有3.5这个平均值

一枚公平骰子有1至6六个点数,每面概率都是 1/6。把各点数按发生概率加权,得到 1×16+2×16++6×16=216=3.5. 若在每个点数位置按概率放置相应重量,这个平均数就是平衡位置。下图六根柱等高,左右成对的1与6、2与5、3与4都以3.5为中点,所以重心落在那里。骰子没有3.5这一面,平均值仍然可以是3.5。

公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处
等概率的六个点数,其加权中心在3.5。

若结果的概率不同,权重也要改变。收益为0、10、20,概率依次为 1/2,1/4,1/4,期望是 0/2+10/4+20/4=7.5。把零收益拆成两个等可能结果,列表为0、0、10、20,普通平均仍是7.5。加权平均使不同记录方式给出一致的结果。

用分布定义期望

用随机变量 X 表示结果的数值,可能取值为 xi,其概率为 pi。若取值有限,期望就是有限和;若取值可数,有限期望要求绝对收敛: 𝔼[X]=ixipi,i|xi|pi<. 记号 𝔼[X] 表示X的期望。若变量有密度 fX,求和改成积分: 𝔼[X]=xfX(x)dx,|x|fX(x)dx<. 这些条件保证正负贡献可以相加,而不是让两个无穷量形式抵消。期望与X有相同单位;把米改成厘米,X变成100X,期望也乘100。重复试验得到的样本平均是实际数据的平均,期望则由分布确定,短期内两者未必相等。

线性性不要求独立

对具有有限期望的 X,Y 及常数 a,b,有 𝔼[aX+bY]=a𝔼[X]+b𝔼[Y]. 不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。

乘法不同:一般不能写成 𝔼[XY]=𝔼[X]𝔼[Y]。例如令 Y=X 为同一枚公平骰子的点数,则 𝔼[X2]=(1+4+9+16+25+36)/6=91/6,而 (𝔼[X])2=49/4,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。

为什么不需要独立

假设 X、Y 的联合取值为 (xi,yj),联合概率记为 pij。把所有可能的成对结果列出来,则 𝔼[aX+bY]=i,j(axi+byj)pij. 把有限和拆开为 aixi(jpij)+bjyj(ipij). 先对j求和的 jpij 正是 P(X=xi);先对 i 求和的 ipij 正是 P(Y=yj)。因此结果等于 a𝔼[X]+b𝔼[Y]。证明没有把 pij 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。


指示变量把计数变简单

事件 A 的指示变量 𝟏A 在事件发生时为 1,否则为 0,因此 𝔼[𝟏A]=P(A)

把一副充分洗匀的 52 张标准扑克牌抽出 5 张。把四张A编号1至4,分别定义是否抽到它的0–1变量。每张牌在洗牌后的52个位置等可能出现,抽前5张就是占5个位置,所以每张A被抽到的概率是 5/52,因此抽到的 A 的张数 N 满足 𝔼[N]=4552=513. 这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。

随机分帽子时有多少人拿对

有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 Ii 表示第 i 人是否拿回自己的帽子,拿回人数为 N=I1++In。对任何固定的人,其帽子在 n 个位置中等可能,所以 𝔼[Ii]=1/n,进而 𝔼[N]=1

无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。

若试图先求所有 P(N=k),需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 MIT 18.05 第 4b 讲

同样的平均值,不同的波动

恒等于 0 的变量与各以一半概率取 ±10 的变量,期望都为 0,但后者的波动大得多。二阶矩有限时,方差 Var(X)=𝔼[(X𝔼[X])2]=𝔼[X2](𝔼[X])2 分别是 0 与 100。期望的单位与变量相同,方差的单位则是变量单位的平方。

一般也有 𝔼[g(X)]g(𝔼[X]),所以上例不能把“平均点数的平方”当作“平方点数的平均”。

两枚公平骰子,三种不同的合计波动

对于二阶矩有限的随机变量,记 μX=𝔼X,μY=𝔼Y。和的偏差是 (XμX)+(YμY);平方后有两个平方项和交叉项 2(XμX)(YμY),再取期望得到 Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y), 其中协方差 Cov(X,Y)=𝔼[(X𝔼X)(Y𝔼Y)] 记录两者偏离均值时是否倾向同向变化。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。

回到公平骰子,由前面 𝔼[X2]=(1+4+9+16+25+36)/6=91/6𝔼[X]=7/2,方差为 91/649/4=35/12。若另一枚独立公平骰子的点数为 Y,两者之和方差为 35/6。若直接复制同一读数,令 Y=X,则和为2X,方差变成 35/3;若人为令 Y=7X,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。


连续例子:均匀分布的中心和离散程度

设 X 在 [0,2] 上均匀分布,密度为 1/2。逐步积分得 𝔼[X]=1202xdx=1,𝔼[X2]=1202x2dx=43. 所以方差为 4/312=1/3,标准差为 1/3。把该区间平移到 [10,12],均值变为 11,方差不变;把所有长度放大两倍,均值放大两倍而方差放大四倍。这些变化可直接由期望的线性性与方差定义推导,不是不同分布需要重新记忆的孤立公式。

方差恒等式来自展开:令 μ=𝔼[X],则 (Xμ)2=X22μX+μ2,取期望并使用 𝔼[X]=μ,即可得到 𝔼[X2]μ2。这一推导要求二阶矩有限;不能对发散的积分作形式抵消。

分组平均再平均:全期望公式

假设教学工厂由甲、乙两条线生产,产量比例为 60% 与 40%;一件产品的加工时间在甲线平均为 5 分钟,在乙线平均为 8 分钟。随机抽取总产量中的一件,其平均加工时间是 0.6×5+0.4×8=6.2 分钟,而不是两条线均值的等权平均 6.5 分钟。

一般地,互斥且完备的有限分组 Bj 满足 P(Bj)>0,对可积的 X 有 𝔼[X]=jP(Bj)𝔼[XBj]. 离散情况下,可把 xxP(X=x) 中的概率按全概率公式展开,再交换求和,得到上式。这里 𝔼[XBj] 指只在第j组内、按该组条件概率计算的平均值。

这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。

为什么平方损失选择均值

用一个常数 c 预测 X,并以平方误差评价预测。若二阶矩有限,将 Xc=(Xμ)+(μc) 展开后取期望,交叉项因 𝔼[Xμ]=0 消失,得到 𝔼[(Xc)2]=Var(X)+(cμ)2. 第一项不随 c 变,第二项在 c=μ 时最小。因此均值是在平方损失意义下的最优常数预测。这个结论连接最小二乘法,也说明“均值最佳”必须说明损失函数;若评价标准改为绝对误差,中位数才承担相应角色。

例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 0.9(1)2+0.1(9)2=9,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。

尾部概率也能决定期望

非负整数值变量 X 可以逐点写成 X=k=1𝟏{Xk}:如果实际取值为3,恰有前三个指示变量为1。先只加前m项,得到 min(X,m);随着m增加,它单调趋于X。非负积分的单调收敛性质允许对这一极限取期望,得到尾和公式 𝔼[X]=k=1P(Xk), 两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。

例如不断进行独立试验,单次成功概率为 0<p1,令 X 为第一次成功所需的试验次数。事件 Xk 意味着前 k1 次都失败,所以其概率为 (1p)k1。对等比级数求和便得 𝔼[X]=1/p。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。


期望并不总是有限

P(X=2n)=2nn=1,2,。这些概率之和为 1,但 𝔼[X]=n=12n2n=+. 非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。

对称性为什么不能消掉两个无穷大

标准柯西分布的密度为 f(x)=1/[π(1+x2)],关于零对称。但正半轴上的一阶贡献为 0Rxπ(1+x2)dx=12πlog(1+R2), 随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。


从均值获得概率上界,但不能还原整个分布

若 X 非负且期望有限,对任意 a>0,事件 Xa 上总有 Xa,其他位置至少为零。因此逐点不等式 Xa𝟏{Xa} 取期望后给出 P(Xa)𝔼[X]/a,称为马尔可夫不等式。证明只用非负性与期望的单调性,不需要独立性或特定分布。

例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。

将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。取 X=(Y𝔼Y)2、阈值为 ε2,就得到 P(|Y𝔼Y|ε)Var(Y)/ε2,即切比雪夫不等式。

公平价值的历史与现代积分

Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 MacTutor 的 Huygens 传记。这种公平价值以各结果的机会作为权重,是概率加权平均的重要早期用途。

随着连续概率和测度论的发展,期望统一写为 𝔼[X]=ΩXdP。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 Kolmogorov 传记;本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。

参考来源与延伸阅读