期望:修订间差异
AIContentBot(留言 | 贡献) 扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航 |
AIContentBot(留言 | 贡献) 重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范 |
||
| 第1行: | 第1行: | ||
'''期望'''(expected | '''期望'''(expected value)是随机变量按概率加权得到的平均量,也称数学期望或均值。它描述整个分布的平均位置,而不只挑出其中最可能的一次结果。 | ||
== 骰子为什么会有3.5这个平均值 == | |||
一枚公平骰子有1至6六个点数,每面概率都是 <math>1/6</math>。把各点数按发生概率加权,得到 | |||
<math display="block">1\times\frac16+2\times\frac16+\cdots+6\times\frac16=\frac{21}6=3.5.</math> | |||
若在每个点数位置按概率放置相应重量,这个平均数就是平衡位置。下图六根柱等高,左右成对的1与6、2与5、3与4都以3.5为中点,所以重心落在那里。骰子没有3.5这一面,平均值仍然可以是3.5。 | |||
[[File:Gezhi-expectation-die-theme.svg|frame|center|alt=公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处|等概率的六个点数,其加权中心在3.5。]] | |||
若结果的概率不同,权重也要改变。收益为0、10、20,概率依次为 <math>1/2,1/4,1/4</math>,期望是 <math>0/2+10/4+20/4=7.5</math>。把零收益拆成两个等可能结果,列表为0、0、10、20,普通平均仍是7.5。加权平均使不同记录方式给出一致的结果。 | |||
</ | |||
== | == 用分布定义期望 == | ||
用随机变量 <math>X</math> 表示结果的数值,可能取值为 <math>x_i</math>,其概率为 <math>p_i</math>。若取值有限,期望就是有限和;若取值可数,有限期望要求绝对收敛: | |||
<math display="block">\mathbb E[X]=\sum_i x_i p_i,\qquad \sum_i |x_i|p_i<\infty.</math> | <math display="block">\mathbb E[X]=\sum_i x_i p_i,\qquad\sum_i|x_i|p_i<\infty.</math> | ||
记号 <math>\mathbb E[X]</math> 表示X的期望。若变量有密度 <math>f_X</math>,求和改成积分: | |||
<math display="block">\mathbb E[X]=\int_{-\infty}^{\infty}x f_X(x)\,dx, | <math display="block">\mathbb E[X]=\int_{-\infty}^{\infty}x f_X(x)\,dx,\qquad\int_{-\infty}^{\infty}|x|f_X(x)\,dx<\infty.</math> | ||
这些条件保证正负贡献可以相加,而不是让两个无穷量形式抵消。期望与X有相同单位;把米改成厘米,X变成100X,期望也乘100。重复试验得到的样本平均是实际数据的平均,期望则由分布确定,短期内两者未必相等。 | |||
== 线性性不要求独立 == | == 线性性不要求独立 == | ||
| 第26行: | 第22行: | ||
不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。 | 不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。 | ||
乘法不同:一般不能写成 <math>\mathbb E[XY]=\mathbb E[X]\mathbb E[Y]</math>。例如令 <math>Y=X</math> 为同一枚公平骰子的点数,则 <math>\mathbb E[X^2]=91/6</math>,而 <math>(\mathbb E[X])^2=49/4</math>,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。 | 乘法不同:一般不能写成 <math>\mathbb E[XY]=\mathbb E[X]\mathbb E[Y]</math>。例如令 <math>Y=X</math> 为同一枚公平骰子的点数,则 <math>\mathbb E[X^2]=(1+4+9+16+25+36)/6=91/6</math>,而 <math>(\mathbb E[X])^2=49/4</math>,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。 | ||
=== 为什么不需要独立 === | |||
假设 X、Y 的联合取值为 <math>(x_i,y_j)</math>,联合概率记为 <math>p_{ij}</math>。把所有可能的成对结果列出来,则 | |||
<math display="block">\mathbb E[aX+bY]=\sum_{i,j}(ax_i+by_j)p_{ij}.</math> | |||
把有限和拆开为 | |||
<math display="block">a\sum_i x_i\left(\sum_jp_{ij}\right)+b\sum_jy_j\left(\sum_ip_{ij}\right).</math> | |||
先对j求和的 <math>\sum_jp_{ij}</math> 正是 <math>P(X=x_i)</math>;先对 i 求和的 <math>\sum_ip_{ij}</math> 正是 <math>P(Y=y_j)</math>。因此结果等于 <math>a\mathbb E[X]+b\mathbb E[Y]</math>。证明没有把 <math>p_{ij}</math> 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。 | |||
== 指示变量把计数变简单 == | == 指示变量把计数变简单 == | ||
事件 <math>A</math> 的指示变量 <math>\mathbf1_A</math> 在事件发生时为 1,否则为 0,因此 <math>\mathbb E[\mathbf1_A]=P(A)</math>。 | 事件 <math>A</math> 的指示变量 <math>\mathbf1_A</math> 在事件发生时为 1,否则为 0,因此 <math>\mathbb E[\mathbf1_A]=P(A)</math>。 | ||
把一副充分洗匀的 52 张标准扑克牌抽出 5 | 把一副充分洗匀的 52 张标准扑克牌抽出 5 张。把四张A编号1至4,分别定义是否抽到它的0–1变量。每张牌在洗牌后的52个位置等可能出现,抽前5张就是占5个位置,所以每张A被抽到的概率是 <math>5/52</math>,因此抽到的 A 的张数 <math>N</math> 满足 | ||
<math display="block">\mathbb E[N]=4\cdot\frac5{52}=\frac5{13}.</math> | <math display="block">\mathbb E[N]=4\cdot\frac5{52}=\frac5{13}.</math> | ||
这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。 | 这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。 | ||
=== 随机分帽子时有多少人拿对 === | |||
有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 <math>I_i</math> 表示第 i 人是否拿回自己的帽子,拿回人数为 <math>N=I_1+\cdots+I_n</math>。对任何固定的人,其帽子在 n 个位置中等可能,所以 <math>\mathbb E[I_i]=1/n</math>,进而 <math>\mathbb E[N]=1</math>。 | |||
无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。 | |||
若试图先求所有 <math>P(N=k)</math>,需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class04-prep-b_pdf/ MIT 18.05 第 4b 讲]。 | |||
== 同样的平均值,不同的波动 == | == 同样的平均值,不同的波动 == | ||
| 第42行: | 第53行: | ||
一般也有 <math>\mathbb E[g(X)]\ne g(\mathbb E[X])</math>,所以上例不能把“平均点数的平方”当作“平方点数的平均”。 | 一般也有 <math>\mathbb E[g(X)]\ne g(\mathbb E[X])</math>,所以上例不能把“平均点数的平方”当作“平方点数的平均”。 | ||
== | === 两枚公平骰子,三种不同的合计波动 === | ||
对于二阶矩有限的随机变量,记 <math>\mu_X=\mathbb EX,\mu_Y=\mathbb EY</math>。和的偏差是 <math>(X-\mu_X)+(Y-\mu_Y)</math>;平方后有两个平方项和交叉项 <math>2(X-\mu_X)(Y-\mu_Y)</math>,再取期望得到 | |||
<math display="block">\ | <math display="block">\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y),</math> | ||
其中协方差 <math>\operatorname{Cov}(X,Y)=\mathbb E[(X-\mathbb E X)(Y-\mathbb E Y)]</math> 记录两者偏离均值时是否倾向同向变化。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。 | |||
回到公平骰子,由前面 <math>\mathbb E[X^2]=(1+4+9+16+25+36)/6=91/6</math> 与 <math>\mathbb E[X]=7/2</math>,方差为 <math>91/6-49/4=35/12</math>。若另一枚独立公平骰子的点数为 Y,两者之和方差为 <math>35/6</math>。若直接复制同一读数,令 <math>Y=X</math>,则和为2X,方差变成 <math>35/3</math>;若人为令 <math>Y=7-X</math>,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。 | |||
<math | |||
== 连续例子:均匀分布的中心和离散程度 == | == 连续例子:均匀分布的中心和离散程度 == | ||
| 第78行: | 第73行: | ||
一般地,互斥且完备的有限分组 <math>B_j</math> 满足 <math>P(B_j)>0</math>,对可积的 X 有 | 一般地,互斥且完备的有限分组 <math>B_j</math> 满足 <math>P(B_j)>0</math>,对可积的 X 有 | ||
<math display="block">\mathbb E[X]=\sum_jP(B_j)\mathbb E[X\mid B_j].</math> | <math display="block">\mathbb E[X]=\sum_jP(B_j)\mathbb E[X\mid B_j].</math> | ||
离散情况下,可把 <math>\sum_xxP(X=x)</math> | 离散情况下,可把 <math>\sum_xxP(X=x)</math> 中的概率按全概率公式展开,再交换求和,得到上式。这里 <math>\mathbb E[X\mid B_j]</math> 指只在第j组内、按该组条件概率计算的平均值。 | ||
这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。 | 这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。 | ||
| 第88行: | 第83行: | ||
例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 <math>0.9(1)^2+0.1(9)^2=9</math>,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。 | 例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 <math>0.9(1)^2+0.1(9)^2=9</math>,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。 | ||
== 尾部概率也能决定期望 == | == 尾部概率也能决定期望 == | ||
非负整数值变量 X 可以逐点写成 <math>X=\sum_{k=1}^{\infty}\mathbf1_{\{X\ge k\}}</math> | 非负整数值变量 X 可以逐点写成 <math>X=\sum_{k=1}^{\infty}\mathbf1_{\{X\ge k\}}</math>:如果实际取值为3,恰有前三个指示变量为1。先只加前m项,得到 <math>\min(X,m)</math>;随着m增加,它单调趋于X。非负积分的单调收敛性质允许对这一极限取期望,得到尾和公式 | ||
<math display="block">\mathbb E[X]=\sum_{k=1}^{\infty}P(X\ge k),</math> | <math display="block">\mathbb E[X]=\sum_{k=1}^{\infty}P(X\ge k),</math> | ||
两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。 | 两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。 | ||
| 第105行: | 第91行: | ||
例如不断进行独立试验,单次成功概率为 <math>0<p\le1</math>,令 X 为第一次成功所需的试验次数。事件 <math>X\ge k</math> 意味着前 <math>k-1</math> 次都失败,所以其概率为 <math>(1-p)^{k-1}</math>。对等比级数求和便得 <math>\mathbb E[X]=1/p</math>。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。 | 例如不断进行独立试验,单次成功概率为 <math>0<p\le1</math>,令 X 为第一次成功所需的试验次数。事件 <math>X\ge k</math> 意味着前 <math>k-1</math> 次都失败,所以其概率为 <math>(1-p)^{k-1}</math>。对等比级数求和便得 <math>\mathbb E[X]=1/p</math>。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。 | ||
== 期望并不总是有限 == | |||
令 <math>P(X=2^n)=2^{-n}</math>,<math>n=1,2,\ldots</math>。这些概率之和为 1,但 | |||
<math display="block">\mathbb E[X]=\sum_{n=1}^{\infty}2^n2^{-n}=+\infty.</math> | |||
非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。 | |||
== 对称性为什么不能消掉两个无穷大 == | == 对称性为什么不能消掉两个无穷大 == | ||
| 第112行: | 第102行: | ||
随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。 | 随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。 | ||
== 从均值获得概率上界,但不能还原整个分布 == | == 从均值获得概率上界,但不能还原整个分布 == | ||
| 第121行: | 第109行: | ||
例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。 | 例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。 | ||
将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。取 <math>X=(Y-\mathbb E Y)^2</math>、阈值为 <math>\varepsilon^2</math>,就得到 <math>P(|Y-\mathbb E Y|\ge\varepsilon)\le\operatorname{Var}(Y)/\varepsilon^2</math>,即切比雪夫不等式。 | |||
== 公平价值的历史与现代积分 == | == 公平价值的历史与现代积分 == | ||
Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Huygens/ MacTutor 的 Huygens 传记] | Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Huygens/ MacTutor 的 Huygens 传记]。这种公平价值以各结果的机会作为权重,是概率加权平均的重要早期用途。 | ||
随着连续概率和测度论的发展,期望统一写为 <math>\mathbb E[X]=\int_\Omega X\,dP</math>。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记];本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。 | 随着连续概率和测度论的发展,期望统一写为 <math>\mathbb E[X]=\int_\Omega X\,dP</math>。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记];本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。 | ||
== 参考来源与延伸阅读 == | == 参考来源与延伸阅读 == | ||
2026年9月20日 (日) 07:16的最新版本
期望(expected value)是随机变量按概率加权得到的平均量,也称数学期望或均值。它描述整个分布的平均位置,而不只挑出其中最可能的一次结果。
骰子为什么会有3.5这个平均值
一枚公平骰子有1至6六个点数,每面概率都是 。把各点数按发生概率加权,得到 若在每个点数位置按概率放置相应重量,这个平均数就是平衡位置。下图六根柱等高,左右成对的1与6、2与5、3与4都以3.5为中点,所以重心落在那里。骰子没有3.5这一面,平均值仍然可以是3.5。
若结果的概率不同,权重也要改变。收益为0、10、20,概率依次为 ,期望是 。把零收益拆成两个等可能结果,列表为0、0、10、20,普通平均仍是7.5。加权平均使不同记录方式给出一致的结果。
用分布定义期望
用随机变量 表示结果的数值,可能取值为 ,其概率为 。若取值有限,期望就是有限和;若取值可数,有限期望要求绝对收敛: 记号 表示X的期望。若变量有密度 ,求和改成积分: 这些条件保证正负贡献可以相加,而不是让两个无穷量形式抵消。期望与X有相同单位;把米改成厘米,X变成100X,期望也乘100。重复试验得到的样本平均是实际数据的平均,期望则由分布确定,短期内两者未必相等。
线性性不要求独立
对具有有限期望的 及常数 ,有 不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。
乘法不同:一般不能写成 。例如令 为同一枚公平骰子的点数,则 ,而 ,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。
为什么不需要独立
假设 X、Y 的联合取值为 ,联合概率记为 。把所有可能的成对结果列出来,则 把有限和拆开为 先对j求和的 正是 ;先对 i 求和的 正是 。因此结果等于 。证明没有把 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。
指示变量把计数变简单
事件 的指示变量 在事件发生时为 1,否则为 0,因此 。
把一副充分洗匀的 52 张标准扑克牌抽出 5 张。把四张A编号1至4,分别定义是否抽到它的0–1变量。每张牌在洗牌后的52个位置等可能出现,抽前5张就是占5个位置,所以每张A被抽到的概率是 ,因此抽到的 A 的张数 满足 这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。
随机分帽子时有多少人拿对
有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 表示第 i 人是否拿回自己的帽子,拿回人数为 。对任何固定的人,其帽子在 n 个位置中等可能,所以 ,进而 。
无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。
若试图先求所有 ,需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 MIT 18.05 第 4b 讲。
同样的平均值,不同的波动
恒等于 0 的变量与各以一半概率取 ±10 的变量,期望都为 0,但后者的波动大得多。二阶矩有限时,方差 分别是 0 与 100。期望的单位与变量相同,方差的单位则是变量单位的平方。
一般也有 ,所以上例不能把“平均点数的平方”当作“平方点数的平均”。
两枚公平骰子,三种不同的合计波动
对于二阶矩有限的随机变量,记 。和的偏差是 ;平方后有两个平方项和交叉项 ,再取期望得到 其中协方差 记录两者偏离均值时是否倾向同向变化。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。
回到公平骰子,由前面 与 ,方差为 。若另一枚独立公平骰子的点数为 Y,两者之和方差为 。若直接复制同一读数,令 ,则和为2X,方差变成 ;若人为令 ,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。
连续例子:均匀分布的中心和离散程度
设 X 在 上均匀分布,密度为 。逐步积分得 所以方差为 ,标准差为 。把该区间平移到 ,均值变为 11,方差不变;把所有长度放大两倍,均值放大两倍而方差放大四倍。这些变化可直接由期望的线性性与方差定义推导,不是不同分布需要重新记忆的孤立公式。
方差恒等式来自展开:令 ,则 ,取期望并使用 ,即可得到 。这一推导要求二阶矩有限;不能对发散的积分作形式抵消。
分组平均再平均:全期望公式
假设教学工厂由甲、乙两条线生产,产量比例为 60% 与 40%;一件产品的加工时间在甲线平均为 5 分钟,在乙线平均为 8 分钟。随机抽取总产量中的一件,其平均加工时间是 分钟,而不是两条线均值的等权平均 6.5 分钟。
一般地,互斥且完备的有限分组 满足 ,对可积的 X 有 离散情况下,可把 中的概率按全概率公式展开,再交换求和,得到上式。这里 指只在第j组内、按该组条件概率计算的平均值。
这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。
为什么平方损失选择均值
用一个常数 c 预测 X,并以平方误差评价预测。若二阶矩有限,将 展开后取期望,交叉项因 消失,得到 第一项不随 c 变,第二项在 时最小。因此均值是在平方损失意义下的最优常数预测。这个结论连接最小二乘法,也说明“均值最佳”必须说明损失函数;若评价标准改为绝对误差,中位数才承担相应角色。
例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 ,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。
尾部概率也能决定期望
非负整数值变量 X 可以逐点写成 :如果实际取值为3,恰有前三个指示变量为1。先只加前m项,得到 ;随着m增加,它单调趋于X。非负积分的单调收敛性质允许对这一极限取期望,得到尾和公式 两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。
例如不断进行独立试验,单次成功概率为 ,令 X 为第一次成功所需的试验次数。事件 意味着前 次都失败,所以其概率为 。对等比级数求和便得 。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。
期望并不总是有限
令 ,。这些概率之和为 1,但 非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。
对称性为什么不能消掉两个无穷大
标准柯西分布的密度为 ,关于零对称。但正半轴上的一阶贡献为 随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。
从均值获得概率上界,但不能还原整个分布
若 X 非负且期望有限,对任意 ,事件 上总有 ,其他位置至少为零。因此逐点不等式 取期望后给出 ,称为马尔可夫不等式。证明只用非负性与期望的单调性,不需要独立性或特定分布。
例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。
将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。取 、阈值为 ,就得到 ,即切比雪夫不等式。
公平价值的历史与现代积分
Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 MacTutor 的 Huygens 传记。这种公平价值以各结果的机会作为权重,是概率加权平均的重要早期用途。
随着连续概率和测度论的发展,期望统一写为 。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 Kolmogorov 传记;本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。
参考来源与延伸阅读
- MIT 18.05 第 6a 讲:连续随机变量的期望、方差与标准差。
- 最小二乘法 · 统计推断:平方损失与样本均值的后续用途。
- MIT OpenCourseWare,18.05 阅读材料:期望、方差与连续随机变量。
- 概率 · 积分 · 数学建模