跳到正文
格致开物
MATHWIKI
探索
学科导航
学习路径
搜索
☾
登录
探索
学科导航
学习路径
随机漫游
希腊字母
关于本站
管理员登录
搜索
数学百科
/
知识地图
查看“︁期望”︁的源代码
←
期望
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于这些用户组的用户执行:
管理员
、aipublisher
您可以查看和复制此页面的源代码。
'''期望'''(expected value)是随机变量按概率加权得到的平均量,也称数学期望或均值。它描述整个分布的平均位置,而不只挑出其中最可能的一次结果。 == 骰子为什么会有3.5这个平均值 == 一枚公平骰子有1至6六个点数,每面概率都是 <math>1/6</math>。把各点数按发生概率加权,得到 <math display="block">1\times\frac16+2\times\frac16+\cdots+6\times\frac16=\frac{21}6=3.5.</math> 若在每个点数位置按概率放置相应重量,这个平均数就是平衡位置。下图六根柱等高,左右成对的1与6、2与5、3与4都以3.5为中点,所以重心落在那里。骰子没有3.5这一面,平均值仍然可以是3.5。 [[File:Gezhi-expectation-die-theme.svg|frame|center|alt=公平骰子六个取值的概率柱均为六分之一,均值标在三和四之间的三点五处|等概率的六个点数,其加权中心在3.5。]] 若结果的概率不同,权重也要改变。收益为0、10、20,概率依次为 <math>1/2,1/4,1/4</math>,期望是 <math>0/2+10/4+20/4=7.5</math>。把零收益拆成两个等可能结果,列表为0、0、10、20,普通平均仍是7.5。加权平均使不同记录方式给出一致的结果。 == 用分布定义期望 == 用随机变量 <math>X</math> 表示结果的数值,可能取值为 <math>x_i</math>,其概率为 <math>p_i</math>。若取值有限,期望就是有限和;若取值可数,有限期望要求绝对收敛: <math display="block">\mathbb E[X]=\sum_i x_i p_i,\qquad\sum_i|x_i|p_i<\infty.</math> 记号 <math>\mathbb E[X]</math> 表示X的期望。若变量有密度 <math>f_X</math>,求和改成积分: <math display="block">\mathbb E[X]=\int_{-\infty}^{\infty}x f_X(x)\,dx,\qquad\int_{-\infty}^{\infty}|x|f_X(x)\,dx<\infty.</math> 这些条件保证正负贡献可以相加,而不是让两个无穷量形式抵消。期望与X有相同单位;把米改成厘米,X变成100X,期望也乘100。重复试验得到的样本平均是实际数据的平均,期望则由分布确定,短期内两者未必相等。 == 线性性不要求独立 == 对具有有限期望的 <math>X,Y</math> 及常数 <math>a,b</math>,有 <math display="block">\mathbb E[aX+bY]=a\mathbb E[X]+b\mathbb E[Y].</math> 不论两个骰子是否独立,只要它们各自都是公平骰子,两者点数和的期望都是 7。相关性会改变和的分布及波动大小,却不影响这条线性规则。 乘法不同:一般不能写成 <math>\mathbb E[XY]=\mathbb E[X]\mathbb E[Y]</math>。例如令 <math>Y=X</math> 为同一枚公平骰子的点数,则 <math>\mathbb E[X^2]=(1+4+9+16+25+36)/6=91/6</math>,而 <math>(\mathbb E[X])^2=49/4</math>,二者不相等。独立且可积是保证乘积期望分解的一组充分条件。 === 为什么不需要独立 === 假设 X、Y 的联合取值为 <math>(x_i,y_j)</math>,联合概率记为 <math>p_{ij}</math>。把所有可能的成对结果列出来,则 <math display="block">\mathbb E[aX+bY]=\sum_{i,j}(ax_i+by_j)p_{ij}.</math> 把有限和拆开为 <math display="block">a\sum_i x_i\left(\sum_jp_{ij}\right)+b\sum_jy_j\left(\sum_ip_{ij}\right).</math> 先对j求和的 <math>\sum_jp_{ij}</math> 正是 <math>P(X=x_i)</math>;先对 i 求和的 <math>\sum_ip_{ij}</math> 正是 <math>P(Y=y_j)</math>。因此结果等于 <math>a\mathbb E[X]+b\mathbb E[Y]</math>。证明没有把 <math>p_{ij}</math> 写成边缘概率的乘积,所以没有使用独立性。无穷求和或积分中,绝对可积条件负责保证相应拆分合法。 == 指示变量把计数变简单 == 事件 <math>A</math> 的指示变量 <math>\mathbf1_A</math> 在事件发生时为 1,否则为 0,因此 <math>\mathbb E[\mathbf1_A]=P(A)</math>。 把一副充分洗匀的 52 张标准扑克牌抽出 5 张。把四张A编号1至4,分别定义是否抽到它的0–1变量。每张牌在洗牌后的52个位置等可能出现,抽前5张就是占5个位置,所以每张A被抽到的概率是 <math>5/52</math>,因此抽到的 A 的张数 <math>N</math> 满足 <math display="block">\mathbb E[N]=4\cdot\frac5{52}=\frac5{13}.</math> 这些指示变量并不独立,但线性性仍然成立。无需先列出抽到 0、1、2、3、4 张 A 的全部概率,就能求得期望。 === 随机分帽子时有多少人拿对 === 有 n 个人,每人一顶带姓名的帽子,把 n 顶帽子等可能地随机分配,每人得到一顶。令 <math>I_i</math> 表示第 i 人是否拿回自己的帽子,拿回人数为 <math>N=I_1+\cdots+I_n</math>。对任何固定的人,其帽子在 n 个位置中等可能,所以 <math>\mathbb E[I_i]=1/n</math>,进而 <math>\mathbb E[N]=1</math>。 无论 n 是 3 还是 100,这个期望都为 1。这没有说总会恰好一人拿对,也没有说不同人的“拿对”独立。n=2 时只有“都拿对”和“都拿错”两种等可能情况,拿对人数只可能为 2 或 0,均值却仍是 1。这个算例同时展示了指示变量、线性性以及“期望不必能实际取到”三个事实。 若试图先求所有 <math>P(N=k)</math>,需要处理错排计数;而目标只有均值时,这些完整分布信息并非必要。选择适合问题的表示,有时比先获得全部概率更有效。关于离散期望的标准规则,可参考 [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class04-prep-b_pdf/ MIT 18.05 第 4b 讲]。 == 同样的平均值,不同的波动 == 恒等于 0 的变量与各以一半概率取 ±10 的变量,期望都为 0,但后者的波动大得多。二阶矩有限时,方差 <math display="block">\operatorname{Var}(X)=\mathbb E[(X-\mathbb E[X])^2]=\mathbb E[X^2]-(\mathbb E[X])^2</math> 分别是 0 与 100。期望的单位与变量相同,方差的单位则是变量单位的平方。 一般也有 <math>\mathbb E[g(X)]\ne g(\mathbb E[X])</math>,所以上例不能把“平均点数的平方”当作“平方点数的平均”。 === 两枚公平骰子,三种不同的合计波动 === 对于二阶矩有限的随机变量,记 <math>\mu_X=\mathbb EX,\mu_Y=\mathbb EY</math>。和的偏差是 <math>(X-\mu_X)+(Y-\mu_Y)</math>;平方后有两个平方项和交叉项 <math>2(X-\mu_X)(Y-\mu_Y)</math>,再取期望得到 <math display="block">\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y),</math> 其中协方差 <math>\operatorname{Cov}(X,Y)=\mathbb E[(X-\mathbb E X)(Y-\mathbb E Y)]</math> 记录两者偏离均值时是否倾向同向变化。均值相加无需独立,但方差能否直接相加取决于交叉项是否为零。独立是保证协方差为零的充分条件;它不是唯一可能的原因。 回到公平骰子,由前面 <math>\mathbb E[X^2]=(1+4+9+16+25+36)/6=91/6</math> 与 <math>\mathbb E[X]=7/2</math>,方差为 <math>91/6-49/4=35/12</math>。若另一枚独立公平骰子的点数为 Y,两者之和方差为 <math>35/6</math>。若直接复制同一读数,令 <math>Y=X</math>,则和为2X,方差变成 <math>35/3</math>;若人为令 <math>Y=7-X</math>,两者之和恒为7,方差变成零。这三种情况下,每个变量的边缘分布都仍然公平,和的期望也均为7,但联合结构让波动完全不同。 == 连续例子:均匀分布的中心和离散程度 == 设 X 在 <math>[0,2]</math> 上均匀分布,密度为 <math>1/2</math>。逐步积分得 <math display="block">\mathbb E[X]=\frac12\int_0^2x\,dx=1,\qquad \mathbb E[X^2]=\frac12\int_0^2x^2\,dx=\frac43.</math> 所以方差为 <math>4/3-1^2=1/3</math>,标准差为 <math>1/\sqrt3</math>。把该区间平移到 <math>[10,12]</math>,均值变为 11,方差不变;把所有长度放大两倍,均值放大两倍而方差放大四倍。这些变化可直接由期望的线性性与方差定义推导,不是不同分布需要重新记忆的孤立公式。 方差恒等式来自展开:令 <math>\mu=\mathbb E[X]</math>,则 <math>(X-\mu)^2=X^2-2\mu X+\mu^2</math>,取期望并使用 <math>\mathbb E[X]=\mu</math>,即可得到 <math>\mathbb E[X^2]-\mu^2</math>。这一推导要求二阶矩有限;不能对发散的积分作形式抵消。 == 分组平均再平均:全期望公式 == 假设教学工厂由甲、乙两条线生产,产量比例为 60% 与 40%;一件产品的加工时间在甲线平均为 5 分钟,在乙线平均为 8 分钟。随机抽取总产量中的一件,其平均加工时间是 <math>0.6\times5+0.4\times8=6.2</math> 分钟,而不是两条线均值的等权平均 6.5 分钟。 一般地,互斥且完备的有限分组 <math>B_j</math> 满足 <math>P(B_j)>0</math>,对可积的 X 有 <math display="block">\mathbb E[X]=\sum_jP(B_j)\mathbb E[X\mid B_j].</math> 离散情况下,可把 <math>\sum_xxP(X=x)</math> 中的概率按全概率公式展开,再交换求和,得到上式。这里 <math>\mathbb E[X\mid B_j]</math> 指只在第j组内、按该组条件概率计算的平均值。 这条公式既用于计算,也用于排查总体构成变化。若两条线的组内均值不变而产量比例改变,总体均值仍会改变。把总体平均的变化完全归因于“每条线都变快了”,就忽略了混合权重。 == 为什么平方损失选择均值 == 用一个常数 c 预测 X,并以平方误差评价预测。若二阶矩有限,将 <math>X-c=(X-\mu)+(\mu-c)</math> 展开后取期望,交叉项因 <math>\mathbb E[X-\mu]=0</math> 消失,得到 <math display="block">\mathbb E[(X-c)^2]=\operatorname{Var}(X)+(c-\mu)^2.</math> 第一项不随 c 变,第二项在 <math>c=\mu</math> 时最小。因此均值是在平方损失意义下的最优常数预测。这个结论连接[[最小二乘法]],也说明“均值最佳”必须说明损失函数;若评价标准改为绝对误差,中位数才承担相应角色。 例如 X 以 90% 概率取 0、以 10% 概率取 10,均值为 1。预测 1 的平方风险为 <math>0.9(1)^2+0.1(9)^2=9</math>,预测 0 的平方风险为 10。但绝对误差下预测 0 的风险为 1,预测 1 的风险为 1.8。不同的最优性结论没有矛盾,它们回答的是不同的问题。 == 尾部概率也能决定期望 == 非负整数值变量 X 可以逐点写成 <math>X=\sum_{k=1}^{\infty}\mathbf1_{\{X\ge k\}}</math>:如果实际取值为3,恰有前三个指示变量为1。先只加前m项,得到 <math>\min(X,m)</math>;随着m增加,它单调趋于X。非负积分的单调收敛性质允许对这一极限取期望,得到尾和公式 <math display="block">\mathbb E[X]=\sum_{k=1}^{\infty}P(X\ge k),</math> 两边允许同为正无穷。这里交换期望与无穷求和依靠非负性,不能直接推广到任意正负交错级数。 例如不断进行独立试验,单次成功概率为 <math>0<p\le1</math>,令 X 为第一次成功所需的试验次数。事件 <math>X\ge k</math> 意味着前 <math>k-1</math> 次都失败,所以其概率为 <math>(1-p)^{k-1}</math>。对等比级数求和便得 <math>\mathbb E[X]=1/p</math>。若成功率为四分之一,平均需要4次,但这不意味着第四次一定成功,也不意味着前3次失败后下一次机会比原来更大。 == 期望并不总是有限 == 令 <math>P(X=2^n)=2^{-n}</math>,<math>n=1,2,\ldots</math>。这些概率之和为 1,但 <math display="block">\mathbb E[X]=\sum_{n=1}^{\infty}2^n2^{-n}=+\infty.</math> 非负随机变量可以有无穷期望。对更一般的有正有负变量,正负部分都无限时,期望可能根本无定义,不能写成“无穷减无穷等于零”。 == 对称性为什么不能消掉两个无穷大 == 标准柯西分布的密度为 <math>f(x)=1/[\pi(1+x^2)]</math>,关于零对称。但正半轴上的一阶贡献为 <math display="block">\int_0^R\frac{x}{\pi(1+x^2)}\,dx=\frac1{2\pi}\log(1+R^2),</math> 随 R 增大而趋于无穷;负半轴的负部分绝对贡献也无穷。因此通常意义下期望无定义,不能说“对称所以均值为零”。对称截断的主值是零,属于另一个概念。 == 从均值获得概率上界,但不能还原整个分布 == 若 X 非负且期望有限,对任意 <math>a>0</math>,事件 <math>X\ge a</math> 上总有 <math>X\ge a</math>,其他位置至少为零。因此逐点不等式 <math>X\ge a\mathbf1_{\{X\ge a\}}</math> 取期望后给出 <math>P(X\ge a)\le\mathbb E[X]/a</math>,称为马尔可夫不等式。证明只用非负性与期望的单调性,不需要独立性或特定分布。 例如一个非负教学变量的均值为2,那么其达到或超过10的概率至多为五分之一。这是上界,不是说概率必定为五分之一:变量恒为2时该概率为零;以五分之一概率取10、其余取零时则达到上界。只知道均值,仍然允许非常不同的分布,因而无法精确恢复尾部概率。 将这个不等式用于平方偏差,就得到概率词条中使用的方差型界。取 <math>X=(Y-\mathbb E Y)^2</math>、阈值为 <math>\varepsilon^2</math>,就得到 <math>P(|Y-\mathbb E Y|\ge\varepsilon)\le\operatorname{Var}(Y)/\varepsilon^2</math>,即切比雪夫不等式。 == 公平价值的历史与现代积分 == Huygens 在 1657 年的概率著作中研究公平机会的价值,这为期望思想提供了早期的重要背景,见 [https://mathshistory.st-andrews.ac.uk/Biographies/Huygens/ MacTutor 的 Huygens 传记]。这种公平价值以各结果的机会作为权重,是概率加权平均的重要早期用途。 随着连续概率和测度论的发展,期望统一写为 <math>\mathbb E[X]=\int_\Omega X\,dP</math>。这个写法以概率测度为积分的权重,离散求和与有密度时的积分只是其特例。20 世纪概率公理化的背景可参见 [https://mathshistory.st-andrews.ac.uk/Biographies/Kolmogorov/ Kolmogorov 传记];本条给出的均值、方差和有限分组公式则在一般理论之前已经可以通过有限求和理解。 == 参考来源与延伸阅读 == * [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/resources/mit18_05_s22_class06-prep-a_pdf/ MIT 18.05 第 6a 讲:连续随机变量的期望、方差与标准差]。 * [[最小二乘法]] · [[统计推断]]:平方损失与样本均值的后续用途。 * [https://ocw.mit.edu/courses/18-05-introduction-to-probability-and-statistics-spring-2022/pages/classes-reading-and-in-class-materials/ MIT OpenCourseWare,18.05 阅读材料]:期望、方差与连续随机变量。 * [[概率]] · [[积分]] · [[数学建模]] [[分类:概率与统计]]
返回
期望
。