跳到正文
格致开物MATHWIKI

统计推断

AIContentBot留言 | 贡献2026年9月20日 (日) 07:18的版本 (重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

统计推断(statistical inference)从有限样本出发,借助概率模型研究总体的未知性质。估计一个参数、给出不确定性区间、检验某个假设,都是统计推断的问题。

十次投掷,九次正面,能知道什么

预先决定投掷一枚硬币十次,结果九次正面。样本正面比例是0.9,但硬币真正的正面概率未必恰好是0.9。我们希望回答两个问题:哪个成功概率最能解释这组结果?如果硬币公平,出现如此偏向一侧的结果有多大机会?前一个问题是估计,后一个问题引出检验。

先明确模型:十次投掷相互独立,正面概率共同为 p,且在试验中不变。用 Xi 记录第i次结果,正面为1、反面为0;总正面数记为 K=iXi。真实的 p 固定但未知,K会随重新试验而变化。本次观察值为 K=9

从数据计算的函数叫统计量。例如 p̂=K/10 是估计量,本次代入得到的0.9是估计值。区分“计算规则”与“这一次算出的数”,才能讨论同一规则在反复抽样中表现如何。

哪个参数使已观察结果最可能

设每次试验只有成功与失败,成功记一,失败记零,独立且共同成功概率为 p。观察 n 次,其中 k 次成功。给定具体的零一序列,其似然为 L(p)=pk(1p)nk,0p1. 若只记录成功总数,似然多一个组合系数 (nk),它不依赖 p,所以最大化位置相同。似然把数据固定、把参数作为自变量;它与“给定数据后 p 的概率分布”不是同一个对象,不能不加先验与归一化就当作后验。

对 0<k<n,取对数得到 (p)=klogp+(nk)log(1p)。导数为 (p)=kpnk1p=knpp(1p). 它在 p<k/n 时为正、p>k/n 时为负,因此最大似然估计为 p̂=k/n。若 k=0,似然随 p 递减,最大值在边界 p=0;若 k=n,最大值在 p=1。此时最大值在边界取得。

开头的九次正面给出 p̂=9/10=0.9:在所列模型内,它使这组数据的似然最大。由 p̂=1niXi,每个0–1变量的期望为p、方差为 p(1p)。因此 𝔼p̂=(np)/n=p,称为无偏;独立性使方差相加,再除以 n2,得到 Var(p̂)=p(1p)/n。即使估计量无偏,每次估计仍会围绕真值波动。

误差、偏差与均方误差

估计误差既包含平均意义上的系统偏离,也包含抽样波动。定义偏差为 Bias(T)=𝔼(T)θ。这里T表示任意估计量,θ表示它要估计的固定参数。二阶矩存在时,写 Tθ=(T𝔼T)+(𝔼Tθ)。展开平方,交叉项的期望是 2(𝔼Tθ)𝔼(T𝔼T)=0,于是 𝔼[(Tθ)2]=Var(T)+Bias(T)2. 这说明总的平均平方误差可以通过偏差与方差之间的权衡改变。一个有少量偏差却显著降低方差的方法,有时会比高方差无偏方法预测更好;比较时必须明确目标参数、损失函数和适用范围。


公平硬币会多常出现这么偏的结果

回到十次投掷、九次正面的结果。取原假设 H0:p=1/2,备择为 p1/2,并用 |K5| 衡量偏离程度。观察到的偏离是 |95|=4,至少同样极端的结果便是K=0、1、9、10。公平模型中,任何一条十次正反面序列概率都是 210;恰有k次正面可从十个位置选k个,故有 (10k) 条序列。因此本例双侧p值为 (100)+(101)+(109)+(1010)210=2210240.02148. 这表示在原假设以及独立、固定样本量等条件成立时,得到预先规定的统计量至少如此极端的概率。它不是原假设为真的概率,也不是结果由“偶然”造成的概率。离散分布的双侧极端性还可以有其他定义,因此必须说明此处采用什么检验。

若事先规定显著性水平 0.05,这次结果进入相应拒绝域;但拒绝原假设并不说明硬币偏差具有多大的实际影响。应同时报告估计值、区间、样本量和试验设计。不拒绝也不等于证明硬币完全公平,可能只是数据还不足以区分很小的偏差。

显著性水平控制的是在原假设成立时使用该检验规则误拒绝的概率,实际离散检验可能小于名义水平。第二类错误是备择情形下没有拒绝,检验功效为其补概率,并且依赖具体备择参数。以下分别计算这两种概率。

检验功效也可以直接计算

仍用十次投掷的双侧检验,显著性水平取0.05。按照已经规定的极端性统计量,拒绝域是 K{0,1,9,10};在原假设下,其真实一类错误概率为 22/1024,小于名义水平0.05。若把K=2与8也纳入,原假设下的概率会增为 112/10240.1094,超过0.05。因此这个对称的非随机化规则只能取较小的实际错误率。

若硬币真正的成功概率为0.8,检验功效是该备择下落入同一拒绝域的概率: k{0,1,9,10}(10k)(0.8)k(0.2)10k0.3758. 也就是说,即使存在相当明显的偏离,十次试验仍有约62.4%的机会没有拒绝原假设。同一个拒绝域,在公平分布下计算得到误拒绝率,在p=0.8分布下计算得到功效。十次投掷的信息有限,漏掉偏差的机会仍相当大。

下图两侧使用同一纵轴尺度和同一拒绝域。金色柱对应 K=0,1,9,10,左图将它们相加得到真实一类错误概率,右图相加得到功效。右图虽然明显偏向较多正面,最高的柱仍在8,尚未进入本次检验的拒绝域。

十次投掷的正面数二项分布,左图成功概率一半右图零点八,零一九十四个拒绝域结果用金色标出,两图其概率总和分别零点零二一四八和零点三七五八一
改变真实参数会改变概率分布;预先规定的判定规则保持相同。

改变真实概率,保留同一检验规则

下图画出 KBin(n,p) 的完整理论分布,没有随机抽样误差。先取 n=10,p=0.5,读出拒绝域的总概率;再只把 p 改成 0.8,拒绝域仍按公平硬币的假设确定,但落入它的概率变了。点击某一根柱,比较“当前模型下恰好出现这个次数的概率”与“公平假设下至少同样极端的概率”。它们回答的是两个不同的问题。

样本量、概率与检验

改变试验次数和成功概率,观察二项分布;比较同一拒绝规则下的误拒绝率与功效。

静态配图与完整推导见本节正文;交互演示需浏览器启用 JavaScript。

把检验反过来,便得到一族置信集合

对每一个候选参数 θ0,如果都有一项一类错误率不超过 α 的检验,就可以把“不会被当前数据拒绝”的所有候选值收集起来。设所得集合为 C(X),则真实参数被排除的事件,恰好等于以真实参数为原假设时被错误拒绝的事件,因此 Pθ(θC(X))1α

这一论证给出了检验与置信集合之间的联系,也解释了覆盖率为何属于构造程序。所得集合不一定总是一个简单区间;离散模型还可能产生超过名义值的覆盖率。不同的双侧极端性定义,对应的反演区间也可能不同。

最简单的正态近似比例区间也有边界风险。把标准误差估为 p̂(1p̂)/n,在观察成功次数为零时会给出零宽度区间。但真实成功率为正时,有限次试验仍可能恰好全失败。因此边界或小样本需要改用二项检验反演等具有明确覆盖性质的方法。

一个可算出端点的区间:正态总体的均值

对于连续测量值,可用另一组完整例子计算区间端点。设独立样本 XiN(μ,σ2),这里N表示正态分布,μ是未知均值,σ是已知总体标准差;样本均值记作 X¯=(X1++Xn)/n。则 X¯N(μ,σ2/n),从标准正态分布的中心约 95% 区间得 Pμ(1.96X¯μσ/n1.96)0.95.c=1.96σ/n,括号内的条件等价于 cX¯μc。左边不等式给 μX¯+c,右边给 μX¯c,因此区间为 [X¯1.96σ/n,X¯+1.96σ/n]。若 n=25,已知 σ=2,观察到均值为 10,区间是 [9.216,10.784]。区间半宽 0.784 来自 1.96×2/5,没有额外拟合步骤。

覆盖率的意思是:在同样的模型和抽样设计下反复抽样、用同样规则造区间,约 95% 的区间会覆盖固定真值 μ。观察这一次数据后,μ 与端点都已固定,不能仅凭频率学派构造就解释为“μ 有 95% 概率落在本区间”。若要给参数这样的条件概率解释,需要另建贝叶斯模型,说明先验与后验。

σ 未知时,把样本标准差直接代入而仍声称小样本下精确正态覆盖率是不对的;在独立正态样本条件下应使用相应 t 分布分位数。对非正态样本,大样本近似需要额外条件与足够的近似质量。

同一数据下,预测区间为何更宽

在已知总体标准差的独立正态模型中,令 Xnew 表示一个与已有样本独立的未来观测。差 XnewX¯ 的均值为零,方差为 σ2(1+1/n),因为新观测与样本均值独立,差的方差为两方差之和:σ2+σ2/n。因此约95%的预测区间为 X¯±1.96σ1+1/n. 沿用 n=25,σ=2,X¯=10 的例子,预测区间半宽约为3.998,远大于均值置信区间的0.784。二者没有矛盾:增加样本可以把均值估计得更精确,却不会把新个体本身的随机波动消除。这个预测区间的频率保证也针对已有样本与未来观测的联合重复过程。


精度目标与样本规模

在已知 σ 的正态均值模型中,同一置信水平的区间半宽与 1/n 成正比。若要将半宽减半,需要四倍样本量,而不是两倍。这一规划结论依赖独立同分布和稳定 σ,不能不加检查地套到高度相关观测。

在同一正态模型中,提高置信水平会使用更大的分位数,从而扩大区间。例如把约95%的1.96换成约99%的2.576,同样数据的半宽从0.784扩大为1.0304。更窄区间与更高覆盖率若要同时实现,需要增加样本量。

多次检验怎样控制总体错误率

若同时检验许多互不相关的假设,每个都用 0.05 阈值,即使全部原假设为真,也可能出现若干“小 p 值”。假设二十次检验相互独立且每次一类错误率恰为 0.05,至少一次误拒绝的概率为 10.95200.6415。现实中检验往往相关,不能直接套用这个数,但选择过程必须进入解释。

如果预先有 m 个检验,并让每个真原假设被误拒绝的概率至多为 α/m,由并集上界,至少一次误拒绝的概率就不超过 α。这称为Bonferroni控制,其证明不需要各检验独立,因而与直接使用 1(1α)m 的独立情形不同。

例如总错误率目标为0.05、预先安排20次检验时,每次使用0.0025的阈值即可得到这一保证。阈值变严格也会降低检测某些真实差异的功效。若看到结果后再挑选要报告的检验,或不断追加样本直到显著,所使用的规则已改变,原先固定检验的错误率计算不再直接适用。

历史与学派关系

Fisher 在二十世纪二十年代推进似然、估计及实验分析,Neyman 与 Egon Pearson 在二十世纪三十年代研究检验理论,Neyman 的区间估计工作则明确了覆盖率框架。相关年代与著作可见 FisherNeyman的大学数学史传记。

贝叶斯方法使用贝叶斯定理,把先验与数据似然结合为后验;频率方法通过重复抽样性质评价程序。它们有时给出相近数值,但语义与前提仍应分别交代。贝叶斯区间用后验概率解释,频率区间用重复抽样的覆盖率解释。

参考来源与延伸阅读