跳到正文
格致开物MATHWIKI

统计推断:修订间差异

AIContentBot留言 | 贡献
扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航
 
AIContentBot留言 | 贡献
重编数学讲解:连贯例题、逐步推导与多幅过程图;更新写作规范
 
第1行: 第1行:
'''统计推断'''(statistical inference)利用有限样本和明确的概率模型,研究总体性质、未知参数或未来观测。它包括参数估计、区间估计、假设检验和预测。结论的不确定性来自抽样变化、测量误差与模型假设;一个精确的小数并不意味着关于现实的结论已经确定。
'''统计推断'''(statistical inference)从有限样本出发,借助概率模型研究总体的未知性质。估计一个参数、给出不确定性区间、检验某个假设,都是统计推断的问题。


== 十次投掷,九次正面,能知道什么 ==
预先决定投掷一枚硬币十次,结果九次正面。样本正面比例是0.9,但硬币真正的正面概率未必恰好是0.9。我们希望回答两个问题:哪个成功概率最能解释这组结果?如果硬币公平,出现如此偏向一侧的结果有多大机会?前一个问题是估计,后一个问题引出检验。


== English overview ==
先明确模型:十次投掷相互独立,正面概率共同为 <math>p</math>,且在试验中不变。用 <math>X_i</math> 记录第i次结果,正面为1、反面为0;总正面数记为 <math>K=\sum_iX_i</math>。真实的 <math>p</math> 固定但未知,K会随重新试验而变化。本次观察值为 <math>K=9</math>
<div lang="en" class="math-english-summary">
Statistical inference uses observed data and an explicit probability model to learn about unknown quantities. A parameter describes a population or data-generating model; a statistic is a function of the sample. Before observing data, an estimator varies across possible samples. Its sampling distribution connects a calculation from one sample to statements about uncertainty.


This article develops estimation and testing through Bernoulli observations and a normal-mean example. We derive the maximum-likelihood estimate of a success probability, compute its expectation and variance, and distinguish an estimator from its realized value. A confidence interval is explained through the repeated-sampling coverage of its construction, not as an automatic posterior probability for a fixed parameter. An exact binomial test illustrates how a p-value depends on a specified null model and definition of extremeness. Bayesian inference answers a related but different conditional-probability question by including a prior distribution. The discussion also covers selection bias, multiple testing, practical significance, and prediction. Historical notes identify contributions to likelihood, testing, and confidence intervals without treating modern inference as a single invention. Every conclusion remains conditional on the sampling design and assumptions used to connect the observed sample to the target population.
从数据计算的函数叫统计量。例如 <math>\hat p=K/10</math> 是估计量,本次代入得到的0.9是估计值。区分“计算规则”与“这一次算出的数”,才能讨论同一规则在反复抽样中表现如何。
</div>


== 从样本到总体,缺少哪一步 ==
== 哪个参数使已观察结果最可能 ==
抽查一百件产品,发现八件不合格,样本不合格比例是 0.08。这是对已观察数据的描述;若要估计整批产品的不合格概率,必须说明抽样方式、批次是否稳定,以及观察之间是否可以视为独立。如果只挑外观可疑的产品来检验,这个比例不能直接代表全部产品。统计推断补上的正是“数据怎样产生,因此能支持什么结论”这一层联系。
 
本条先采用独立同分布样本 <math>X_1,\ldots,X_n</math>。独立表示联合概率按相应方式分解,同分布表示各次观测使用相同分布,并不意味着数值相同。参数如成功概率 p 或总体均值 μ,在频率学派模型中是固定但未知的;样本则在重复抽样中变化。统计量不能包含未知参数,例如样本均值 <math>\bar X</math> 是统计量,表达式 <math>\bar X-\mu</math> 本身则含有未知 μ。
 
“估计量”指样本的函数,“估计值”指把实际数据代入所得的数。样本均值作为估计量会有分布、[[期望]]和方差;观察之后得到的 10.2 是一个已经计算出的估计值。分清这两层,才能理解置信区间为什么讨论一种重复使用的程序,而不只是当前区间的外观。
 
== 完整算例一:成功概率的最大似然估计 ==
设每次试验只有成功与失败,成功记一,失败记零,独立且共同成功概率为 p。观察 n 次,其中 k 次成功。给定具体的零一序列,其似然为
设每次试验只有成功与失败,成功记一,失败记零,独立且共同成功概率为 p。观察 n 次,其中 k 次成功。给定具体的零一序列,其似然为
<math display="block">L(p)=p^k(1-p)^{n-k},\qquad 0\le p\le1.</math>
<math display="block">L(p)=p^k(1-p)^{n-k},\qquad 0\le p\le1.</math>
第23行: 第15行:
对 0<k<n,取对数得到 <math>\ell(p)=k\log p+(n-k)\log(1-p)</math>。导数为
对 0<k<n,取对数得到 <math>\ell(p)=k\log p+(n-k)\log(1-p)</math>。导数为
<math display="block">\ell'(p)=\frac{k}{p}-\frac{n-k}{1-p}=\frac{k-np}{p(1-p)}.</math>
<math display="block">\ell'(p)=\frac{k}{p}-\frac{n-k}{1-p}=\frac{k-np}{p(1-p)}.</math>
它在 p<k/n 时为正、p>k/n 时为负,因此最大似然估计为 <math>\hat p=k/n</math>。若 k=0,似然随 p 递减,最大值在边界 p=0;若 k=n,最大值在 p=1。这两种情况不能直接忽略边界后只解内部导数方程。
它在 p<k/n 时为正、p>k/n 时为负,因此最大似然估计为 <math>\hat p=k/n</math>。若 k=0,似然随 p 递减,最大值在边界 p=0;若 k=n,最大值在 p=1。此时最大值在边界取得。


例如十次试验七次成功,估计值为 0.7。它不是说参数恰好等于 0.7 已被证明,也不保证下一批十次必有七次成功。由 <math>\hat p=\frac1n\sum_iX_i</math>,线性期望给出 <math>\mathbb E\hat p=p</math>,独立性给出 <math>\operatorname{Var}(\hat p)=p(1-p)/n</math>。这分别说明无偏性与抽样波动规模;它们是重复抽样性质,不是每一次估计都接近真值的保证。
开头的九次正面给出 <math>\hat p=9/10=0.9</math>:在所列模型内,它使这组数据的似然最大。由 <math>\hat p=\frac1n\sum_iX_i</math>,每个0–1变量的期望为p、方差为 <math>p(1-p)</math>。因此 <math>\mathbb E\hat p=(np)/n=p</math>,称为无偏;独立性使方差相加,再除以 <math>n^2</math>,得到 <math>\operatorname{Var}(\hat p)=p(1-p)/n</math>。即使估计量无偏,每次估计仍会围绕真值波动。


== 误差、偏差与均方误差 ==
== 误差、偏差与均方误差 ==
一个估计量是否有用,不能只看是否无偏。定义偏差为 <math>\operatorname{Bias}(T)=\mathbb E(T)-\theta</math>。若二阶矩存在,把 T−θ 拆成 T−E(T) E(T)−θ,展开平方并取期望,交叉项为零,得到
估计误差既包含平均意义上的系统偏离,也包含抽样波动。定义偏差为 <math>\operatorname{Bias}(T)=\mathbb E(T)-\theta</math>。这里T表示任意估计量,θ表示它要估计的固定参数。二阶矩存在时,写 <math>T-\theta=(T-\mathbb ET)+(\mathbb ET-\theta)</math>。展开平方,交叉项的期望是 <math>2(\mathbb ET-\theta)\mathbb E(T-\mathbb ET)=0</math>,于是
<math display="block">\mathbb E[(T-\theta)^2]=\operatorname{Var}(T)+\operatorname{Bias}(T)^2.</math>
<math display="block">\mathbb E[(T-\theta)^2]=\operatorname{Var}(T)+\operatorname{Bias}(T)^2.</math>
这说明总的平均平方误差可以通过偏差与方差之间的权衡改变。一个有少量偏差却显著降低方差的方法,有时会比高方差无偏方法预测更好;比较时必须明确目标参数、损失函数和适用范围。
这说明总的平均平方误差可以通过偏差与方差之间的权衡改变。一个有少量偏差却显著降低方差的方法,有时会比高方差无偏方法预测更好;比较时必须明确目标参数、损失函数和适用范围。


参数估计误差也不同于未来观测误差。即使已经很精确地知道总体均值,下一次观测仍可能因为个体差异波动很大。用于均值的区间通常比用于单个未来观测的预测区间窄。把均值置信区间误当作“约九成五的个体都落在里面”,会严重低估个体变化。
== 完整算例二:正态均值的置信区间 ==
设样本独立且 <math>X_i\sim N(\mu,\sigma^2)</math>,总体标准差 σ 已知。则 <math>\bar X\sim N(\mu,\sigma^2/n)</math>,从标准正态分布的中心约 95% 区间得
<math display="block">P_\mu\left(-1.96\le\frac{\bar X-\mu}{\sigma/\sqrt n}\le1.96\right)\approx0.95.</math>
把不等式对 μ 整理,便得到随机区间 <math>[\bar X-1.96\sigma/\sqrt n,\bar X+1.96\sigma/\sqrt n]</math>。若 n=25,已知 σ=2,观察到均值为 10,区间是 [9.216,10.784]。区间半宽 0.784 来自 <math>1.96\times2/5</math>,没有额外拟合步骤。
覆盖率的意思是:在同样的模型和抽样设计下反复抽样、用同样规则造区间,约 95% 的区间会覆盖固定真值 μ。观察这一次数据后,μ 与端点都已固定,不能仅凭频率学派构造就解释为“μ 有 95% 概率落在本区间”。若要给参数这样的条件概率解释,需要另建贝叶斯模型,说明先验与后验。
σ 未知时,把样本标准差直接代入而仍声称小样本下精确正态覆盖率是不对的;在独立正态样本条件下应使用相应 t 分布分位数。对非正态样本,大样本近似需要额外条件与足够的近似质量。自助法也不是不问数据依赖结构的通用修复,时间相关数据不能随意当作独立观测重抽。


== 完整算例三:精确二项检验 ==
== 公平硬币会多常出现这么偏的结果 ==
检验硬币成功概率是否为 1/2,预先固定进行十次独立投掷,观察到九次成功。取原假设 <math>H_0:p=1/2</math>,备择为 <math>p\ne1/2</math>,并用 <math>|K-5|</math> 衡量偏离程度。至少同样极端的结果是 K=0、1、9、10。因此本例双侧 p 值为
回到十次投掷、九次正面的结果。取原假设 <math>H_0:p=1/2</math>,备择为 <math>p\ne1/2</math>,并用 <math>|K-5|</math> 衡量偏离程度。观察到的偏离是 <math>|9-5|=4</math>,至少同样极端的结果便是K=0、1、9、10。公平模型中,任何一条十次正反面序列概率都是 <math>2^{-10}</math>;恰有k次正面可从十个位置选k个,故有 <math>\binom{10}k</math> 条序列。因此本例双侧p值为
<math display="block">\frac{\binom{10}0+\binom{10}1+\binom{10}9+\binom{10}{10}}{2^{10}}=\frac{22}{1024}\approx0.02148.</math>
<math display="block">\frac{\binom{10}0+\binom{10}1+\binom{10}9+\binom{10}{10}}{2^{10}}=\frac{22}{1024}\approx0.02148.</math>
这表示在原假设以及独立、固定样本量等条件成立时,得到预先规定的统计量至少如此极端的概率。它不是原假设为真的概率,也不是结果由“偶然”造成的概率。离散分布的双侧极端性还可以有其他定义,因此必须说明此处采用什么检验。
这表示在原假设以及独立、固定样本量等条件成立时,得到预先规定的统计量至少如此极端的概率。它不是原假设为真的概率,也不是结果由“偶然”造成的概率。离散分布的双侧极端性还可以有其他定义,因此必须说明此处采用什么检验。
第50行: 第32行:
若事先规定显著性水平 0.05,这次结果进入相应拒绝域;但拒绝原假设并不说明硬币偏差具有多大的实际影响。应同时报告估计值、区间、样本量和试验设计。不拒绝也不等于证明硬币完全公平,可能只是数据还不足以区分很小的偏差。
若事先规定显著性水平 0.05,这次结果进入相应拒绝域;但拒绝原假设并不说明硬币偏差具有多大的实际影响。应同时报告估计值、区间、样本量和试验设计。不拒绝也不等于证明硬币完全公平,可能只是数据还不足以区分很小的偏差。


显著性水平控制的是在原假设成立时使用该检验规则误拒绝的概率,实际离散检验可能小于名义水平。第二类错误是备择情形下没有拒绝,检验功效为其补概率,并且依赖具体备择参数。不能把一个固定的 5% 当作所有错误的统一概率。
显著性水平控制的是在原假设成立时使用该检验规则误拒绝的概率,实际离散检验可能小于名义水平。第二类错误是备择情形下没有拒绝,检验功效为其补概率,并且依赖具体备择参数。以下分别计算这两种概率。
 
== 多重比较、选择过程与现实结论 ==
若同时检验许多互不相关的假设,每个都用 0.05 阈值,即使全部原假设为真,也可能出现若干“小 p 值”。假设二十次检验相互独立且每次一类错误率恰为 0.05,至少一次误拒绝的概率为 <math>1-0.95^{20}\approx0.6415</math>。现实中检验往往相关,不能直接套用这个数,但选择过程必须进入解释。
 
只报告显著结果、看到数据再挑单侧方向,或不断追加样本直到显著,都会改变原来宣称的误差控制。应预先确定核心问题,完整报告分析路径,并使用与设计匹配的方法。更多数据可以降低随机误差,却不自动消除有偏抽样、错误测量、遗漏变量与模型失配。
 
观测到两个变量相关并不等于干预其中一个会改变另一个。随机抽样主要关系到向总体推广,随机分配处理主要关系到处理组之间因果比较,两种随机化目的不同。百科中的教学算例用于说明统计逻辑,不应在缺少实际设计细节时替具体研究作结论。


== 检验功效也可以直接计算 ==
== 检验功效也可以直接计算 ==
仍用十次投掷的双侧检验,显著性水平取0.05。按照已经规定的极端性统计量,拒绝域是 <math>K\in\{0,1,9,10\}</math>;在原假设下,其真实一类错误概率为 <math>22/1024</math>,小于名义水平0.05。这种保守性来自离散分布不能任意切出恰好5%的非随机化拒绝域。
仍用十次投掷的双侧检验,显著性水平取0.05。按照已经规定的极端性统计量,拒绝域是 <math>K\in\{0,1,9,10\}</math>;在原假设下,其真实一类错误概率为 <math>22/1024</math>,小于名义水平0.05。若把K=2与8也纳入,原假设下的概率会增为 <math>112/1024\approx0.1094</math>,超过0.05。因此这个对称的非随机化规则只能取较小的实际错误率。


若硬币真正的成功概率为0.8,检验功效是该备择下落入同一拒绝域的概率:
若硬币真正的成功概率为0.8,检验功效是该备择下落入同一拒绝域的概率:
<math display="block">\sum_{k\in\{0,1,9,10\}}\binom{10}{k}(0.8)^k(0.2)^{10-k}\approx0.3758.</math>
<math display="block">\sum_{k\in\{0,1,9,10\}}\binom{10}{k}(0.8)^k(0.2)^{10-k}\approx0.3758.</math>
也就是说,即使存在相当明显的偏离,十次试验仍有约62.4%的机会没有拒绝原假设。这项计算具体说明了“不显著不等于没有差别”。功效计算改变的是评估拒绝域时使用的真实参数,不能在看到结果后偷偷更换拒绝域。
也就是说,即使存在相当明显的偏离,十次试验仍有约62.4%的机会没有拒绝原假设。同一个拒绝域,在公平分布下计算得到误拒绝率,在p=0.8分布下计算得到功效。十次投掷的信息有限,漏掉偏差的机会仍相当大。
 
下图两侧使用同一纵轴尺度和同一拒绝域。金色柱对应 <math>K=0,1,9,10</math>,左图将它们相加得到真实一类错误概率,右图相加得到功效。右图虽然明显偏向较多正面,最高的柱仍在8,尚未进入本次检验的拒绝域。
 
[[File:Gezhi-analysis-inference-test.svg|frame|center|alt=十次投掷的正面数二项分布,左图成功概率一半右图零点八,零一九十四个拒绝域结果用金色标出,两图其概率总和分别零点零二一四八和零点三七五八一|改变真实参数会改变概率分布;预先规定的判定规则保持相同。]]


== 同一数据下,预测区间为何更宽 ==
=== 改变真实概率,保留同一检验规则 ===
在已知总体标准差的独立正态模型中,令 <math>X_{\rm new}</math> 表示一个与已有样本独立的未来观测。差 <math>X_{\rm new}-\bar X</math> 的均值为零,方差为 <math>\sigma^2(1+1/n)</math>,其中一项来自新个体,一项来自均值估计。因此约95%的预测区间为
下图画出 <math>K\sim\operatorname{Bin}(n,p)</math> 的完整理论分布,没有随机抽样误差。先取 <math>n=10,p=0.5</math>,读出拒绝域的总概率;再只把 <math>p</math> 改成 <math>0.8</math>,拒绝域仍按公平硬币的假设确定,但落入它的概率变了。点击某一根柱,比较“当前模型下恰好出现这个次数的概率”与“公平假设下至少同样极端的概率”。它们回答的是两个不同的问题。
<math display="block">\bar X\pm1.96\sigma\sqrt{1+1/n}.</math>
沿用 <math>n=25,\sigma=2,\bar X=10</math> 的例子,预测区间半宽约为3.998,远大于均值置信区间的0.784。二者没有矛盾:增加样本可以把均值估计得更精确,却不会把新个体本身的随机波动消除。这个预测区间的频率保证也针对已有样本与未来观测的联合重复过程。


如果未来数据来自不同总体,或者存在时间关联,这个方差分解就需要调整。预测时训练数据与未来对象是否同分布,往往比选用更多小数位更重要。
<math-experiment type="binomial" />


== 把检验反过来,便得到一族置信集合 ==
== 把检验反过来,便得到一族置信集合 ==
对每一个候选参数 <math>\theta_0</math>,如果都有一项一类错误率不超过 <math>\alpha</math> 的检验,就可以把“不会被当前数据拒绝”的所有候选值收集起来。设所得集合为 <math>C(X)</math>,则真实参数被排除的事件,恰好等于以真实参数为原假设时被错误拒绝的事件,因此 <math>P_\theta(\theta\in C(X))\ge1-\alpha</math>。
对每一个候选参数 <math>\theta_0</math>,如果都有一项一类错误率不超过 <math>\alpha</math> 的检验,就可以把“不会被当前数据拒绝”的所有候选值收集起来。设所得集合为 <math>C(X)</math>,则真实参数被排除的事件,恰好等于以真实参数为原假设时被错误拒绝的事件,因此 <math>P_\theta(\theta\in C(X))\ge1-\alpha</math>。


这一论证给出了检验与置信集合之间的联系,也解释了覆盖率为何属于构造程序。所得集合不一定总是一个简单区间;离散模型还可能产生超过名义值的覆盖率。若改用不同的双侧极端性定义,反演得到的区间也可能不同,因此不能只说“精确区间”而完全不说明算法。
这一论证给出了检验与置信集合之间的联系,也解释了覆盖率为何属于构造程序。所得集合不一定总是一个简单区间;离散模型还可能产生超过名义值的覆盖率。不同的双侧极端性定义,对应的反演区间也可能不同。
 
最简单的正态近似比例区间也有边界风险。把标准误差估为 <math>\sqrt{\hat p(1-\hat p)/n}</math>,在观察成功次数为零时会给出零宽度区间。但真实成功率为正时,有限次试验仍可能恰好全失败。因此边界或小样本需要改用二项检验反演等具有明确覆盖性质的方法。


最简单的正态近似比例区间也有边界风险。把标准误差估为 <math>\sqrt{\hat p(1-\hat p)/n}</math>,在观察成功次数为零时会给出零宽度区间。这显然不能被解释为有限数据证明总体成功率严格为零。边界或小样本应使用与二项分布相符的检验反演或其他明确说明性质的方法,而不是机械套用大样本公式。
== 一个可算出端点的区间:正态总体的均值 ==
对于连续测量值,可用另一组完整例子计算区间端点。设独立样本 <math>X_i\sim N(\mu,\sigma^2)</math>,这里N表示正态分布,μ是未知均值,σ是已知总体标准差;样本均值记作 <math>\bar X=(X_1+\cdots+X_n)/n</math>。则 <math>\bar X\sim N(\mu,\sigma^2/n)</math>,从标准正态分布的中心约 95% 区间得
<math display="block">P_\mu\left(-1.96\le\frac{\bar X-\mu}{\sigma/\sqrt n}\le1.96\right)\approx0.95.</math>
令 <math>c=1.96\sigma/\sqrt n</math>,括号内的条件等价于 <math>-c\le\bar X-\mu\le c</math>。左边不等式给 <math>\mu\le\bar X+c</math>,右边给 <math>\mu\ge\bar X-c</math>,因此区间为 <math>[\bar X-1.96\sigma/\sqrt n,\bar X+1.96\sigma/\sqrt n]</math>。若 n=25,已知 σ=2,观察到均值为 10,区间是 [9.216,10.784]。区间半宽 0.784 来自 <math>1.96\times2/5</math>,没有额外拟合步骤。


== 多重比较的一个无需独立的保证 ==
覆盖率的意思是:在同样的模型和抽样设计下反复抽样、用同样规则造区间,约 95% 的区间会覆盖固定真值 μ。观察这一次数据后,μ 与端点都已固定,不能仅凭频率学派构造就解释为“μ 有 95% 概率落在本区间”。若要给参数这样的条件概率解释,需要另建贝叶斯模型,说明先验与后验。
如果预先有 m 个检验,并让每个真原假设被误拒绝的概率至多为 <math>\alpha/m</math>,由并集上界,至少一次误拒绝的概率就不超过 <math>\alpha</math>。这称为Bonferroni控制,其证明不需要各检验独立,因而与直接使用 <math>1-(1-\alpha)^m</math> 的独立情形不同。


代价是单项阈值变严格,检测真实差异的功效可能降低。校正方案不是任意选一个更小阈值来显得谨慎,而是在明确要控制“一次或多次误拒绝”的总体风险后,对整个分析设计给出保证。若还在数据中挑选变量、删去异常值或反复查看结果,实际选择范围也应纳入所使用的方法。
σ 未知时,把样本标准差直接代入而仍声称小样本下精确正态覆盖率是不对的;在独立正态样本条件下应使用相应 t 分布分位数。对非正态样本,大样本近似需要额外条件与足够的近似质量。


== 历史与学派关系 ==
== 同一数据下,预测区间为何更宽 ==
统计推断由多条研究路线发展而来。Fisher 在二十世纪二十年代推进似然、估计及实验分析,Neyman 与 Egon Pearson 在二十世纪三十年代研究检验理论,Neyman 的区间估计工作则明确了覆盖率框架。相关年代与著作可见 [https://mathshistory.st-andrews.ac.uk/Biographies/Fisher/ Fisher]及[https://mathshistory.st-andrews.ac.uk/Biographies/Neyman/ Neyman]的大学数学史传记。这里列的是若干方法史节点,不代表统计推断由一位人物一次性创立。
在已知总体标准差的独立正态模型中,令 <math>X_{\rm new}</math> 表示一个与已有样本独立的未来观测。差 <math>X_{\rm new}-\bar X</math> 的均值为零,方差为 <math>\sigma^2(1+1/n)</math>,因为新观测与样本均值独立,差的方差为两方差之和:<math>\sigma^2+\sigma^2/n</math>。因此约95%的预测区间为
<math display="block">\bar X\pm1.96\sigma\sqrt{1+1/n}.</math>
沿用 <math>n=25,\sigma=2,\bar X=10</math> 的例子,预测区间半宽约为3.998,远大于均值置信区间的0.784。二者没有矛盾:增加样本可以把均值估计得更精确,却不会把新个体本身的随机波动消除。这个预测区间的频率保证也针对已有样本与未来观测的联合重复过程。


贝叶斯方法使用[[贝叶斯定理]],把先验与数据似然结合为后验;频率方法通过重复抽样性质评价程序。它们有时给出相近数值,但语义与前提仍应分别交代。不能因为两种区间碰巧接近,就混用“覆盖率”和“后验概率”的解释;也不宜把一种方法描述成无需任何假设的客观答案。


== 精度目标与样本规模 ==
== 精度目标与样本规模 ==
在已知 σ 的正态均值模型中,同一置信水平的区间半宽与 <math>1/\sqrt n</math> 成正比。若要将半宽减半,需要四倍样本量,而不是两倍。这一规划结论依赖独立同分布和稳定 σ,不能不加检查地套到高度相关观测。
在已知 σ 的正态均值模型中,同一置信水平的区间半宽与 <math>1/\sqrt n</math> 成正比。若要将半宽减半,需要四倍样本量,而不是两倍。这一规划结论依赖独立同分布和稳定 σ,不能不加检查地套到高度相关观测。


在样本量固定时,提高置信水平通常会扩大区间,而不是让同一宽度的结论凭空更可靠。若同时要求更高覆盖率与更窄区间,就需要增加信息,或引入更强且能够辩护的模型假设。样本规模、精度与保证程度是共同约束,不能只挑一个指标优化。
在同一正态模型中,提高置信水平会使用更大的分位数,从而扩大区间。例如把约95%的1.96换成约99%的2.576,同样数据的半宽从0.784扩大为1.0304。更窄区间与更高覆盖率若要同时实现,需要增加样本量。
 
== 多次检验怎样控制总体错误率 ==
若同时检验许多互不相关的假设,每个都用 0.05 阈值,即使全部原假设为真,也可能出现若干“小 p 值”。假设二十次检验相互独立且每次一类错误率恰为 0.05,至少一次误拒绝的概率为 <math>1-0.95^{20}\approx0.6415</math>。现实中检验往往相关,不能直接套用这个数,但选择过程必须进入解释。
 
如果预先有 m 个检验,并让每个真原假设被误拒绝的概率至多为 <math>\alpha/m</math>,由并集上界,至少一次误拒绝的概率就不超过 <math>\alpha</math>。这称为Bonferroni控制,其证明不需要各检验独立,因而与直接使用 <math>1-(1-\alpha)^m</math> 的独立情形不同。
 
例如总错误率目标为0.05、预先安排20次检验时,每次使用0.0025的阈值即可得到这一保证。阈值变严格也会降低检测某些真实差异的功效。若看到结果后再挑选要报告的检验,或不断追加样本直到显著,所使用的规则已改变,原先固定检验的错误率计算不再直接适用。
 
== 历史与学派关系 ==
Fisher 在二十世纪二十年代推进似然、估计及实验分析,Neyman 与 Egon Pearson 在二十世纪三十年代研究检验理论,Neyman 的区间估计工作则明确了覆盖率框架。相关年代与著作可见 [https://mathshistory.st-andrews.ac.uk/Biographies/Fisher/ Fisher]及[https://mathshistory.st-andrews.ac.uk/Biographies/Neyman/ Neyman]的大学数学史传记。


== 编者评注(AI 辅助) ==
贝叶斯方法使用[[贝叶斯定理]],把先验与数据似然结合为后验;频率方法通过重复抽样性质评价程序。它们有时给出相近数值,但语义与前提仍应分别交代。贝叶斯区间用后验概率解释,频率区间用重复抽样的覆盖率解释。
<div class="math-editorial-note">'''编者评注(AI 辅助)。''' 统计题里的公式往往容易算,最难的是说清这个数回答什么问题。建议每次写出三句话:数据如何抽取,概率是对什么随机变化而言,哪些假设失效会改变解释。若一份结果只有 p 值或一个预测点,而没有效应量、误差与设计说明,信息通常不足。理解这些层次后,再学习更复杂模型,能少走把计算熟练误当成推断可靠的弯路。</div>


== 参考来源与延伸阅读 ==
== 参考来源与延伸阅读 ==

2026年9月20日 (日) 07:18的最新版本

统计推断(statistical inference)从有限样本出发,借助概率模型研究总体的未知性质。估计一个参数、给出不确定性区间、检验某个假设,都是统计推断的问题。

十次投掷,九次正面,能知道什么

预先决定投掷一枚硬币十次,结果九次正面。样本正面比例是0.9,但硬币真正的正面概率未必恰好是0.9。我们希望回答两个问题:哪个成功概率最能解释这组结果?如果硬币公平,出现如此偏向一侧的结果有多大机会?前一个问题是估计,后一个问题引出检验。

先明确模型:十次投掷相互独立,正面概率共同为 p,且在试验中不变。用 Xi 记录第i次结果,正面为1、反面为0;总正面数记为 K=iXi。真实的 p 固定但未知,K会随重新试验而变化。本次观察值为 K=9

从数据计算的函数叫统计量。例如 p̂=K/10 是估计量,本次代入得到的0.9是估计值。区分“计算规则”与“这一次算出的数”,才能讨论同一规则在反复抽样中表现如何。

哪个参数使已观察结果最可能

设每次试验只有成功与失败,成功记一,失败记零,独立且共同成功概率为 p。观察 n 次,其中 k 次成功。给定具体的零一序列,其似然为 L(p)=pk(1p)nk,0p1. 若只记录成功总数,似然多一个组合系数 (nk),它不依赖 p,所以最大化位置相同。似然把数据固定、把参数作为自变量;它与“给定数据后 p 的概率分布”不是同一个对象,不能不加先验与归一化就当作后验。

对 0<k<n,取对数得到 (p)=klogp+(nk)log(1p)。导数为 (p)=kpnk1p=knpp(1p). 它在 p<k/n 时为正、p>k/n 时为负,因此最大似然估计为 p̂=k/n。若 k=0,似然随 p 递减,最大值在边界 p=0;若 k=n,最大值在 p=1。此时最大值在边界取得。

开头的九次正面给出 p̂=9/10=0.9:在所列模型内,它使这组数据的似然最大。由 p̂=1niXi,每个0–1变量的期望为p、方差为 p(1p)。因此 𝔼p̂=(np)/n=p,称为无偏;独立性使方差相加,再除以 n2,得到 Var(p̂)=p(1p)/n。即使估计量无偏,每次估计仍会围绕真值波动。

误差、偏差与均方误差

估计误差既包含平均意义上的系统偏离,也包含抽样波动。定义偏差为 Bias(T)=𝔼(T)θ。这里T表示任意估计量,θ表示它要估计的固定参数。二阶矩存在时,写 Tθ=(T𝔼T)+(𝔼Tθ)。展开平方,交叉项的期望是 2(𝔼Tθ)𝔼(T𝔼T)=0,于是 𝔼[(Tθ)2]=Var(T)+Bias(T)2. 这说明总的平均平方误差可以通过偏差与方差之间的权衡改变。一个有少量偏差却显著降低方差的方法,有时会比高方差无偏方法预测更好;比较时必须明确目标参数、损失函数和适用范围。


公平硬币会多常出现这么偏的结果

回到十次投掷、九次正面的结果。取原假设 H0:p=1/2,备择为 p1/2,并用 |K5| 衡量偏离程度。观察到的偏离是 |95|=4,至少同样极端的结果便是K=0、1、9、10。公平模型中,任何一条十次正反面序列概率都是 210;恰有k次正面可从十个位置选k个,故有 (10k) 条序列。因此本例双侧p值为 (100)+(101)+(109)+(1010)210=2210240.02148. 这表示在原假设以及独立、固定样本量等条件成立时,得到预先规定的统计量至少如此极端的概率。它不是原假设为真的概率,也不是结果由“偶然”造成的概率。离散分布的双侧极端性还可以有其他定义,因此必须说明此处采用什么检验。

若事先规定显著性水平 0.05,这次结果进入相应拒绝域;但拒绝原假设并不说明硬币偏差具有多大的实际影响。应同时报告估计值、区间、样本量和试验设计。不拒绝也不等于证明硬币完全公平,可能只是数据还不足以区分很小的偏差。

显著性水平控制的是在原假设成立时使用该检验规则误拒绝的概率,实际离散检验可能小于名义水平。第二类错误是备择情形下没有拒绝,检验功效为其补概率,并且依赖具体备择参数。以下分别计算这两种概率。

检验功效也可以直接计算

仍用十次投掷的双侧检验,显著性水平取0.05。按照已经规定的极端性统计量,拒绝域是 K{0,1,9,10};在原假设下,其真实一类错误概率为 22/1024,小于名义水平0.05。若把K=2与8也纳入,原假设下的概率会增为 112/10240.1094,超过0.05。因此这个对称的非随机化规则只能取较小的实际错误率。

若硬币真正的成功概率为0.8,检验功效是该备择下落入同一拒绝域的概率: k{0,1,9,10}(10k)(0.8)k(0.2)10k0.3758. 也就是说,即使存在相当明显的偏离,十次试验仍有约62.4%的机会没有拒绝原假设。同一个拒绝域,在公平分布下计算得到误拒绝率,在p=0.8分布下计算得到功效。十次投掷的信息有限,漏掉偏差的机会仍相当大。

下图两侧使用同一纵轴尺度和同一拒绝域。金色柱对应 K=0,1,9,10,左图将它们相加得到真实一类错误概率,右图相加得到功效。右图虽然明显偏向较多正面,最高的柱仍在8,尚未进入本次检验的拒绝域。

十次投掷的正面数二项分布,左图成功概率一半右图零点八,零一九十四个拒绝域结果用金色标出,两图其概率总和分别零点零二一四八和零点三七五八一
改变真实参数会改变概率分布;预先规定的判定规则保持相同。

改变真实概率,保留同一检验规则

下图画出 KBin(n,p) 的完整理论分布,没有随机抽样误差。先取 n=10,p=0.5,读出拒绝域的总概率;再只把 p 改成 0.8,拒绝域仍按公平硬币的假设确定,但落入它的概率变了。点击某一根柱,比较“当前模型下恰好出现这个次数的概率”与“公平假设下至少同样极端的概率”。它们回答的是两个不同的问题。

样本量、概率与检验

改变试验次数和成功概率,观察二项分布;比较同一拒绝规则下的误拒绝率与功效。

静态配图与完整推导见本节正文;交互演示需浏览器启用 JavaScript。

把检验反过来,便得到一族置信集合

对每一个候选参数 θ0,如果都有一项一类错误率不超过 α 的检验,就可以把“不会被当前数据拒绝”的所有候选值收集起来。设所得集合为 C(X),则真实参数被排除的事件,恰好等于以真实参数为原假设时被错误拒绝的事件,因此 Pθ(θC(X))1α

这一论证给出了检验与置信集合之间的联系,也解释了覆盖率为何属于构造程序。所得集合不一定总是一个简单区间;离散模型还可能产生超过名义值的覆盖率。不同的双侧极端性定义,对应的反演区间也可能不同。

最简单的正态近似比例区间也有边界风险。把标准误差估为 p̂(1p̂)/n,在观察成功次数为零时会给出零宽度区间。但真实成功率为正时,有限次试验仍可能恰好全失败。因此边界或小样本需要改用二项检验反演等具有明确覆盖性质的方法。

一个可算出端点的区间:正态总体的均值

对于连续测量值,可用另一组完整例子计算区间端点。设独立样本 XiN(μ,σ2),这里N表示正态分布,μ是未知均值,σ是已知总体标准差;样本均值记作 X¯=(X1++Xn)/n。则 X¯N(μ,σ2/n),从标准正态分布的中心约 95% 区间得 Pμ(1.96X¯μσ/n1.96)0.95.c=1.96σ/n,括号内的条件等价于 cX¯μc。左边不等式给 μX¯+c,右边给 μX¯c,因此区间为 [X¯1.96σ/n,X¯+1.96σ/n]。若 n=25,已知 σ=2,观察到均值为 10,区间是 [9.216,10.784]。区间半宽 0.784 来自 1.96×2/5,没有额外拟合步骤。

覆盖率的意思是:在同样的模型和抽样设计下反复抽样、用同样规则造区间,约 95% 的区间会覆盖固定真值 μ。观察这一次数据后,μ 与端点都已固定,不能仅凭频率学派构造就解释为“μ 有 95% 概率落在本区间”。若要给参数这样的条件概率解释,需要另建贝叶斯模型,说明先验与后验。

σ 未知时,把样本标准差直接代入而仍声称小样本下精确正态覆盖率是不对的;在独立正态样本条件下应使用相应 t 分布分位数。对非正态样本,大样本近似需要额外条件与足够的近似质量。

同一数据下,预测区间为何更宽

在已知总体标准差的独立正态模型中,令 Xnew 表示一个与已有样本独立的未来观测。差 XnewX¯ 的均值为零,方差为 σ2(1+1/n),因为新观测与样本均值独立,差的方差为两方差之和:σ2+σ2/n。因此约95%的预测区间为 X¯±1.96σ1+1/n. 沿用 n=25,σ=2,X¯=10 的例子,预测区间半宽约为3.998,远大于均值置信区间的0.784。二者没有矛盾:增加样本可以把均值估计得更精确,却不会把新个体本身的随机波动消除。这个预测区间的频率保证也针对已有样本与未来观测的联合重复过程。


精度目标与样本规模

在已知 σ 的正态均值模型中,同一置信水平的区间半宽与 1/n 成正比。若要将半宽减半,需要四倍样本量,而不是两倍。这一规划结论依赖独立同分布和稳定 σ,不能不加检查地套到高度相关观测。

在同一正态模型中,提高置信水平会使用更大的分位数,从而扩大区间。例如把约95%的1.96换成约99%的2.576,同样数据的半宽从0.784扩大为1.0304。更窄区间与更高覆盖率若要同时实现,需要增加样本量。

多次检验怎样控制总体错误率

若同时检验许多互不相关的假设,每个都用 0.05 阈值,即使全部原假设为真,也可能出现若干“小 p 值”。假设二十次检验相互独立且每次一类错误率恰为 0.05,至少一次误拒绝的概率为 10.95200.6415。现实中检验往往相关,不能直接套用这个数,但选择过程必须进入解释。

如果预先有 m 个检验,并让每个真原假设被误拒绝的概率至多为 α/m,由并集上界,至少一次误拒绝的概率就不超过 α。这称为Bonferroni控制,其证明不需要各检验独立,因而与直接使用 1(1α)m 的独立情形不同。

例如总错误率目标为0.05、预先安排20次检验时,每次使用0.0025的阈值即可得到这一保证。阈值变严格也会降低检测某些真实差异的功效。若看到结果后再挑选要报告的检验,或不断追加样本直到显著,所使用的规则已改变,原先固定检验的错误率计算不再直接适用。

历史与学派关系

Fisher 在二十世纪二十年代推进似然、估计及实验分析,Neyman 与 Egon Pearson 在二十世纪三十年代研究检验理论,Neyman 的区间估计工作则明确了覆盖率框架。相关年代与著作可见 FisherNeyman的大学数学史传记。

贝叶斯方法使用贝叶斯定理,把先验与数据似然结合为后验;频率方法通过重复抽样性质评价程序。它们有时给出相近数值,但语义与前提仍应分别交代。贝叶斯区间用后验概率解释,频率区间用重复抽样的覆盖率解释。

参考来源与延伸阅读