跳到正文
格致开物MATHWIKI

统计推断

AIContentBot留言 | 贡献2026年9月20日 (日) 02:25的版本 (扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

统计推断(statistical inference)利用有限样本和明确的概率模型,研究总体性质、未知参数或未来观测。它包括参数估计、区间估计、假设检验和预测。结论的不确定性来自抽样变化、测量误差与模型假设;一个精确的小数并不意味着关于现实的结论已经确定。


English overview

Statistical inference uses observed data and an explicit probability model to learn about unknown quantities. A parameter describes a population or data-generating model; a statistic is a function of the sample. Before observing data, an estimator varies across possible samples. Its sampling distribution connects a calculation from one sample to statements about uncertainty.

This article develops estimation and testing through Bernoulli observations and a normal-mean example. We derive the maximum-likelihood estimate of a success probability, compute its expectation and variance, and distinguish an estimator from its realized value. A confidence interval is explained through the repeated-sampling coverage of its construction, not as an automatic posterior probability for a fixed parameter. An exact binomial test illustrates how a p-value depends on a specified null model and definition of extremeness. Bayesian inference answers a related but different conditional-probability question by including a prior distribution. The discussion also covers selection bias, multiple testing, practical significance, and prediction. Historical notes identify contributions to likelihood, testing, and confidence intervals without treating modern inference as a single invention. Every conclusion remains conditional on the sampling design and assumptions used to connect the observed sample to the target population.

从样本到总体,缺少哪一步

抽查一百件产品,发现八件不合格,样本不合格比例是 0.08。这是对已观察数据的描述;若要估计整批产品的不合格概率,必须说明抽样方式、批次是否稳定,以及观察之间是否可以视为独立。如果只挑外观可疑的产品来检验,这个比例不能直接代表全部产品。统计推断补上的正是“数据怎样产生,因此能支持什么结论”这一层联系。

本条先采用独立同分布样本 X1,,Xn。独立表示联合概率按相应方式分解,同分布表示各次观测使用相同分布,并不意味着数值相同。参数如成功概率 p 或总体均值 μ,在频率学派模型中是固定但未知的;样本则在重复抽样中变化。统计量不能包含未知参数,例如样本均值 X¯ 是统计量,表达式 X¯μ 本身则含有未知 μ。

“估计量”指样本的函数,“估计值”指把实际数据代入所得的数。样本均值作为估计量会有分布、期望和方差;观察之后得到的 10.2 是一个已经计算出的估计值。分清这两层,才能理解置信区间为什么讨论一种重复使用的程序,而不只是当前区间的外观。

完整算例一:成功概率的最大似然估计

设每次试验只有成功与失败,成功记一,失败记零,独立且共同成功概率为 p。观察 n 次,其中 k 次成功。给定具体的零一序列,其似然为 L(p)=pk(1p)nk,0p1. 若只记录成功总数,似然多一个组合系数 (nk),它不依赖 p,所以最大化位置相同。似然把数据固定、把参数作为自变量;它与“给定数据后 p 的概率分布”不是同一个对象,不能不加先验与归一化就当作后验。

对 0<k<n,取对数得到 (p)=klogp+(nk)log(1p)。导数为 (p)=kpnk1p=knpp(1p). 它在 p<k/n 时为正、p>k/n 时为负,因此最大似然估计为 p̂=k/n。若 k=0,似然随 p 递减,最大值在边界 p=0;若 k=n,最大值在 p=1。这两种情况不能直接忽略边界后只解内部导数方程。

例如十次试验七次成功,估计值为 0.7。它不是说参数恰好等于 0.7 已被证明,也不保证下一批十次必有七次成功。由 p̂=1niXi,线性期望给出 𝔼p̂=p,独立性给出 Var(p̂)=p(1p)/n。这分别说明无偏性与抽样波动规模;它们是重复抽样性质,不是每一次估计都接近真值的保证。

误差、偏差与均方误差

一个估计量是否有用,不能只看是否无偏。定义偏差为 Bias(T)=𝔼(T)θ。若二阶矩存在,把 T−θ 拆成 T−E(T) 与 E(T)−θ,展开平方并取期望,交叉项为零,得到 𝔼[(Tθ)2]=Var(T)+Bias(T)2. 这说明总的平均平方误差可以通过偏差与方差之间的权衡改变。一个有少量偏差却显著降低方差的方法,有时会比高方差无偏方法预测更好;比较时必须明确目标参数、损失函数和适用范围。

参数估计误差也不同于未来观测误差。即使已经很精确地知道总体均值,下一次观测仍可能因为个体差异波动很大。用于均值的区间通常比用于单个未来观测的预测区间窄。把均值置信区间误当作“约九成五的个体都落在里面”,会严重低估个体变化。

完整算例二:正态均值的置信区间

设样本独立且 XiN(μ,σ2),总体标准差 σ 已知。则 X¯N(μ,σ2/n),从标准正态分布的中心约 95% 区间得 Pμ(1.96X¯μσ/n1.96)0.95. 把不等式对 μ 整理,便得到随机区间 [X¯1.96σ/n,X¯+1.96σ/n]。若 n=25,已知 σ=2,观察到均值为 10,区间是 [9.216,10.784]。区间半宽 0.784 来自 1.96×2/5,没有额外拟合步骤。

覆盖率的意思是:在同样的模型和抽样设计下反复抽样、用同样规则造区间,约 95% 的区间会覆盖固定真值 μ。观察这一次数据后,μ 与端点都已固定,不能仅凭频率学派构造就解释为“μ 有 95% 概率落在本区间”。若要给参数这样的条件概率解释,需要另建贝叶斯模型,说明先验与后验。

σ 未知时,把样本标准差直接代入而仍声称小样本下精确正态覆盖率是不对的;在独立正态样本条件下应使用相应 t 分布分位数。对非正态样本,大样本近似需要额外条件与足够的近似质量。自助法也不是不问数据依赖结构的通用修复,时间相关数据不能随意当作独立观测重抽。

完整算例三:精确二项检验

检验硬币成功概率是否为 1/2,预先固定进行十次独立投掷,观察到九次成功。取原假设 H0:p=1/2,备择为 p1/2,并用 |K5| 衡量偏离程度。至少同样极端的结果是 K=0、1、9、10。因此本例双侧 p 值为 (100)+(101)+(109)+(1010)210=2210240.02148. 这表示在原假设以及独立、固定样本量等条件成立时,得到预先规定的统计量至少如此极端的概率。它不是原假设为真的概率,也不是结果由“偶然”造成的概率。离散分布的双侧极端性还可以有其他定义,因此必须说明此处采用什么检验。

若事先规定显著性水平 0.05,这次结果进入相应拒绝域;但拒绝原假设并不说明硬币偏差具有多大的实际影响。应同时报告估计值、区间、样本量和试验设计。不拒绝也不等于证明硬币完全公平,可能只是数据还不足以区分很小的偏差。

显著性水平控制的是在原假设成立时使用该检验规则误拒绝的概率,实际离散检验可能小于名义水平。第二类错误是备择情形下没有拒绝,检验功效为其补概率,并且依赖具体备择参数。不能把一个固定的 5% 当作所有错误的统一概率。

多重比较、选择过程与现实结论

若同时检验许多互不相关的假设,每个都用 0.05 阈值,即使全部原假设为真,也可能出现若干“小 p 值”。假设二十次检验相互独立且每次一类错误率恰为 0.05,至少一次误拒绝的概率为 10.95200.6415。现实中检验往往相关,不能直接套用这个数,但选择过程必须进入解释。

只报告显著结果、看到数据再挑单侧方向,或不断追加样本直到显著,都会改变原来宣称的误差控制。应预先确定核心问题,完整报告分析路径,并使用与设计匹配的方法。更多数据可以降低随机误差,却不自动消除有偏抽样、错误测量、遗漏变量与模型失配。

观测到两个变量相关并不等于干预其中一个会改变另一个。随机抽样主要关系到向总体推广,随机分配处理主要关系到处理组之间因果比较,两种随机化目的不同。百科中的教学算例用于说明统计逻辑,不应在缺少实际设计细节时替具体研究作结论。

检验功效也可以直接计算

仍用十次投掷的双侧检验,显著性水平取0.05。按照已经规定的极端性统计量,拒绝域是 K{0,1,9,10};在原假设下,其真实一类错误概率为 22/1024,小于名义水平0.05。这种保守性来自离散分布不能任意切出恰好5%的非随机化拒绝域。

若硬币真正的成功概率为0.8,检验功效是该备择下落入同一拒绝域的概率: k{0,1,9,10}(10k)(0.8)k(0.2)10k0.3758. 也就是说,即使存在相当明显的偏离,十次试验仍有约62.4%的机会没有拒绝原假设。这项计算具体说明了“不显著不等于没有差别”。功效计算改变的是评估拒绝域时使用的真实参数,不能在看到结果后偷偷更换拒绝域。

同一数据下,预测区间为何更宽

在已知总体标准差的独立正态模型中,令 Xnew 表示一个与已有样本独立的未来观测。差 XnewX¯ 的均值为零,方差为 σ2(1+1/n),其中一项来自新个体,一项来自均值估计。因此约95%的预测区间为 X¯±1.96σ1+1/n. 沿用 n=25,σ=2,X¯=10 的例子,预测区间半宽约为3.998,远大于均值置信区间的0.784。二者没有矛盾:增加样本可以把均值估计得更精确,却不会把新个体本身的随机波动消除。这个预测区间的频率保证也针对已有样本与未来观测的联合重复过程。

如果未来数据来自不同总体,或者存在时间关联,这个方差分解就需要调整。预测时训练数据与未来对象是否同分布,往往比选用更多小数位更重要。

把检验反过来,便得到一族置信集合

对每一个候选参数 θ0,如果都有一项一类错误率不超过 α 的检验,就可以把“不会被当前数据拒绝”的所有候选值收集起来。设所得集合为 C(X),则真实参数被排除的事件,恰好等于以真实参数为原假设时被错误拒绝的事件,因此 Pθ(θC(X))1α

这一论证给出了检验与置信集合之间的联系,也解释了覆盖率为何属于构造程序。所得集合不一定总是一个简单区间;离散模型还可能产生超过名义值的覆盖率。若改用不同的双侧极端性定义,反演得到的区间也可能不同,因此不能只说“精确区间”而完全不说明算法。

最简单的正态近似比例区间也有边界风险。把标准误差估为 p̂(1p̂)/n,在观察成功次数为零时会给出零宽度区间。这显然不能被解释为有限数据证明总体成功率严格为零。边界或小样本应使用与二项分布相符的检验反演或其他明确说明性质的方法,而不是机械套用大样本公式。

多重比较的一个无需独立的保证

如果预先有 m 个检验,并让每个真原假设被误拒绝的概率至多为 α/m,由并集上界,至少一次误拒绝的概率就不超过 α。这称为Bonferroni控制,其证明不需要各检验独立,因而与直接使用 1(1α)m 的独立情形不同。

代价是单项阈值变严格,检测真实差异的功效可能降低。校正方案不是任意选一个更小阈值来显得谨慎,而是在明确要控制“一次或多次误拒绝”的总体风险后,对整个分析设计给出保证。若还在数据中挑选变量、删去异常值或反复查看结果,实际选择范围也应纳入所使用的方法。

历史与学派关系

统计推断由多条研究路线发展而来。Fisher 在二十世纪二十年代推进似然、估计及实验分析,Neyman 与 Egon Pearson 在二十世纪三十年代研究检验理论,Neyman 的区间估计工作则明确了覆盖率框架。相关年代与著作可见 FisherNeyman的大学数学史传记。这里列的是若干方法史节点,不代表统计推断由一位人物一次性创立。

贝叶斯方法使用贝叶斯定理,把先验与数据似然结合为后验;频率方法通过重复抽样性质评价程序。它们有时给出相近数值,但语义与前提仍应分别交代。不能因为两种区间碰巧接近,就混用“覆盖率”和“后验概率”的解释;也不宜把一种方法描述成无需任何假设的客观答案。

精度目标与样本规模

在已知 σ 的正态均值模型中,同一置信水平的区间半宽与 1/n 成正比。若要将半宽减半,需要四倍样本量,而不是两倍。这一规划结论依赖独立同分布和稳定 σ,不能不加检查地套到高度相关观测。

在样本量固定时,提高置信水平通常会扩大区间,而不是让同一宽度的结论凭空更可靠。若同时要求更高覆盖率与更窄区间,就需要增加信息,或引入更强且能够辩护的模型假设。样本规模、精度与保证程度是共同约束,不能只挑一个指标优化。

编者评注(AI 辅助)

编者评注(AI 辅助)。 统计题里的公式往往容易算,最难的是说清这个数回答什么问题。建议每次写出三句话:数据如何抽取,概率是对什么随机变化而言,哪些假设失效会改变解释。若一份结果只有 p 值或一个预测点,而没有效应量、误差与设计说明,信息通常不足。理解这些层次后,再学习更复杂模型,能少走把计算熟练误当成推断可靠的弯路。

参考来源与延伸阅读