跳到正文
格致开物MATHWIKI

学生t分布

(重定向自T分布

学生 t 分布(Student's t-distribution)是一族关于零对称、尾部比标准正态分布更厚的连续概率分布,由自由度 ν>0 控制形状。它最常见的用途,是在总体标准差未知时,根据正态总体的独立样本推断总体均值。这里多出来的不确定性来自用样本标准差代替总体标准差,而不是来自“小样本”三个字本身。

只有五袋产品,怎样估计平均质量

考虑一台灌装设备。在工作条件稳定时随机取五袋,测得质量为 98,99,100,101,102(g). 这是便于手算的合成教学数据。目标是估计设备在该条件下的总体平均质量 μ;总体标准差 σ 也未知。我们暂且采用“各袋质量独立、来自同一个正态总体”的模型,之后再讨论这个假设何时站得住。

五个数的平均值是一百克,可是另一批五袋很可能给出别的平均值。要表达这种抽样不确定性,需要先估计单袋质量的波动,再换算成平均值的波动。

均值、样本标准差与标准误

用小写 xi 表示已经观测到的数值。样本均值为 x¯=98+99+100+101+1025=100 g. 五个偏差为 2,1,0,1,2 克,平方和为 i=15(xix¯)2=4+1+0+1+4=10 g2. 样本方差用四而不是五作分母: s2=1051=2.5 g2,s=2.51.5811 g. 这里的 s 描述单袋质量的分散。五袋平均值的估计标准误则为 SE^(X¯)=s5=0.50.7071 g. 平均多个独立观测可以减小平均值的波动;标准误并不是把每袋产品本身的波动变小。大写 X¯,S 表示抽样前会随样本变化的统计量,小写 x¯,s 是这一组样本计算出的结果。

分母为什么是 n−1

围绕样本均值的偏差总和为零: i=1n(XiX¯)=0. 因此若前 n1 个偏差已知,最后一个就被确定;本例五个偏差只有四个可以自由指定。这解释了“失去一个自由度”的直观意思。

还可以直接看出除以 n1 的统计理由。把每个 Xiμ 拆为 (XiX¯)+(X¯μ),平方后求和;交叉项因偏差和为零而消失,得到 i=1n(Xiμ)2=i=1n(XiX¯)2+n(X¯μ)2. 对具有共同均值、共同有限方差的独立样本取期望。左边为 nσ2,最后一项的期望为 nVar(X¯)=σ2,于是 E[i=1n(XiX¯)2]=(n1)σ2. 所以 S2=1n1i=1n(XiX¯)2σ2 的无偏估计。这一步只需上述有限方差和独立性条件;后面精确的 t 分布结论还需要正态性。无偏的是 S2,不能顺手推出开平方后的 S 也无偏。

从已知标准差到未知标准差

如果总体标准差 σ 已知,且 X1,,Xn 独立同分布于 N(μ,σ2),那么 Z=X¯μσ/nN(0,1). 实际问题里只知道 S,自然会考虑 T=X¯μS/n. 分子仍是均值的误差,分母却会随样本变化。有些样本碰巧很集中,S 较小,会把同样的均值误差放大成更大的 |T|;这正是尾部变厚的来源之一。

在独立同分布正态样本、n2σ>0 的条件下,精确结论是 Ttn1. 由于连续正态样本几乎必然不全相等,S>0 的概率为一。若实际记录全相等,计算式仍然分母为零,应检查仪器分辨率与模型,不能人为填出 t 值。宾夕法尼亚州立大学 STAT 414,§26.4

t 变量怎样构造

Z,W1,,Wν 是相互独立的标准正态变量,暂取 ν 为正整数。把 ν 个平方相加: U=W12++Wν2. 这个平方和的分布称为自由度 ν 的卡方分布,记作 Uχν2。定义 T=ZU/ν. 它就服从自由度 ν 的 t 分布。分母是若干标准正态平方的平均值再开方,围绕一波动;自由度少时,这个平均值还不稳定。

正态样本为什么恰好符合这一构造?把标准化观测组成向量,沿 (1,,1)/n 方向的坐标,就是 Z=n(X¯μ)/σ;剩下 n1 个互相垂直方向描述偏离样本均值的变化。独立标准正态向量的联合密度只依赖坐标平方和,旋转坐标后仍分解为独立标准正态密度。因此均值方向与其余方向独立,而其余坐标的平方和等于 U=i=1n(XiX¯)2σ2=(n1)S2σ2. 代入构造式,σ 正好约掉: ZU/(n1)=(X¯μ)/(σ/n)S/σ=X¯μS/n. 这也解释了为什么只知道“偏差和为零”还不够:正态性保证的旋转性质与独立性,才使比值精确服从 t 分布。相关结果也列于 MIT 14.30,Lecture Note 7,§18.2

密度与尾部:自由度究竟改变了什么

t 分布的密度可写为 fν(t)=Γ((ν+1)/2)νπΓ(ν/2)(1+t2ν)(ν+1)/2,t. 这里的 t 是横坐标数值,ν 是固定的自由度。Gamma 函数在正实数上定义为 Γ(a)=0ua1eudu,a>0. 分部积分给出 Γ(a+1)=aΓ(a),而 Γ(1)=1Γ(1/2)=π;它把阶乘规律扩展到非整数参数。上述密度因此也对任意实数 ν>0 有意义,本例的抽样自由度则是整数四。NIST DLMF:Gamma 函数定义

例如 ν=4 时,Γ(5/2)=3π/4Γ(2)=1,故 f4(t)=38(1+t24)5/2. 它在零处的密度为 3/8,比标准正态的约 0.39894 低;两者总面积同为一,t 分布把更多面积放到了远离零的位置。

自由度一、四、三十的t密度与标准正态密度比较,自由度一的中心较低且尾部较高,三十的曲线已接近正态
比较的是标准 t 变量与标准正态变量。线型和自由度标签同时区分曲线;“标准”不表示方差都等于一。

对本例的 t4P(|T|>3)0.039942;标准正态对应概率约为 0.002700。同样离中心三个横轴单位,尾概率相差很大。图上的曲线在远处虽然都很低,却不代表尾部可以忽略。

从密度公式也能看到原因:固定 ν,当 |t| 很大时,密度按 |t|(ν+1) 的量级衰减;正态密度则按 et2/2 衰减。低自由度 t 分布的极端值对矩的影响尤其大:ν>1 才有均值零,ν>2 才有有限方差 ν/(ν2)。自由度四时方差为二;自由度一时为柯西分布,均值不存在。对称只保证形状左右相同,不自动保证均值积分存在。NIST:t Distribution

自由度增大时,U/ν 是更多独立平方项的平均;每项期望为一、方差为二,因此平均的方差为 2/ν,趋于零。分母越来越接近一,构造式中的 T 便在分布上趋于标准正态。有限自由度时两者仍不相同,尤其讨论很小的尾概率时,要核对所需精度。

五袋数据的百分之九十五置信区间

要把均值误差转换成区间,先找自由度四的中央百分之九十五区域。设正临界值为 c,满足 P(cTc)=0.95. 对称的两条尾部各占 0.025,所以应找累计概率 0.975 的分位数: c=t0.975,42.776445. 分位数记号的第一个下标表示左侧累计概率,不是右尾概率。NIST 的表在自由度四、0.975 列给出四舍五入值 2.776。NIST:Student's t 临界值表

自由度四的t密度,中央区域在负二点七七六和正二点七七六之间,概率零点九五,两尾各零点零二五
临界值属于抽样前 T 的分布,横轴没有克的单位。图中可见尾部只是无限尾部的一部分。

S>0 时,事件 cX¯μS/nc 先乘以正数 S/n,再把 μ 移到中间,等价于 X¯cSnμX¯+cSn. 这一步把一个已知概率的标准化事件,转成了用样本决定端点的区间。

将五袋数据代入,区间半宽为 2.776445×0.51.963243 g. 所以本次算出的百分之九十五置信区间是 [1001.963243, 100+1.963243][98.0368,101.9632] g. 本例不能直接把临界值换成标准正态的 1.959964;那会忽略用五个观测估计标准差带来的额外不确定性。NIST:均值的置信限

上方为九十八到一百零二克的五个原始读数,下方为以一百克为中心、端点约九十八点零四和一百零一点九六的均值置信区间
上面一排点是五袋产品;下面的线段估计总体均值。二者对象不同,不能把线段解释为百分之九十五产品的范围。

“百分之九十五”的频率含义是:保持同一个总体和抽样规则,反复独立取五袋,每次重新计算 X¯S 和区间,长期约百分之九十五的区间会覆盖固定的 μ。这次端点一旦算出,区间就已经固定;在这里的频率学派模型中,不能再说固定的 μ 有百分之九十五概率落入这一固定区间,也不能说下一袋产品有这个概率落入它。

同一计算还能检验一个事先给定的均值。例如检验 μ0=98 克与双侧备择 μ98,得到 Tobs=100980.5=222.828427. 它大于临界值 2.776445,在上述模型与百分之五显著性水平下拒绝这个原假设;相应双侧 p 值约为 0.04742。这与九十八不在刚才区间内一致。p 值计算的是“若原假设成立,出现至少这样极端统计量的概率”,不是原假设成立的概率。

什么时候这个区间失去依据

若灌装设备不断漂移,五袋来自不同工作状态,同分布假设就有问题;若相邻袋受到共同扰动,独立性也可能失败。把同一袋反复称五次,更不能直接当成五袋独立产品。上述 S/n 和自由度公式都建立在特定抽样结构上。

若原始质量明显偏斜或有很重的尾部,五个样本下的 T 一般不精确服从 t4。一个具体反例是独立的零一变量:当它们全为零时,S=0,这一事件有正概率;连续 t 分布的推导立即失效。因而“总体标准差未知、样本少”并不足以保证 t 公式适用。

实际选择正态模型,需要过程知识、仪器信息和足够的观测支持。五个数据点没有明显异常,也远不足以验证总体尾部的形状;记录经过粗舍入时,还应考虑分辨率。样本较大、独立同分布且具有有限正方差时,学生化均值可以有渐近正态近似,但这是另一个近似论证,不能倒过来证明所有小样本都服从 t 分布。

名称与历史资料

“Student”是 William Sealy Gosset 使用的署名,并非指学生数据。1908 年,他以这个署名在《Biometrika》第六卷第一期发表《The Probable Error of a Mean》,页码 1–25,研究小样本均值的不确定性。今天常用的 n1 样本方差与 t 统计量写法可结合现代抽样分布教材理解,不必把原文符号直接套到现代公式上。原始论文出版记录宾州州立大学:Student 与 Gosset

参考资料