跳到正文
格致开物MATHWIKI

误差线图

AIContentBot​(留言 | 贡献)2026年9月26日 (六) 09:31的版本 (补充统计图形语法、密度估计、分面及不确定性图解;完善原有统计图词条)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

误差线图(error-bar plot)用一段线表示某个点估计周围的区间。单看两端的位置无法知道它表示的是原始数据的标准差、估计量的标准误、置信区间,还是仪器允许误差;必须在图注中写明对象、算法、置信水平和单位。区间的含义来自计算与假设,不来自线段的外形。

两组五次观测与两条区间

设两组独立的等候时间分别为 A:5,6,7,8,9 分钟,B:7,8,9,10,11 分钟。这些是合成教学数据,两组各 n=5。样本均值为 x¯A=7、x¯B=9 分钟。先保留图中的全部原始点,再讨论要给哪个量画区间。

以 A 组为例,五个值与均值的差为 −2,−1,0,1,2,平方和为 10。样本方差按 n−1=4 作分母,故 sA2=10/4=2.5 min2,样本标准差 sA≈1.581 分钟。B 组只是整体加了两分钟,因此 sB2=2.5 min2。

若把每组的五次读数看作来自同一正态总体的独立样本,可用 t 区间估计该组总体均值 μ。标准误为 s/n=2.5/5≈0.7071 分钟;自由度为 4 的 t 分布有 t0.975,4≈2.776。于是 x¯±t0.975,4sn=x¯±1.963 min. 两组的 95% 置信区间约为 A 的 [5.04,8.96] 与 B 的 [7.04,10.96] 分钟。图中浅色小点是原始观测,较大的彩色点是均值,竖线两端才是按上述模型计算的区间。均值为 7 的点与恰好为七分钟的原始点重合,但代表的对象不同。

A组5到9分钟、B组7到11分钟的各五次原始点;A组均值7分钟的95% t区间约5.04到8.96,B组均值9分钟的区间约7.04到10.96
小点保留每组五次观察,较大的点表示均值;两端带帽的彩色竖线表示在独立正态抽样假设下计算的总体均值 95% t 置信区间。纵轴单位为分钟。

标准差、标准误和置信区间不能互换

s 描述组内个体读数的离散程度;s/n 是样本均值的估计标准误;上式再乘 t 分位数,才形成指定置信水平的均值区间。若只画 x¯±s,不能在图注中称它为“95% 置信区间”。反过来,均值置信区间也不是下一位参加者可能等待的范围;个体预测还包含新的个体差异,通常更宽。

95% 的频率解释对应重复采用同一种抽样与建区间方法:在模型条件成立时,长期反复得到的区间约有 95% 包含固定但未知的总体均值。它不表示已算出的这个区间内“均值有 95% 的概率”。仅五个数据点很难从图上核实正态与独立假设,故示例的区间是说明方法,不是关于真实候车系统的结论。

比较两组时计算差值区间

两条 95% 区间是否重叠,不是一条通用的显著性判据。此例若另外假设两组总体方差相同,则两个样本方差都为 2.5,合并方差为 sp2=(5−1)sA2+(5−1)sB25+5−2=4(2.5)+4(2.5)8=2.5 min2. 两组均值差的标准误于是为 SE⁡(X¯B−X¯A)=sp15+15=1 min. 在独立正态、等方差模型下,自由度为 8 的双侧 95% 区间为 (x¯B−x¯A)±t0.975,8SE⁡=2±2.306=[−0.306,4.306] min. 它包含零,表示这组小样本按该方法尚不能把总体均值差与零清楚区分。样本中的两分钟差仍是已经观察到的事实;推断结论回答的是另一个问题。若方差或抽样方式与上述假设不符,应重新选择计算方法,而不能照搬图上端点。

误差线旁应标出每组 n、所画区间类型与算法,并尽量保留原始点。跨时间绘制一串区间时还须说明它们是否来自同一批对象,以及是否考虑多次比较。只给一个彩色柱和两条没有定义的“±”线,无法让读者判断图在表达变异、估计精度还是测量误差。

参考资料