跳到正文
格致开物MATHWIKI

Q-Q图:修订间差异

AIContentBot​(留言 | 贡献)
扩充统计图形百科:原始点、分布诊断、二维分箱与不确定性图解
 
AIContentBot​(留言 | 贡献)
改用可复现 SVG 配图并改善热力图明暗主题对比度
 
第7行: 第7行:
这里 <math>\Phi</math> 是标准正态累计分布函数。例如 <math>p_3=0.5</math> 对应 <math>q_3=0</math>;它与样本第三个数 0 配成图上的 <math>(0,0)</math>。
这里 <math>\Phi</math> 是标准正态累计分布函数。例如 <math>p_3=0.5</math> 对应 <math>q_3=0</math>;它与样本第三个数 0 配成图上的 <math>(0,0)</math>。


[[File:Gezhi-stats-qq-theory-positions.svg|frame|center|alt=标准正态累计曲线上标出概率0.1、0.3、0.5、0.7、0.9及相应的五个理论分位数|五个橙点先确定理论横坐标;Q-Q 图再把排序后的五个观测依次放在这些横坐标上。]]
[[File:Gezhi-stats-qq-theory-positions-v2.svg|frame|center|alt=标准正态累计曲线上标出概率0.1、0.3、0.5、0.7、0.9及相应的五个理论分位数|五个橙点先确定理论横坐标;Q-Q 图再把排序后的五个观测依次放在这些横坐标上。]]


概率位置的选法不止这一种;改变它会轻微改变有限样本点的位置,尤其是两端。比较两幅 Q-Q 图时,先核对所用理论分布、参数和概率位置。标准正态仅是本例的参照,不能因为横轴写“正态”便认定观测来自正态总体。
概率位置的选法不止这一种;改变它会轻微改变有限样本点的位置,尤其是两端。比较两幅 Q-Q 图时,先核对所用理论分布、参数和概率位置。标准正态仅是本例的参照,不能因为横轴写“正态”便认定观测来自正态总体。
第15行: 第15行:
把前四个值保留,只将最大值从 2 改成 6,得到 B 组 <math>-2,-1,0,1,6</math>;原组记为 A。两组前四个样本分位数相同,于是它们在图中的前四个位置重合。第五个点却分别位于 <math>(1.282,2)</math> 和 <math>(1.282,6)</math>。这种差别藏在直方图宽箱中可能不醒目,但在 Q-Q 图的右端直接显现。
把前四个值保留,只将最大值从 2 改成 6,得到 B 组 <math>-2,-1,0,1,6</math>;原组记为 A。两组前四个样本分位数相同,于是它们在图中的前四个位置重合。第五个点却分别位于 <math>(1.282,2)</math> 和 <math>(1.282,6)</math>。这种差别藏在直方图宽箱中可能不醒目,但在 Q-Q 图的右端直接显现。


[[File:Gezhi-stats-qq-tail.svg|frame|center|alt=A组有序值负2、负1、0、1、2与B组负2、负1、0、1、6对标准正态的Q-Q图;前四点重合,第五点B明显高于四分位参考线|虚线由样本中部四分位数确定。B 的最高观测在右端远高于它,提示这条记录或右尾模型需要检查;五个数不能据此判定总体分布。]]
[[File:Gezhi-stats-qq-tail-v2.svg|frame|center|alt=A组有序值负2、负1、0、1、2与B组负2、负1、0、1、6对标准正态的Q-Q图;前四点重合,第五点B明显高于四分位参考线|虚线由样本中部四分位数确定。B 的最高观测在右端远高于它,提示这条记录或右尾模型需要检查;五个数不能据此判定总体分布。]]


图中的虚线不是“样本一定应落在上面”的标准正态密度。它通过理论分布的 25% 和 75% 分位点 <math>\pm0.6745</math>,以及两组相同的样本四分位数 <math>-1,1</math>。因此斜率约为
图中的虚线不是“样本一定应落在上面”的标准正态密度。它通过理论分布的 25% 和 75% 分位点 <math>\pm0.6745</math>,以及两组相同的样本四分位数 <math>-1,1</math>。因此斜率约为

2026年9月26日 (六) 10:55的最新版本

Q-Q 图(quantile–quantile plot)把两套分位数按相同的累计概率配成点,用来检查分布形状是否相近。一种常见用法是把样本分位数与指定理论分布的分位数比较:横轴是理论值,纵轴是样本排序后的值。若两者只差位置和平移伸缩,点会大致沿直线排列;局部弯曲或尾端偏离提示要回到数据与模型检查。

把概率位置与观测值配对

先看五个有序观测 −2,−1,0,1,2。这是合成教学数据。为避免把最小和最大值硬放在理论分布的无穷尾端,取概率位置 pi=(i−1/2)/5,即 0.1,0.3,0.5,0.7,0.9。若比较对象是标准正态分布,理论横坐标取满足 Φ(qi)=pi 的 qi: qi≈−1.282,−0.524,0,0.524,1.282. 这里 Φ 是标准正态累计分布函数。例如 p3=0.5 对应 q3=0;它与样本第三个数 0 配成图上的 (0,0)。

标准正态累计曲线上标出概率0.1、0.3、0.5、0.7、0.9及相应的五个理论分位数
五个橙点先确定理论横坐标;Q-Q 图再把排序后的五个观测依次放在这些横坐标上。

概率位置的选法不止这一种;改变它会轻微改变有限样本点的位置,尤其是两端。比较两幅 Q-Q 图时,先核对所用理论分布、参数和概率位置。标准正态仅是本例的参照,不能因为横轴写“正态”便认定观测来自正态总体。

一次极端观测怎样改变右尾

把前四个值保留,只将最大值从 2 改成 6,得到 B 组 −2,−1,0,1,6;原组记为 A。两组前四个样本分位数相同,于是它们在图中的前四个位置重合。第五个点却分别位于 (1.282,2) 和 (1.282,6)。这种差别藏在直方图宽箱中可能不醒目,但在 Q-Q 图的右端直接显现。

A组有序值负2、负1、0、1、2与B组负2、负1、0、1、6对标准正态的Q-Q图;前四点重合,第五点B明显高于四分位参考线
虚线由样本中部四分位数确定。B 的最高观测在右端远高于它,提示这条记录或右尾模型需要检查;五个数不能据此判定总体分布。

图中的虚线不是“样本一定应落在上面”的标准正态密度。它通过理论分布的 25% 和 75% 分位点 ±0.6745,以及两组相同的样本四分位数 −1,1。因此斜率约为 1−(−1)0.6745−(−0.6745)≈1.483, 截距为零。在最高点的理论横坐标 1.282 处,这条线给出的纵坐标约 1.90;A 的 2 很接近,B 的 6 则相距很远。直线斜率反映相对尺度,截距反映位置差,故判断“近似一条直线”不等于必须贴着 45° 的 y=x。

诊断信号与结论边界

若中部近直线而右尾持续上翘,可能是样本右尾比参照分布更长,也可能来自异常记录、混合了不同组或样本很小的偶然波动。下一步应检查原始值、采集过程,再看是否需要按条件分组或换参照分布。不能从五个点的一次偏离得出“通过”或“未通过”正态性检验的结论。

Q-Q 图也能比较两个样本:在相同的 pi 下,把两组的样本分位数分别作横纵坐标。若两组样本量不同,可用各自的分位数函数在共同概率位置求值,不能简单把不同长度的两列按行硬配。与经验分布函数图相比,Q-Q 图强调对应分位数之间的关系,ECDF 则更便于在具体阈值读取累计比例。

参考资料