Q-Q图:修订间差异
AIContentBot(留言 | 贡献) 扩充统计图形百科:原始点、分布诊断、二维分箱与不确定性图解 |
AIContentBot(留言 | 贡献) 改用可复现 SVG 配图并改善热力图明暗主题对比度 |
||
| 第7行: | 第7行: | ||
这里 <math>\Phi</math> 是标准正态累计分布函数。例如 <math>p_3=0.5</math> 对应 <math>q_3=0</math>;它与样本第三个数 0 配成图上的 <math>(0,0)</math>。 | 这里 <math>\Phi</math> 是标准正态累计分布函数。例如 <math>p_3=0.5</math> 对应 <math>q_3=0</math>;它与样本第三个数 0 配成图上的 <math>(0,0)</math>。 | ||
[[File:Gezhi-stats-qq-theory-positions.svg|frame|center|alt=标准正态累计曲线上标出概率0.1、0.3、0.5、0.7、0.9及相应的五个理论分位数|五个橙点先确定理论横坐标;Q-Q 图再把排序后的五个观测依次放在这些横坐标上。]] | [[File:Gezhi-stats-qq-theory-positions-v2.svg|frame|center|alt=标准正态累计曲线上标出概率0.1、0.3、0.5、0.7、0.9及相应的五个理论分位数|五个橙点先确定理论横坐标;Q-Q 图再把排序后的五个观测依次放在这些横坐标上。]] | ||
概率位置的选法不止这一种;改变它会轻微改变有限样本点的位置,尤其是两端。比较两幅 Q-Q 图时,先核对所用理论分布、参数和概率位置。标准正态仅是本例的参照,不能因为横轴写“正态”便认定观测来自正态总体。 | 概率位置的选法不止这一种;改变它会轻微改变有限样本点的位置,尤其是两端。比较两幅 Q-Q 图时,先核对所用理论分布、参数和概率位置。标准正态仅是本例的参照,不能因为横轴写“正态”便认定观测来自正态总体。 | ||
| 第15行: | 第15行: | ||
把前四个值保留,只将最大值从 2 改成 6,得到 B 组 <math>-2,-1,0,1,6</math>;原组记为 A。两组前四个样本分位数相同,于是它们在图中的前四个位置重合。第五个点却分别位于 <math>(1.282,2)</math> 和 <math>(1.282,6)</math>。这种差别藏在直方图宽箱中可能不醒目,但在 Q-Q 图的右端直接显现。 | 把前四个值保留,只将最大值从 2 改成 6,得到 B 组 <math>-2,-1,0,1,6</math>;原组记为 A。两组前四个样本分位数相同,于是它们在图中的前四个位置重合。第五个点却分别位于 <math>(1.282,2)</math> 和 <math>(1.282,6)</math>。这种差别藏在直方图宽箱中可能不醒目,但在 Q-Q 图的右端直接显现。 | ||
[[File:Gezhi-stats-qq-tail.svg|frame|center|alt=A组有序值负2、负1、0、1、2与B组负2、负1、0、1、6对标准正态的Q-Q图;前四点重合,第五点B明显高于四分位参考线|虚线由样本中部四分位数确定。B 的最高观测在右端远高于它,提示这条记录或右尾模型需要检查;五个数不能据此判定总体分布。]] | [[File:Gezhi-stats-qq-tail-v2.svg|frame|center|alt=A组有序值负2、负1、0、1、2与B组负2、负1、0、1、6对标准正态的Q-Q图;前四点重合,第五点B明显高于四分位参考线|虚线由样本中部四分位数确定。B 的最高观测在右端远高于它,提示这条记录或右尾模型需要检查;五个数不能据此判定总体分布。]] | ||
图中的虚线不是“样本一定应落在上面”的标准正态密度。它通过理论分布的 25% 和 75% 分位点 <math>\pm0.6745</math>,以及两组相同的样本四分位数 <math>-1,1</math>。因此斜率约为 | 图中的虚线不是“样本一定应落在上面”的标准正态密度。它通过理论分布的 25% 和 75% 分位点 <math>\pm0.6745</math>,以及两组相同的样本四分位数 <math>-1,1</math>。因此斜率约为 | ||
2026年9月26日 (六) 10:55的最新版本
Q-Q 图(quantile–quantile plot)把两套分位数按相同的累计概率配成点,用来检查分布形状是否相近。一种常见用法是把样本分位数与指定理论分布的分位数比较:横轴是理论值,纵轴是样本排序后的值。若两者只差位置和平移伸缩,点会大致沿直线排列;局部弯曲或尾端偏离提示要回到数据与模型检查。
把概率位置与观测值配对
先看五个有序观测 。这是合成教学数据。为避免把最小和最大值硬放在理论分布的无穷尾端,取概率位置 ,即 。若比较对象是标准正态分布,理论横坐标取满足 的 : 这里 是标准正态累计分布函数。例如 对应 ;它与样本第三个数 0 配成图上的 。
概率位置的选法不止这一种;改变它会轻微改变有限样本点的位置,尤其是两端。比较两幅 Q-Q 图时,先核对所用理论分布、参数和概率位置。标准正态仅是本例的参照,不能因为横轴写“正态”便认定观测来自正态总体。
一次极端观测怎样改变右尾
把前四个值保留,只将最大值从 2 改成 6,得到 B 组 ;原组记为 A。两组前四个样本分位数相同,于是它们在图中的前四个位置重合。第五个点却分别位于 和 。这种差别藏在直方图宽箱中可能不醒目,但在 Q-Q 图的右端直接显现。
图中的虚线不是“样本一定应落在上面”的标准正态密度。它通过理论分布的 25% 和 75% 分位点 ,以及两组相同的样本四分位数 。因此斜率约为 截距为零。在最高点的理论横坐标 处,这条线给出的纵坐标约 ;A 的 2 很接近,B 的 6 则相距很远。直线斜率反映相对尺度,截距反映位置差,故判断“近似一条直线”不等于必须贴着 45° 的 。
诊断信号与结论边界
若中部近直线而右尾持续上翘,可能是样本右尾比参照分布更长,也可能来自异常记录、混合了不同组或样本很小的偶然波动。下一步应检查原始值、采集过程,再看是否需要按条件分组或换参照分布。不能从五个点的一次偏离得出“通过”或“未通过”正态性检验的结论。
Q-Q 图也能比较两个样本:在相同的 下,把两组的样本分位数分别作横纵坐标。若两组样本量不同,可用各自的分位数函数在共同概率位置求值,不能简单把不同长度的两列按行硬配。与经验分布函数图相比,Q-Q 图强调对应分位数之间的关系,ECDF 则更便于在具体阈值读取累计比例。
参考资料
- ggplot2:Q-Q 图与四分位参考线,理论分位数、样本分位数及参照线。
- NIST/SEMATECH:Quantile-Quantile Plot,两组分布的分位数比较。
- 相关:正态分布、经验分布函数图、直方图、残差分析。