散点图
散点图(scatter plot)用点的位置同时表示两个数值变量:横坐标记录一个量,纵坐标记录另一个量。每个点来自同一个对象或同一次观测的一对数据。它帮助我们判断两种量是否一起变化、关系是否接近直线,以及有没有偏离主要点群的观测。
一行数据怎样成为一个点
假设要比较两台温度计在相同地点的读数。下面是四个地点的合成教学数据,横轴 表示第一台的读数,纵轴 表示第二台的读数,单位都是摄氏度。两台仪器的读数必须按地点配对,不能各自排序后重新搭配。
| 地点编号 | (℃) | (℃) | 图上的点 |
|---|---|---|---|
| 1 | 1 | 2 | |
| 2 | 2 | 3 | |
| 3 | 3 | 5 | |
| 4 | 4 | 4 |
第三行并不是两个点。它表示先沿横轴找到三,再沿纵向找到五,在交会处放一个点 。其余三行同理。
散点图的横坐标是温度,不是地点编号:换一下数据表的行序,图上的点不应改变。这里没有连接地点一、二、三、四的线,因为地点之间没有需要表达的连续顺序。若横轴改为同一地点的观测时间,并要研究先后变化,则可能更适合折线图。
交换横纵轴会把图沿 反射,仍然表示同一组配对关系。不过,若要用一个变量预测另一个变量,预测方向就有区别,见最小二乘法。
先看方向,再看形状和分散程度
图中较大的 大体对应较大的 ,这叫正向关系;若点群从左上向右下延伸,就是负向关系。方向只描述整体变化,不要求任意相邻两点都同升同降。本例从 到 虽向下,整体仍呈正向趋势。
其次要看关系是否接近直线。点围绕一条斜直线分布,与点沿弯曲的 U 形分布,是不同的结构。还要留意同一横坐标附近的纵向分散是否改变、是否分成多个点群。NIST 的散点图指南将这些形状、变异与异常观测作为主要阅读内容。NIST:Scatter Plot
对于两台温度计,还应区分“同步变化”与“读数一致”。假如总有 ,点会精确落在一条上升直线上,但第二台始终比第一台高十度。判断两台读数是否接近,需要同时查看点离 有多远,不能只看相关程度。
完整算一次 Pearson 相关系数
样本 Pearson 相关系数用一个数概括成对数据的线性关联。对 对数值,先求均值 ,再定义 当两个变量都不是常数,即 时, 分子比较两个变量偏离各自均值的方向:同在均值之上或同在均值之下时,乘积为正;分处两侧时为负。分母用两种偏差各自的总体大小作标准化。其单位与分子相同,所以 没有单位。NIST:Correlation 的公式与记号
对前面的四行读数, 逐行减去均值并相乘:
| 两偏差之积 | 横向偏差平方 | 纵向偏差平方 | |||
|---|---|---|---|---|---|
| 1 | −1.5 | −1.5 | 2.25 | 2.25 | 2.25 |
| 2 | −0.5 | −0.5 | 0.25 | 0.25 | 0.25 |
| 3 | 0.5 | 1.5 | 0.75 | 0.25 | 2.25 |
| 4 | 1.5 | 0.5 | 0.75 | 2.25 | 0.25 |
| 合计 | 0 | 0 | 4 | 5 | 5 |
于是 回看第一张图,四个点都位于均值交点的左下或右上方向,因此四个偏差乘积都为正;它们没有落在同一条直线上,相关系数也没有达到一。 是这四对数据的描述,不等于“两台仪器有百分之八十的概率一致”,也没有把摄氏度变成百分比。
为什么结果在负一与一之间
把偏差归一化为 这样 ,而 。利用平方和非负, 第一式给出 ,第二式给出 。当 时,每个 ,两组偏差成正比例,所有点落在同一条正斜率直线上; 则对应负比例。
若一台温度计的四次读数完全相同,其偏差平方和为零,公式分母为零,此时 未定义,不能填作零。只给两个横纵值都不同的点时,两点总能确定一条斜直线,因而 ;这也说明极少的点不能证明总体关系牢固。计算描述性的 不要求数据服从正态分布;进一步做显著性检验或区间估计,需要另行说明抽样和分布模型,参见统计推断。
零相关仍然可以有确定关系
现在改看五个无量纲点: 它们按 构造。知道横坐标,就能精确算出纵坐标,却没有统一的上升或下降方向。
这组数据有 。偏差乘积的和为 同时 、,所以 。左右两侧的线性方向在相加时抵消了,U 形结构却完全保留。零相关排除不了非线性关系。
“不相关”与“独立”的区别还可以精确说明:把这五个点看作各以 概率发生的结果,定义随机变量 和 。则 知道 后, 的概率改变了,因此两者不独立;这个明确给定的概率模型又有协方差为零。一般散点样本里算出 ,更不能直接据此断言总体独立。
多一个点,相关系数会怎样改变
回到温度计例子,假设多记录了一对 。这个点偏离原先的右上趋势,用不同形状标出,方便比较。
现在均值变成 。必须用新均值重新计算全部偏差,而不是只在旧分子后面添一项。计算得到 只新增一个点,描述性相关系数就从正变负。这不是图“失效”,而是图提醒我们不要让一个数字遮住数据结构。
下一步应核对该行的地点配对、仪器状态、录入与测量条件。若是录入错误,应根据原始记录更正;若是真实观测,则要解释它为何不同,并考虑分组或模型是否遗漏了条件。不能因为删除后相关系数更漂亮,就把它排除。还应同时报告采用哪些数据,避免让读者无法复算。
图中还有什么信息,图外还缺什么
散点图显示的是联合变化。两个温度计可能都受到同一个地点温度影响,不能因为第一台读数大时第二台也大,就说“第一台的读数使第二台升高”。因果判断需要测量机制、研究设计与其他证据;把某个量放在横轴不会自动赋予它原因的地位。NIST:关联不能单凭散点图证明因果
读图还要留意点是否重叠。十次完全相同的读数可能盖成一个符号,肉眼数符号未必得到样本数;可用透明度、重复次数标记或适当的分组图补充。若给点加抖动以看清重叠,应说明显示位置经过轻微偏移,精确计算仍用原始数据。
比较两张散点图时,要核对坐标范围和单位。改变图框宽高会改变肉眼看到的倾斜程度,却不改变原始数据的 。与条形图靠长度表示数量不同,散点图依靠两个坐标定位,坐标轴可根据问题选择合适范围,但必须清楚标出刻度。若只想了解单个变量的分布,应另看直方图或箱线图;若关心按时间发展的轨迹,可与折线图配合。
参考资料
- NIST/SEMATECH e-Handbook,1.3.3.26 Scatter Plot:二维配对、关系形状、异常点与关联解释。
- NIST Dataplot,Correlation:Pearson 相关系数的偏差和公式。
- 英国国家统计局,Axes and gridlines:坐标范围与跨图比较。
- 相关:统计图、概率、统计推断、最小二乘法。