跳到正文
格致开物MATHWIKI

散点图

散点图(scatter plot)用点的位置同时表示两个数值变量:横坐标记录一个量,纵坐标记录另一个量。每个点来自同一个对象或同一次观测的一对数据。它帮助我们判断两种量是否一起变化、关系是否接近直线,以及有没有偏离主要点群的观测。

一行数据怎样成为一个点

假设要比较两台温度计在相同地点的读数。下面是四个地点的合成教学数据,横轴 x 表示第一台的读数,纵轴 y 表示第二台的读数,单位都是摄氏度。两台仪器的读数必须按地点配对,不能各自排序后重新搭配。

地点编号 i xi(℃) yi(℃) 图上的点
1 1 2 (1,2)
2 2 3 (2,3)
3 3 5 (3,5)
4 4 4 (4,4)

第三行并不是两个点。它表示先沿横轴找到三,再沿纵向找到五,在交会处放一个点 (3,5)。其余三行同理。

四个观测点为一二、二三、三五、四四,横纵坐标都是摄氏度,虚线分别经过横坐标均值二点五和纵坐标均值三点五
先把第三行定位到 (3,5),再看整个点群从左下向右上延伸。虚线表示均值位置。

散点图的横坐标是温度,不是地点编号:换一下数据表的行序,图上的点不应改变。这里没有连接地点一、二、三、四的线,因为地点之间没有需要表达的连续顺序。若横轴改为同一地点的观测时间,并要研究先后变化,则可能更适合折线图

交换横纵轴会把图沿 y=x 反射,仍然表示同一组配对关系。不过,若要用一个变量预测另一个变量,预测方向就有区别,见最小二乘法

先看方向,再看形状和分散程度

图中较大的 x 大体对应较大的 y,这叫正向关系;若点群从左上向右下延伸,就是负向关系。方向只描述整体变化,不要求任意相邻两点都同升同降。本例从 (3,5)(4,4) 虽向下,整体仍呈正向趋势。

其次要看关系是否接近直线。点围绕一条斜直线分布,与点沿弯曲的 U 形分布,是不同的结构。还要留意同一横坐标附近的纵向分散是否改变、是否分成多个点群。NIST 的散点图指南将这些形状、变异与异常观测作为主要阅读内容。NIST:Scatter Plot

对于两台温度计,还应区分“同步变化”与“读数一致”。假如总有 y=x+10,点会精确落在一条上升直线上,但第二台始终比第一台高十度。判断两台读数是否接近,需要同时查看点离 y=x 有多远,不能只看相关程度。

完整算一次 Pearson 相关系数

样本 Pearson 相关系数用一个数概括成对数据的线性关联。对 n 对数值,先求均值 x¯,y¯,再定义 Sxx=i=1n(xix¯)2,Syy=i=1n(yiy¯)2, Sxy=i=1n(xix¯)(yiy¯). 当两个变量都不是常数,即 Sxx>0,Syy>0 时, r=SxySxxSyy. 分子比较两个变量偏离各自均值的方向:同在均值之上或同在均值之下时,乘积为正;分处两侧时为负。分母用两种偏差各自的总体大小作标准化。其单位与分子相同,所以 r 没有单位。NIST:Correlation 的公式与记号

对前面的四行读数, x¯=1+2+3+44=2.5,y¯=2+3+5+44=3.5. 逐行减去均值并相乘:

i xix¯ yiy¯ 两偏差之积 横向偏差平方 纵向偏差平方
1 −1.5 −1.5 2.25 2.25 2.25
2 −0.5 −0.5 0.25 0.25 0.25
3 0.5 1.5 0.75 0.25 2.25
4 1.5 0.5 0.75 2.25 0.25
合计 0 0 4 5 5

于是 r=45×5=0.8. 回看第一张图,四个点都位于均值交点的左下或右上方向,因此四个偏差乘积都为正;它们没有落在同一条直线上,相关系数也没有达到一。0.8 是这四对数据的描述,不等于“两台仪器有百分之八十的概率一致”,也没有把摄氏度变成百分比。

为什么结果在负一与一之间

把偏差归一化为 ui=xix¯Sxx,vi=yiy¯Syy. 这样 ui2=vi2=1,而 r=uivi。利用平方和非负, 0(uivi)2=22r,0(ui+vi)2=2+2r. 第一式给出 r1,第二式给出 r1。当 r=1 时,每个 ui=vi,两组偏差成正比例,所有点落在同一条正斜率直线上;r=1 则对应负比例。

若一台温度计的四次读数完全相同,其偏差平方和为零,公式分母为零,此时 r 未定义,不能填作零。只给两个横纵值都不同的点时,两点总能确定一条斜直线,因而 |r|=1;这也说明极少的点不能证明总体关系牢固。计算描述性的 r 不要求数据服从正态分布;进一步做显著性检验或区间估计,需要另行说明抽样和分布模型,参见统计推断

零相关仍然可以有确定关系

现在改看五个无量纲点: (2,4), (1,1), (0,0), (1,1), (2,4). 它们按 y=x2 构造。知道横坐标,就能精确算出纵坐标,却没有统一的上升或下降方向。

五个点位于y等于x平方的U形曲线上,横坐标负二负一零一二对应纵坐标四一零一四,相关系数为零
虚线说明这组数据的构造关系 y=x²;它不是把相邻观测顺序连接起来的折线。

这组数据有 x¯=0,y¯=2。偏差乘积的和为 Sxy=(2)(42)+(1)(12)+0(02)+1(12)+2(42)=0. 同时 Sxx=10Syy=14,所以 r=0/140=0。左右两侧的线性方向在相加时抵消了,U 形结构却完全保留。零相关排除不了非线性关系。

“不相关”与“独立”的区别还可以精确说明:把这五个点看作各以 1/5 概率发生的结果,定义随机变量 XY=X2。则 P(Y=0)=15,P(Y=0X=0)=1. 知道 X=0 后,Y 的概率改变了,因此两者不独立;这个明确给定的概率模型又有协方差为零。一般散点样本里算出 r=0,更不能直接据此断言总体独立。

多一个点,相关系数会怎样改变

回到温度计例子,假设多记录了一对 (5,0)。这个点偏离原先的右上趋势,用不同形状标出,方便比较。

原来的四个点仍向右上延伸,额外的五零点用十字标出;四点相关系数零点八,加入后约为负零点二四六六
坐标尺度与第一张图一致。新增点既偏离原有点群,也改变了两组均值。

现在均值变成 x¯=3,y¯=2.8。必须用新均值重新计算全部偏差,而不是只在旧分子后面添一项。计算得到 Sxx=10,Syy=14.8,Sxy=3, r=31480.2466. 只新增一个点,描述性相关系数就从正变负。这不是图“失效”,而是图提醒我们不要让一个数字遮住数据结构。

下一步应核对该行的地点配对、仪器状态、录入与测量条件。若是录入错误,应根据原始记录更正;若是真实观测,则要解释它为何不同,并考虑分组或模型是否遗漏了条件。不能因为删除后相关系数更漂亮,就把它排除。还应同时报告采用哪些数据,避免让读者无法复算。

图中还有什么信息,图外还缺什么

散点图显示的是联合变化。两个温度计可能都受到同一个地点温度影响,不能因为第一台读数大时第二台也大,就说“第一台的读数使第二台升高”。因果判断需要测量机制、研究设计与其他证据;把某个量放在横轴不会自动赋予它原因的地位。NIST:关联不能单凭散点图证明因果

读图还要留意点是否重叠。十次完全相同的读数可能盖成一个符号,肉眼数符号未必得到样本数;可用透明度、重复次数标记或适当的分组图补充。若给点加抖动以看清重叠,应说明显示位置经过轻微偏移,精确计算仍用原始数据。

比较两张散点图时,要核对坐标范围和单位。改变图框宽高会改变肉眼看到的倾斜程度,却不改变原始数据的 r。与条形图靠长度表示数量不同,散点图依靠两个坐标定位,坐标轴可根据问题选择合适范围,但必须清楚标出刻度。若只想了解单个变量的分布,应另看直方图箱线图;若关心按时间发展的轨迹,可与折线图配合。

参考资料