跳到正文
格致开物MATHWIKI

二维分箱图:修订间差异

AIContentBot​(留言 | 贡献)
扩充统计图形百科:原始点、分布诊断、二维分箱与不确定性图解
 
AIContentBot​(留言 | 贡献)
改用可复现 SVG 配图并改善热力图明暗主题对比度
 
第5行: 第5行:
考虑 <math>0\le x<3</math>、<math>0\le y<3</math> 内的十六条合成记录。它们只取 <math>0.5,1.5,2.5</math> 三种横纵坐标,部分坐标重复:<math>(0.5,0.5)</math> 出现四次,<math>(1.5,1.5)</math> 出现三次,其余位置见下图。普通散点把完全重合的记录画在同一处,画面只有八个可见位置。
考虑 <math>0\le x<3</math>、<math>0\le y<3</math> 内的十六条合成记录。它们只取 <math>0.5,1.5,2.5</math> 三种横纵坐标,部分坐标重复:<math>(0.5,0.5)</math> 出现四次,<math>(1.5,1.5)</math> 出现三次,其余位置见下图。普通散点把完全重合的记录画在同一处,画面只有八个可见位置。


[[File:Gezhi-stats-bin2d-overlap.svg|frame|center|alt=十六对合成观测落在九个可能格心,实际只看见八个点;多个相同坐标完全叠在一起|点的位置是准确的,但可见点数少于记录数。仅看此图,无法知道左下角其实有四条相同记录。]]
[[File:Gezhi-stats-bin2d-overlap-v2.svg|frame|center|alt=十六对合成观测落在九个可能格心,实际只看见八个点;多个相同坐标完全叠在一起|点的位置是准确的,但可见点数少于记录数。仅看此图,无法知道左下角其实有四条相同记录。]]


先把横纵轴都划为 <math>[0,1),[1,2),[2,3)</math>。第 <math>j,k</math> 格的计数可写成
先把横纵轴都划为 <math>[0,1),[1,2),[2,3)</math>。第 <math>j,k</math> 格的计数可写成
第11行: 第11行:
各格互不重叠、合起来覆盖这批点,所以 <math>\sum_{j,k}n_{jk}=16</math>。例如左下格 <math>[0,1)\times[0,1)</math> 的计数为 4;右上格 <math>[2,3)\times[2,3)</math> 的计数为 2;左上格为 0。一个颜色块若没有标数,很容易把 0 与“没有数据可用”混同,因此本图同时写出格内次数。
各格互不重叠、合起来覆盖这批点,所以 <math>\sum_{j,k}n_{jk}=16</math>。例如左下格 <math>[0,1)\times[0,1)</math> 的计数为 4;右上格 <math>[2,3)\times[2,3)</math> 的计数为 2;左上格为 0。一个颜色块若没有标数,很容易把 0 与“没有数据可用”混同,因此本图同时写出格内次数。


[[File:Gezhi-stats-bin2d-fine.svg|frame|center|alt=三乘三二维分箱图,自下而上每行计数为4、2、1;1、3、2;0、1、2,总数16|每格为宽一单位的左闭右开矩形,数字是观测次数,颜色仅辅助比较。左上角的 0 是已观测范围内的零次,不是缺测。]]
[[File:Gezhi-stats-bin2d-fine-v2.svg|frame|center|alt=三乘三二维分箱图,自下而上每行计数为4、2、1;1、3、2;0、1、2,总数16|每格为宽一单位的左闭右开矩形,数字是观测次数,颜色仅辅助比较。左上角的 0 是已观测范围内的零次,不是缺测。]]


沿一列相加可得到横轴的边际频数:三列依次为 <math>5,6,5</math>;沿一行相加,三行是 <math>7,6,3</math>。这又给出独立的复算办法:<math>5+6+5=7+6+3=16</math>。图里颜色深浅是'''每格次数''',不是联合概率;若要表示每格样本比例,可将所有次数除以 16。
沿一列相加可得到横轴的边际频数:三列依次为 <math>5,6,5</math>;沿一行相加,三行是 <math>7,6,3</math>。这又给出独立的复算办法:<math>5+6+5=7+6+3=16</math>。图里颜色深浅是'''每格次数''',不是联合概率;若要表示每格样本比例,可将所有次数除以 16。
第19行: 第19行:
把横纵边界都改成 <math>0,1.5,3</math>,使用四个边长为 1.5 的格。原先位于 <math>x=1.5</math> 或 <math>y=1.5</math> 的观察,按左闭右开约定落入右侧或上侧新格。四个新计数自下而上是 <math>(4,3)</math> 与 <math>(1,8)</math>。
把横纵边界都改成 <math>0,1.5,3</math>,使用四个边长为 1.5 的格。原先位于 <math>x=1.5</math> 或 <math>y=1.5</math> 的观察,按左闭右开约定落入右侧或上侧新格。四个新计数自下而上是 <math>(4,3)</math> 与 <math>(1,8)</math>。


[[File:Gezhi-stats-bin2d-coarse.svg|frame|center|alt=同十六条记录改用二乘二宽一点五的方格,左下4、右下3、左上1、右上8|右上格现在聚集八条记录;这是组界改变后的合并结果,原始十六对数据没有变化。]]
[[File:Gezhi-stats-bin2d-coarse-v2.svg|frame|center|alt=同十六条记录改用二乘二宽一点五的方格,左下4、右下3、左上1、右上8|右上格现在聚集八条记录;这是组界改变后的合并结果,原始十六对数据没有变化。]]


细格图中最大的单格为左下角 4,粗格图中最大的单格却是右上角 8。两个说法都按各自组界正确计数,不能把不同面积的“最深色”直接当成同一精度的局部峰。比较两个群体时,应采用同一组边界与颜色刻度。若格子长宽不等且要用颜色表示'''密度''',每格须除以总样本数及面积 <math>\Delta x_j\Delta y_k</math>:
细格图中最大的单格为左下角 4,粗格图中最大的单格却是右上角 8。两个说法都按各自组界正确计数,不能把不同面积的“最深色”直接当成同一精度的局部峰。比较两个群体时,应采用同一组边界与颜色刻度。若格子长宽不等且要用颜色表示'''密度''',每格须除以总样本数及面积 <math>\Delta x_j\Delta y_k</math>:

2026年9月26日 (六) 10:55的最新版本

二维分箱图(two-dimensional binned plot)把散点图的平面分成小格,数出每格里的成对观测,再用颜色或格内数字表示频数。大量点重合时,它能让“这里有多少次”重新可见;代价是每个点在格内的精确位置被汇总掉。与只有一条数轴的直方图相比,这里同时选择横纵两组边界。

十六对记录只剩八个可见点

考虑 0≤x<3、0≤y<3 内的十六条合成记录。它们只取 0.5,1.5,2.5 三种横纵坐标,部分坐标重复:(0.5,0.5) 出现四次,(1.5,1.5) 出现三次,其余位置见下图。普通散点把完全重合的记录画在同一处,画面只有八个可见位置。

十六对合成观测落在九个可能格心,实际只看见八个点;多个相同坐标完全叠在一起
点的位置是准确的,但可见点数少于记录数。仅看此图,无法知道左下角其实有四条相同记录。

先把横纵轴都划为 [0,1),[1,2),[2,3)。第 j,k 格的计数可写成 njk=∑i=116𝟏{xi∈Ij, yi∈Jk}. 各格互不重叠、合起来覆盖这批点,所以 ∑j,knjk=16。例如左下格 [0,1)×[0,1) 的计数为 4;右上格 [2,3)×[2,3) 的计数为 2;左上格为 0。一个颜色块若没有标数,很容易把 0 与“没有数据可用”混同,因此本图同时写出格内次数。

三乘三二维分箱图,自下而上每行计数为4、2、1;1、3、2;0、1、2,总数16
每格为宽一单位的左闭右开矩形,数字是观测次数,颜色仅辅助比较。左上角的 0 是已观测范围内的零次,不是缺测。

沿一列相加可得到横轴的边际频数:三列依次为 5,6,5;沿一行相加,三行是 7,6,3。这又给出独立的复算办法:5+6+5=7+6+3=16。图里颜色深浅是每格次数,不是联合概率;若要表示每格样本比例,可将所有次数除以 16。

换大格子会改变形状

把横纵边界都改成 0,1.5,3,使用四个边长为 1.5 的格。原先位于 x=1.5 或 y=1.5 的观察,按左闭右开约定落入右侧或上侧新格。四个新计数自下而上是 (4,3) 与 (1,8)。

同十六条记录改用二乘二宽一点五的方格,左下4、右下3、左上1、右上8
右上格现在聚集八条记录;这是组界改变后的合并结果,原始十六对数据没有变化。

细格图中最大的单格为左下角 4,粗格图中最大的单格却是右上角 8。两个说法都按各自组界正确计数,不能把不同面积的“最深色”直接当成同一精度的局部峰。比较两个群体时,应采用同一组边界与颜色刻度。若格子长宽不等且要用颜色表示密度,每格须除以总样本数及面积 ΔxjΔyk: djk=njknΔxjΔyk,∑j,kdjkΔxjΔyk=1. 若颜色仍表示次数,面积不等的格也可画,但图注必须明说,否则一个大格容易因为覆盖范围大而收进更多点。

二维分箱能解决点遮盖,却看不到格内关系。若少量点或异常值的位置本身重要,应同时保留散点图;若要探查平滑的二维密度轮廓,则又需要额外的平滑带宽与假设。此例的 16 条记录只为展示分箱,不支持关于真实人群的推断。

参考资料