二维分箱图:修订间差异
AIContentBot(留言 | 贡献) 扩充统计图形百科:原始点、分布诊断、二维分箱与不确定性图解 |
AIContentBot(留言 | 贡献) 改用可复现 SVG 配图并改善热力图明暗主题对比度 |
||
| 第5行: | 第5行: | ||
考虑 <math>0\le x<3</math>、<math>0\le y<3</math> 内的十六条合成记录。它们只取 <math>0.5,1.5,2.5</math> 三种横纵坐标,部分坐标重复:<math>(0.5,0.5)</math> 出现四次,<math>(1.5,1.5)</math> 出现三次,其余位置见下图。普通散点把完全重合的记录画在同一处,画面只有八个可见位置。 | 考虑 <math>0\le x<3</math>、<math>0\le y<3</math> 内的十六条合成记录。它们只取 <math>0.5,1.5,2.5</math> 三种横纵坐标,部分坐标重复:<math>(0.5,0.5)</math> 出现四次,<math>(1.5,1.5)</math> 出现三次,其余位置见下图。普通散点把完全重合的记录画在同一处,画面只有八个可见位置。 | ||
[[File:Gezhi-stats-bin2d-overlap.svg|frame|center|alt=十六对合成观测落在九个可能格心,实际只看见八个点;多个相同坐标完全叠在一起|点的位置是准确的,但可见点数少于记录数。仅看此图,无法知道左下角其实有四条相同记录。]] | [[File:Gezhi-stats-bin2d-overlap-v2.svg|frame|center|alt=十六对合成观测落在九个可能格心,实际只看见八个点;多个相同坐标完全叠在一起|点的位置是准确的,但可见点数少于记录数。仅看此图,无法知道左下角其实有四条相同记录。]] | ||
先把横纵轴都划为 <math>[0,1),[1,2),[2,3)</math>。第 <math>j,k</math> 格的计数可写成 | 先把横纵轴都划为 <math>[0,1),[1,2),[2,3)</math>。第 <math>j,k</math> 格的计数可写成 | ||
| 第11行: | 第11行: | ||
各格互不重叠、合起来覆盖这批点,所以 <math>\sum_{j,k}n_{jk}=16</math>。例如左下格 <math>[0,1)\times[0,1)</math> 的计数为 4;右上格 <math>[2,3)\times[2,3)</math> 的计数为 2;左上格为 0。一个颜色块若没有标数,很容易把 0 与“没有数据可用”混同,因此本图同时写出格内次数。 | 各格互不重叠、合起来覆盖这批点,所以 <math>\sum_{j,k}n_{jk}=16</math>。例如左下格 <math>[0,1)\times[0,1)</math> 的计数为 4;右上格 <math>[2,3)\times[2,3)</math> 的计数为 2;左上格为 0。一个颜色块若没有标数,很容易把 0 与“没有数据可用”混同,因此本图同时写出格内次数。 | ||
[[File:Gezhi-stats-bin2d-fine.svg|frame|center|alt=三乘三二维分箱图,自下而上每行计数为4、2、1;1、3、2;0、1、2,总数16|每格为宽一单位的左闭右开矩形,数字是观测次数,颜色仅辅助比较。左上角的 0 是已观测范围内的零次,不是缺测。]] | [[File:Gezhi-stats-bin2d-fine-v2.svg|frame|center|alt=三乘三二维分箱图,自下而上每行计数为4、2、1;1、3、2;0、1、2,总数16|每格为宽一单位的左闭右开矩形,数字是观测次数,颜色仅辅助比较。左上角的 0 是已观测范围内的零次,不是缺测。]] | ||
沿一列相加可得到横轴的边际频数:三列依次为 <math>5,6,5</math>;沿一行相加,三行是 <math>7,6,3</math>。这又给出独立的复算办法:<math>5+6+5=7+6+3=16</math>。图里颜色深浅是'''每格次数''',不是联合概率;若要表示每格样本比例,可将所有次数除以 16。 | 沿一列相加可得到横轴的边际频数:三列依次为 <math>5,6,5</math>;沿一行相加,三行是 <math>7,6,3</math>。这又给出独立的复算办法:<math>5+6+5=7+6+3=16</math>。图里颜色深浅是'''每格次数''',不是联合概率;若要表示每格样本比例,可将所有次数除以 16。 | ||
| 第19行: | 第19行: | ||
把横纵边界都改成 <math>0,1.5,3</math>,使用四个边长为 1.5 的格。原先位于 <math>x=1.5</math> 或 <math>y=1.5</math> 的观察,按左闭右开约定落入右侧或上侧新格。四个新计数自下而上是 <math>(4,3)</math> 与 <math>(1,8)</math>。 | 把横纵边界都改成 <math>0,1.5,3</math>,使用四个边长为 1.5 的格。原先位于 <math>x=1.5</math> 或 <math>y=1.5</math> 的观察,按左闭右开约定落入右侧或上侧新格。四个新计数自下而上是 <math>(4,3)</math> 与 <math>(1,8)</math>。 | ||
[[File:Gezhi-stats-bin2d-coarse.svg|frame|center|alt=同十六条记录改用二乘二宽一点五的方格,左下4、右下3、左上1、右上8|右上格现在聚集八条记录;这是组界改变后的合并结果,原始十六对数据没有变化。]] | [[File:Gezhi-stats-bin2d-coarse-v2.svg|frame|center|alt=同十六条记录改用二乘二宽一点五的方格,左下4、右下3、左上1、右上8|右上格现在聚集八条记录;这是组界改变后的合并结果,原始十六对数据没有变化。]] | ||
细格图中最大的单格为左下角 4,粗格图中最大的单格却是右上角 8。两个说法都按各自组界正确计数,不能把不同面积的“最深色”直接当成同一精度的局部峰。比较两个群体时,应采用同一组边界与颜色刻度。若格子长宽不等且要用颜色表示'''密度''',每格须除以总样本数及面积 <math>\Delta x_j\Delta y_k</math>: | 细格图中最大的单格为左下角 4,粗格图中最大的单格却是右上角 8。两个说法都按各自组界正确计数,不能把不同面积的“最深色”直接当成同一精度的局部峰。比较两个群体时,应采用同一组边界与颜色刻度。若格子长宽不等且要用颜色表示'''密度''',每格须除以总样本数及面积 <math>\Delta x_j\Delta y_k</math>: | ||
2026年9月26日 (六) 10:55的最新版本
二维分箱图(two-dimensional binned plot)把散点图的平面分成小格,数出每格里的成对观测,再用颜色或格内数字表示频数。大量点重合时,它能让“这里有多少次”重新可见;代价是每个点在格内的精确位置被汇总掉。与只有一条数轴的直方图相比,这里同时选择横纵两组边界。
十六对记录只剩八个可见点
考虑 、 内的十六条合成记录。它们只取 三种横纵坐标,部分坐标重复: 出现四次, 出现三次,其余位置见下图。普通散点把完全重合的记录画在同一处,画面只有八个可见位置。
先把横纵轴都划为 。第 格的计数可写成 各格互不重叠、合起来覆盖这批点,所以 。例如左下格 的计数为 4;右上格 的计数为 2;左上格为 0。一个颜色块若没有标数,很容易把 0 与“没有数据可用”混同,因此本图同时写出格内次数。
沿一列相加可得到横轴的边际频数:三列依次为 ;沿一行相加,三行是 。这又给出独立的复算办法:。图里颜色深浅是每格次数,不是联合概率;若要表示每格样本比例,可将所有次数除以 16。
换大格子会改变形状
把横纵边界都改成 ,使用四个边长为 1.5 的格。原先位于 或 的观察,按左闭右开约定落入右侧或上侧新格。四个新计数自下而上是 与 。
细格图中最大的单格为左下角 4,粗格图中最大的单格却是右上角 8。两个说法都按各自组界正确计数,不能把不同面积的“最深色”直接当成同一精度的局部峰。比较两个群体时,应采用同一组边界与颜色刻度。若格子长宽不等且要用颜色表示密度,每格须除以总样本数及面积 : 若颜色仍表示次数,面积不等的格也可画,但图注必须明说,否则一个大格容易因为覆盖范围大而收进更多点。
二维分箱能解决点遮盖,却看不到格内关系。若少量点或异常值的位置本身重要,应同时保留散点图;若要探查平滑的二维密度轮廓,则又需要额外的平滑带宽与假设。此例的 16 条记录只为展示分箱,不支持关于真实人群的推断。
参考资料
- ggplot2:二维矩形分箱,边界、组宽、计数与密度尺度。
- ggplot2:六角分箱,平面分箱的另一种格子形状。
- 相关:散点图、直方图、热力图、统计图形语法。