统计图:修订间差异
AIContentBot(留言 | 贡献) 补充统计图解:六类图形、完整算例、透明SVG与选图入口 |
AIContentBot(留言 | 贡献) 串联统计图与概率分布的学习路径和分类导航 |
||
| 第89行: | 第89行: | ||
一幅可复查的图应让读者找到数据来源、筛选范围、计算方法与作图约定。颜色应辅以文字、形状或线型;需要精确读数时同时提供数表。本文及相邻词条中的教学数据均为合成例子,不能用作现实人群或社会现象的证据。 | 一幅可复查的图应让读者找到数据来源、筛选范围、计算方法与作图约定。颜色应辅以文字、形状或线型;需要精确读数时同时提供数表。本文及相邻词条中的教学数据均为合成例子,不能用作现实人群或社会现象的证据。 | ||
== 从数据的图形走向分布模型 == | |||
[[直方图]]显示一批已经取得的观察,[[概率分布]]描述模型如何向可能结果分配概率。画在一起比较时,先使直方图面积归一化,再核对横轴单位。计数问题可以读[[二项分布]]与[[泊松分布]],等待问题可以读[[几何分布]]、[[均匀分布]]与[[指数分布]],测量和均值推断可读[[正态分布]]与[[学生t分布]]。图形相似是检查模型的线索,还需要说明抽样机制和适用条件。 | |||
== 统计图与探索性数据分析 == | == 统计图与探索性数据分析 == | ||
2026年9月20日 (日) 09:22的最新版本
统计图(statistical graphics)把数据中的数量、次序或关系映射为点的位置、线的走向、条的长度或区域的面积。看懂一张统计图,需要知道这些视觉特征分别代表什么,也需要知道数据是怎样取得的。
拿到一张有四十行记录的表格,先不要急着挑颜色。每行是一名参加者、一次测量,还是一天的合计?你要比较人数、观察数值分布,还是研究两个量怎样一起变化?这些问题决定图的结构。把图选对以后,计算和解释才有共同的依据。
先弄清一行数据代表什么
假设一次活动记录了四十名参加者当天到场的情况。下面是这份合成教学数据可能采用的记录格式;它说明应怎样保存原始信息,不代表一项真实调查。
| 字段 | 一条记录的含义 | 可以提出的问题 | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 参加者编号 | 区分参加者的标识;编号大小没有数量意义 | 有没有重复记录?同一个人是否被算了两次? | 主要到达方式 | 每人按事先统一的规则选一种类别 | 哪种方式的人数最多?各类占这四十人的多少? | 到场用时,单位为分钟 | 每人的一个数量值 | 多数人花多久?是否有少数人用时很长? | 路程,单位为千米 | 与同一人的用时成对保存 | 路程较长的人是否通常用时也较长? | 到场时刻 | 放在时间轴上的观测时刻 | 某些时间段是否特别集中? |
“公交车”是类别,不能用类别编号的平均值表示平均出行方式。用时则可以排序、相减,并在测量定义一致时求平均。路程和用时之间的关系需要保留同一行的配对;分别排序这两列再配起来,会把真实的配对关系破坏掉。
同一份数据可以回答几种问题,但回答一种问题时不必把所有字段都挤进一张图。到场时刻与个人用时也不能混淆:前者定位事件发生在何时,后者描述一个人的历时。
按问题选择统计图
| 想知道什么 | 合适的起点 | 主要读什么 | 需要特别检查什么 | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 几个类别各有多少,谁多谁少 | 条形图(竖直绘制也称柱状图) | 从共同基线起的长度及数值刻度 | 单位、类别口径、零基线;类别条形的宽度通常不代表数量 | 一个整体由哪些部分构成 | 扇形统计图(饼图) | 同一圆内的角度与面积占比 | 各部分须使用同一分母,互不重叠并覆盖所表示的整体 | 一个数量变量集中在哪些区间 | 直方图 | 区间位置、面积、峰与尾部 | 分组边界、组宽以及纵轴是频数还是密度 | 几组数量数据的中部与分散程度怎样不同 | 箱线图 | 中位数、四分位距、须及单独标出的点 | 四分位数和须的计算约定;箱体省略了大量分布细节 | 两个数量变量怎样一起变化 | 散点图 | 每一对观测的位置、整体形状与偏离的点 | 配对是否正确、是否有分组或重叠;相关性不能单独确定因果 | 一个量怎样随时间或有序坐标变化 | 折线图及适当的曲线 | 观测点、变化方向、单位时间的变化 | 时间间隔、缺测、连接或平滑所加的假设 |
图名不能代替这些判断。例如,四根竖柱可能表示四种交通方式,也可能表示四个用时区间。前者的横轴是类别,调换次序通常不改变数据含义;后者的横轴是连续的数轴,交换区间就会改变所描述的分布。区分条形图与直方图时,这一点比“柱子有没有缝”更可靠。
从四十条记录走到一张图
按每人一种主要到达方式计数,得到下面的合成汇总。步行、自行车、公交和轨道交通的分类规则须事先明确;若一人乘用了几种交通工具,不能未经处理就在每类里重复计算,再把它们当作一个圆的四个部分。
| 主要到达方式 | 人数(频数) | 占本次四十人的比例(相对频数) |
|---|---|---|
| 步行 | 12 | |
| 自行车 | 11 | |
| 公交 | 9 | |
| 轨道交通 | 8 | |
| 合计 | 40 |
这里先把四十次类别记录汇总为四个频数 ,再用共同总数 计算 最后一个等式来自分类不重不漏。若有两人没有回答,应注明未回答人数,并说明比例的分母是全部参加者还是有效回答者。把分母藏起来,会让同一个百分比产生不同的解释。
若问题是“步行比自行车多多少”,条形图把两根条放在共同刻度上,差值就是 人。换成占比,差值为 个百分点。若问题是“步行人数比自行车人数高百分之几”,分母改为自行车人数,结果为 这三个数回答三个不同的问题,不能只说“高了 2.5%”而省略比较对象。
若要强调这四十人的构成,扇形统计图可以把同一组比例转为扇区。因为完整圆周有 ,步行所对应的角度为 。换了图形,原来的十二人没有改变;改变的是最容易被看见的关系。
一张图显示了什么,又省略了什么
上述四个频数能告诉我们参加者的主要到达方式,却不能还原每人的用时,更不能推导出路程与用时的相关系数。汇总会丢失信息,所以应保留原始记录和计算过程,不能只保存最后的图片。
对于用时,先画直方图可以观察是否偏斜、是否有多个集中区间;比较几组用时时,箱线图能紧凑地排列它们的中位数和四分位距。两种图回答的问题有交集,省略的信息却不同:箱线图通常看不出两个峰,直方图的形状又会随组宽和分组起点改变。样本很小时,把原始点一并画出,往往比只给汇总形状更便于判断。
研究路程与用时时,散点图保留每一对数的位置。把每人的点按编号连成线,通常没有值得解释的斜率,因为编号并不是时间。若记录的是同一个容器在不同时刻的水量,则折线图中的时间次序有实际含义;仍须区分观测点与连接线,不能把两次测量之间的直线当作已经测到的过程。
读图时沿着证据走
先读标题与数据说明,明确对象、期间和单位;再读轴、图例、分母及样本量。随后描述图中确实看见的现象,例如“本次四十人中步行人数最多”,并给出数值。这个顺序可以避免先被颜色或形状吸引,再替图寻找结论。
这四十人并不自动代表全市居民。活动地点、参加者来源、天气和到场时间都可能影响记录。把本次比例推广为总体比例,需要说明抽样或数据生成机制,并考虑不确定性,相关问题进入统计推断。即使图画得准确,也不能弥补样本选择造成的偏差。
图中的异常点同样先是线索。它可能来自录入错误,也可能是真实的长途参加者;应回查记录和测量过程,再决定处理方法。仅仅因为某个点使趋势不整齐而删除它,会改变要研究的数据。
一幅可复查的图应让读者找到数据来源、筛选范围、计算方法与作图约定。颜色应辅以文字、形状或线型;需要精确读数时同时提供数表。本文及相邻词条中的教学数据均为合成例子,不能用作现实人群或社会现象的证据。
从数据的图形走向分布模型
直方图显示一批已经取得的观察,概率分布描述模型如何向可能结果分配概率。画在一起比较时,先使直方图面积归一化,再核对横轴单位。计数问题可以读二项分布与泊松分布,等待问题可以读几何分布、均匀分布与指数分布,测量和均值推断可读正态分布与学生t分布。图形相似是检查模型的线索,还需要说明抽样机制和适用条件。
统计图与探索性数据分析
探索性数据分析(exploratory data analysis,EDA)把图形与数值摘要结合,用来发现结构、检查假设并寻找需要继续研究的问题。Tukey 的《Exploratory Data Analysis》(1977)是这一方法的重要著作;这不意味着所有统计图都在那时才被发明。NIST 的手册也强调,EDA 是分析问题的方式,不只是某一种图的名称。
学习时可以先用条形图和扇形统计图弄清比较与构成,再用直方图和箱线图认识分布,最后用散点图与折线图讨论关系和变化。每学一种图,都尝试用原始数据重算图上的一个位置或区域,并解释改变一种作图约定后,哪些结论仍然成立。
延伸阅读
- NIST/SEMATECH e-Handbook:What is EDA?,区分探索性分析方法与个别图形技术。
- 英国国家统计局(ONS):Chart types,按比较、时间变化、构成等任务组织图形选择。
- ONS:Data visualisation principles,讨论准确表达、可访问性与图文配合。