跳到正文
格致开物
MATHWIKI
探索
学科导航
学习路径
搜索
☾
登录
探索
学科导航
学习路径
随机漫游
希腊字母
关于本站
管理员登录
搜索
数学百科
/
知识地图
查看“︁统计图”︁的源代码
←
统计图
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于这些用户组的用户执行:
管理员
、aipublisher
您可以查看和复制此页面的源代码。
'''统计图'''(statistical graphics)把数据中的数量、次序或关系映射为点的位置、线的走向、条的长度或区域的面积。看懂一张统计图,需要知道这些视觉特征分别代表什么,也需要知道数据是怎样取得的。 拿到一张有四十行记录的表格,先不要急着挑颜色。每行是一名参加者、一次测量,还是一天的合计?你要比较人数、观察数值分布,还是研究两个量怎样一起变化?这些问题决定图的结构。把图选对以后,计算和解释才有共同的依据。 == 先弄清一行数据代表什么 == 假设一次活动记录了四十名参加者当天到场的情况。下面是这份'''合成教学数据'''可能采用的记录格式;它说明应怎样保存原始信息,不代表一项真实调查。 <div class="math-table-scroll" role="region" aria-label="记录字段与问题" tabindex="0"> {| class="wikitable" ! 字段 !! 一条记录的含义 !! 可以提出的问题 |- | 参加者编号 || 区分参加者的标识;编号大小没有数量意义 || 有没有重复记录?同一个人是否被算了两次? | 主要到达方式 || 每人按事先统一的规则选一种类别 || 哪种方式的人数最多?各类占这四十人的多少? | 到场用时,单位为分钟 || 每人的一个数量值 || 多数人花多久?是否有少数人用时很长? | 路程,单位为千米 || 与同一人的用时成对保存 || 路程较长的人是否通常用时也较长? | 到场时刻 || 放在时间轴上的观测时刻 || 某些时间段是否特别集中? |} </div> “公交车”是类别,不能用类别编号的平均值表示平均出行方式。用时则可以排序、相减,并在测量定义一致时求平均。路程和用时之间的关系需要保留'''同一行的配对''';分别排序这两列再配起来,会把真实的配对关系破坏掉。 同一份数据可以回答几种问题,但回答一种问题时不必把所有字段都挤进一张图。到场时刻与个人用时也不能混淆:前者定位事件发生在何时,后者描述一个人的历时。 == 按问题选择统计图 == <div class="math-table-scroll" role="region" aria-label="按统计问题选择图形" tabindex="0"> {| class="wikitable" ! 想知道什么 !! 合适的起点 !! 主要读什么 !! 需要特别检查什么 |- | 几个类别各有多少,谁多谁少 || [[条形图]](竖直绘制也称柱状图) || 从共同基线起的长度及数值刻度 || 单位、类别口径、零基线;类别条形的宽度通常不代表数量 | 一个整体由哪些部分构成 || [[扇形统计图]](饼图) || 同一圆内的角度与面积占比 || 各部分须使用同一分母,互不重叠并覆盖所表示的整体 | 一个数量变量集中在哪些区间 || [[直方图]] || 区间位置、面积、峰与尾部 || 分组边界、组宽以及纵轴是频数还是密度 | 几组数量数据的中部与分散程度怎样不同 || [[箱线图]] || 中位数、四分位距、须及单独标出的点 || 四分位数和须的计算约定;箱体省略了大量分布细节 | 两个数量变量怎样一起变化 || [[散点图]] || 每一对观测的位置、整体形状与偏离的点 || 配对是否正确、是否有分组或重叠;相关性不能单独确定因果 | 一个量怎样随时间或有序坐标变化 || [[折线图]]及适当的曲线 || 观测点、变化方向、单位时间的变化 || 时间间隔、缺测、连接或平滑所加的假设 |} </div> 图名不能代替这些判断。例如,四根竖柱可能表示四种交通方式,也可能表示四个用时区间。前者的横轴是类别,调换次序通常不改变数据含义;后者的横轴是连续的数轴,交换区间就会改变所描述的分布。区分[[条形图]]与[[直方图]]时,这一点比“柱子有没有缝”更可靠。 == 从四十条记录走到一张图 == 按每人一种主要到达方式计数,得到下面的合成汇总。步行、自行车、公交和轨道交通的分类规则须事先明确;若一人乘用了几种交通工具,不能未经处理就在每类里重复计算,再把它们当作一个圆的四个部分。 <div class="math-table-scroll" role="region" aria-label="四十人到达方式频数与比例" tabindex="0"> {| class="wikitable" ! 主要到达方式 !! 人数(频数) !! 占本次四十人的比例(相对频数) |- | 步行 || 12 || <math>12/40=30\%</math> |- | 自行车 || 11 || <math>11/40=27.5\%</math> |- | 公交 || 9 || <math>9/40=22.5\%</math> |- | 轨道交通 || 8 || <math>8/40=20\%</math> |- | 合计 || 40 || <math>100\%</math> |} </div> 这里先把四十次类别记录汇总为四个频数 <math>n_j</math>,再用共同总数 <math>N=40</math> 计算 <math display="block">p_j=\frac{n_j}{N},\qquad \sum_{j=1}^{4}n_j=N,\qquad \sum_{j=1}^{4}p_j=1.</math> 最后一个等式来自分类不重不漏。若有两人没有回答,应注明未回答人数,并说明比例的分母是全部参加者还是有效回答者。把分母藏起来,会让同一个百分比产生不同的解释。 [[File:Gezhi-stats-bar-read-values.svg|frame|center|alt=四十人的主要到达方式横向条形图,步行十二、自行车十一、公交九、轨道八,所有条形从零起画|用同一组数据画条形图。先沿共同刻度读出人数,再比较条形端点之间的差;类别名称不能当作数轴刻度。]] 若问题是“步行比自行车多多少”,[[条形图]]把两根条放在共同刻度上,差值就是 <math>12-11=1</math> 人。换成占比,差值为 <math>30\%-27.5\%=2.5</math> '''个百分点'''。若问题是“步行人数比自行车人数高百分之几”,分母改为自行车人数,结果为 <math display="block">\frac{12-11}{11}\times100\%\approx9.09\%.</math> 这三个数回答三个不同的问题,不能只说“高了 2.5%”而省略比较对象。 若要强调这四十人的构成,[[扇形统计图]]可以把同一组比例转为扇区。因为完整圆周有 <math>360^\circ</math>,步行所对应的角度为 <math>360^\circ\times0.30=108^\circ</math>。换了图形,原来的十二人没有改变;改变的是最容易被看见的关系。 == 一张图显示了什么,又省略了什么 == 上述四个频数能告诉我们参加者的主要到达方式,却不能还原每人的用时,更不能推导出路程与用时的相关系数。'''汇总会丢失信息''',所以应保留原始记录和计算过程,不能只保存最后的图片。 对于用时,先画[[直方图]]可以观察是否偏斜、是否有多个集中区间;比较几组用时时,[[箱线图]]能紧凑地排列它们的中位数和四分位距。两种图回答的问题有交集,省略的信息却不同:箱线图通常看不出两个峰,直方图的形状又会随组宽和分组起点改变。样本很小时,把原始点一并画出,往往比只给汇总形状更便于判断。 研究路程与用时时,[[散点图]]保留每一对数的位置。把每人的点按编号连成线,通常没有值得解释的斜率,因为编号并不是时间。若记录的是同一个容器在不同时刻的水量,则[[折线图]]中的时间次序有实际含义;仍须区分观测点与连接线,不能把两次测量之间的直线当作已经测到的过程。 == 读图时沿着证据走 == 先读标题与数据说明,明确对象、期间和单位;再读轴、图例、分母及样本量。随后描述图中确实看见的现象,例如“本次四十人中步行人数最多”,并给出数值。这个顺序可以避免先被颜色或形状吸引,再替图寻找结论。 这四十人并不自动代表全市居民。活动地点、参加者来源、天气和到场时间都可能影响记录。把本次比例推广为总体比例,需要说明抽样或数据生成机制,并考虑不确定性,相关问题进入[[统计推断]]。即使图画得准确,也不能弥补样本选择造成的偏差。 图中的异常点同样先是线索。它可能来自录入错误,也可能是真实的长途参加者;应回查记录和测量过程,再决定处理方法。仅仅因为某个点使趋势不整齐而删除它,会改变要研究的数据。 一幅可复查的图应让读者找到数据来源、筛选范围、计算方法与作图约定。颜色应辅以文字、形状或线型;需要精确读数时同时提供数表。本文及相邻词条中的教学数据均为合成例子,不能用作现实人群或社会现象的证据。 == 统计图与探索性数据分析 == 探索性数据分析(exploratory data analysis,EDA)把图形与数值摘要结合,用来发现结构、检查假设并寻找需要继续研究的问题。Tukey 的《Exploratory Data Analysis》(1977)是这一方法的重要著作;这不意味着所有统计图都在那时才被发明。NIST 的手册也强调,EDA 是分析问题的方式,不只是某一种图的名称。 学习时可以先用[[条形图]]和[[扇形统计图]]弄清比较与构成,再用[[直方图]]和[[箱线图]]认识分布,最后用[[散点图]]与[[折线图]]讨论关系和变化。每学一种图,都尝试用原始数据重算图上的一个位置或区域,并解释改变一种作图约定后,哪些结论仍然成立。 == 延伸阅读 == * [https://www.itl.nist.gov/div898/handbook/eda/section1/eda11.htm NIST/SEMATECH e-Handbook:What is EDA?],区分探索性分析方法与个别图形技术。 * [https://service-manual.ons.gov.uk/data-visualisation/chart-types 英国国家统计局(ONS):Chart types],按比较、时间变化、构成等任务组织图形选择。 * [https://service-manual.ons.gov.uk/data-visualisation/guidance/principles ONS:Data visualisation principles],讨论准确表达、可访问性与图文配合。 [[分类:概率与统计]]
返回
统计图
。