数据的测量尺度
数据的测量尺度(scale of measurement)描述数值或标签怎样代表对象,以及哪些比较在合理改变记法后仍然成立。常见的名义、顺序、区间和比率四类尺度,分别强调分类、次序、等间隔和有意义的比例。它们帮助解释数据,并不只是软件中选择某个统计按钮的许可表。
同一张记录表中,数字的意思不同
设阅读室记录四次到访,包含所在房间、主观舒适等级、室温及停留时长。以下为合成记录;“低、中、高”按受访者对本次体验的评价排序,尚未假设相邻等级之间差得一样多。
| 到访记录 | 房间 | 舒适等级 | 室温(℃) | 停留(分钟) |
|---|---|---|---|---|
| A | 东室 | 低 | 18 | 10 |
| B | 西室 | 中 | 20 | 20 |
| C | 西室 | 中 | 22 | 20 |
| D | 东室 | 高 | 24 | 40 |
可以说D停留时间是A的四倍,也可以说D记录的室温比A高6℃。但“24℃是18℃的三分之四倍那么热”没有沿用同一种合理解释;把东室编码为1、西室编码为2,也不会使西室成为东室的两倍。区别来自测量规则,不是来自单元格能否存成数字。OpenStax §1.3介绍了这些基本区别。
名义尺度保留相同与不同
房间名称属于名义尺度。东室与西室是不同类别,但名称本身没有大小次序。可分别计数:各出现两次,占记录的一半;可以研究房间与其他变量的关系。
把东、西室编码为1、2,四个代码的平均数是1.5。若改成10、90,平均数成为50。两次编码都完整保留了谁在哪个房间,却给出不同“平均房间”;所以这个均值没有不依赖编码的房间含义。
这不妨碍对类别进行计算。例如定义指示变量 :第 次在东室取1,否则取0。那么 就是东室频率。这里0、1有明确的事件指示含义,平均的是“是否在东室”,不是房间名称的大小。名义尺度不能解释任意类别代码的均值,不等于类别数据不能使用统计模型。
顺序尺度保留排序,不自动保留距离
舒适度的低、中、高有次序,所以属于顺序尺度。我们知道“高”排在“中”之上,但没有测得从低到中与从中到高的改善量相同。
用1、2、3编码,四次评价为1、2、2、3,均值为2。换成仍保持顺序的1、2、10,数据成为1、2、2、10,均值为3.75。同一组评价出现不同的数值间隔;顺序信息并没有指定哪一套间隔正确。
本例的众数是“中”,排序后居中的两次也都是“中”,这些结论不受上述重编码影响。若样本中间两项属于不同等级,可以报告中间等级范围或采用明确的顺序分位数约定,不必对两个文字标签作算术平均。
评价量表有时使用总分或平均分。这可以是一个有定义的评分指标,也可能基于额外的等间隔近似或潜变量模型;需要说明解释、效度证据及对不同编码的敏感性。不能只因原始选项有顺序,就断言任何使用均值的方法都错;也不能只因软件算得出均值,就把编码差解释为相同的心理差异。
区间尺度:换零点后,差值关系仍一致
摄氏温度允许比较差值:本例每相邻记录相差2℃。把数值转换成华氏温度, 18、20、22、24℃分别成为64.4、68、71.6、75.2℉。每相邻差改为3.6℉,所有差统一乘 。但原来的数值比 变成 ,不是 。
一般的区间尺度允许正仿射变换 ,其中 表示单位改变, 表示零点平移。于是 两个非零差值的比也不变,因为共同的 可以约去;单个读数的比则通常受 影响。说“温差6℃是温差2℃的三倍”与说“24℃是8℃的三倍那么热”,是不同的比较。
四次摄氏温度的均值为21℃,对应华氏均值为69.8℉。直接对转换后的数据求平均也得到69.8,原因是 所以均值可以随单位和零点一致转换。摄氏零度是一个规定的温标参考点,不表示热运动或能量消失;不要把温标的比例解释直接换成“热量比例”,后者还涉及物体和物理模型。
比率尺度:单位改变,比例不变
停留时长的零表示没有经过时间,在本记录中可作为比率尺度。分钟换成秒只需乘60,不改变零点: 四个时长的均值为 分钟,换算为1350秒。与温度一样,均值的数值会随单位改变;不同之处在于时长比也具有不依赖时间单位的含义。
时长与“钟表上显示的时刻”也不同:上午8点与下午4点的数值16、8不能解释为后一个时刻是前一个的两倍。先确定测的是持续时间、相对某个参考时刻的差,还是循环显示的钟点,再选计算方式。
用重编码检查一个结论
四种尺度可概括为保持哪些结构的变化。这里是经典尺度框架,不表示所有现实量表恰好落入其中之一。
| 尺度 | 保留的主要信息 | 合理重编码示意 | 本例 |
|---|---|---|---|
| 名义 | 相同或不同 | 类别的一一改名 | 东室、西室 |
| 顺序 | 类别及次序 | 严格递增的等级编码 | 低、中、高 |
| 区间 | 次序与相等差值 | 摄氏与华氏温标 | |
| 比率 | 差值与非零量之间的比 | 分钟与秒的时长 |
尺度回答“数值代表什么”,抽样设计回答“从谁那里获得数据”,统计模型回答“哪些随机关系足以支持推断”。三者都影响方法选择。四个时间数字不能因为是比率尺度,就自动视为相互独立、代表所有读者;四级选项也可以作为分类变量进入回归模型。
S. S. Stevens在1946年的论文中系统提出这套四类尺度框架,见原论文出版记录。Velleman与Wilkinson在1993年的原始方法论讨论指出,将这套分类机械地用作统计方法的准入规则会忽略分析目的与模型条件。本条的重编码计算用于检查解释是否一致,不取代对实际测量过程的研究。
两个有解答的变式
变式一:把舒适等级改成0、5、6,还是顺序编码吗?平均分是多少,能否与原均值2直接比较?
解答:它仍保持低<中<高。四个分数为0、5、5、6,均值4。原均值2与新均值4不能直接解释为舒适度翻倍;众数和中间等级仍为“中”。
变式二:为保护隐私,把所有停留分钟统一加100再发布。D的记录变140,A变110,可以说D停留是A的 倍吗?
解答:不可以。这个公开字段的零点已移走,读数比没有保留原时长比;若知道平移量,应先减100,得到 。二者相差30分钟的结论则仍可由 直接得到。
参考来源与后续
- OpenStax,Introductory Statistics 2e,§1.3:频数与测量尺度。
- S. S. Stevens,On the Theory of Scales of Measurement,Science 103,677–680,1946。
- Paul F. Velleman、Leland Wilkinson,Nominal, Ordinal, Interval, and Ratio Typologies are Misleading,The American Statistician 47(1),65–72,1993:关于尺度分类与统计方法选择的原始讨论。
- 统计图说明如何按变量意义作图;方差与标准差继续追踪单位变化对离散程度的影响;统计推断讨论样本之外的结论需要哪些条件。