1.截断坐标轴——让小差异看起来很大
条形图中条形的高度,是为了让人用眼睛比较数值的大小。可是如果纵轴不从 0 开始,条形高度的比例就和实际数值的比例不一样了,小小的差异会看起来像好几倍的差距。
截断纵轴并不总是错的。像体温、股价这类不会降到 0 附近的数值,在观察小幅变化的折线图中常常截断坐标轴。问题在于,一边让人用条形的长度比较大小,一边又截断了坐标轴。看到图表时,先确认纵轴的起始值和刻度。
- 第1步:图上看到的条形高度:A 是 100 − 98 = 2格,B 是 104 − 98 = 6格。
- 第2步:看起来的比例:6 ÷ 2 = 3倍。
- 第3步:实际比例:104 ÷ 100 = 1.04,也就是 B 只比 A 高 4%。
- 验算:如果纵轴从 0 开始画,条形高度是 100 和 104,用眼睛几乎分辨不出差别。
2.相关不等于因果
两个数值一起升降,叫作相关关系。夏天冰淇淋销量增加,溺水等戏水事故也增加。两者之间有明显的相关,但并不是冰淇淋引发了事故,而是气温这个第三方因素同时推动了两者。这种隐藏的因素叫作混杂变量。
把相关解读为因果之前,先问三个问题:有没有隐藏的共同原因?原因和结果的方向会不会正好相反(是运动的人更健康,还是健康的人更爱运动)?会不会只是巧合?确认因果最可靠的方法,是比较随机分成的两组的实验,但并不是任何时候都能做这样的实验。
- 共同原因:气温 → 冰淇淋销量,气温 → 戏水事故
- 方向相反:“常去医院的人病得更重”——其实是因为生病才去医院
- 巧合:两个毫不相关的统计数据,只要挑好时间段,也可能走势相似
3.样本偏差——问的是谁
不可能调查全部对象,所以抽取一部分(样本)来推断整体。这时如果样本不像整体,收集得再多,结果也是偏的。只在某个应用程序里做的问卷,反映的是使用这个程序的人的意见;只收集自愿作答者的问卷,更接近对这个话题很感兴趣的人的意见。
只看幸存下来的对象,也是一种样本偏差。“成功人士都早起”这句话,漏掉了那些早起却没有成功的人。看数据时,要先于数字问一问:“是谁、怎样被选出来的,又漏掉了谁?”很多时候,抽样方法比样本大小更重要。
AI也面临同样的问题。训练数据偏向某个群体,AI的判断也会偏向那一边。「人工智能基础」课程中讲到的数据偏差,正是这种样本偏差。
4.比率与绝对数,相对变化与绝对变化
把人口 100 万的城市和人口 10 万的城市的事故数直接比较,大城市总是显得更多。要公平比较,就得换算成同一基准的比率,比如每 10 万人的事故数。反过来,只看比率而忽略绝对数,就会误判实际规模。
“风险增加了一倍”这句话也藏着同样的问题。相对变化(两倍,增长 100%)听起来很大,但如果原来的风险非常小,绝对变化可能微乎其微。两者要一起看,才能做出判断。
- 第1步:城市 A:500 ÷ 1,000,000 × 100,000 = 50起。
- 第2步:城市 B:100 ÷ 100,000 × 100,000 = 100起。
- 第3步:按绝对数,A 是 B 的 5 倍;但按人口比例,B 是 A 的 2 倍。
- 验算:A 有 10 个“10万人”,500 ÷ 10 = 50;B 只有 1 个,所以是 100。结果相同。
- 第1步:相对变化:(4 − 2) ÷ 2 = 1 → 增长 100%(两倍)。
- 第2步:绝对变化:从 2 ÷ 10,000 = 0.02% 增加到 4 ÷ 10,000 = 0.04%,增加了 0.02 个百分点。
- 验算:0.04 − 0.02 = 0.02 个百分点,相当于每 10,000 人中多出 2 人。
5.平均数与合并统计的陷阱
平均水深 1 m 的河能蹚过去吗?如果岸边很浅、中间有 3 m 深,平均数即使是 1 m 也过不去。平均数不会告诉你分散程度和最大值。正如第8讲所讲,平均数旁边要同时放上中位数和分散程度。
合并起来看的结果和分开看的结果,也可能正好相反。这叫作辛普森悖论。在下面的例子中,医院 X 无论是简单手术还是困难手术,成功率都比 Y 高,可合在一起看,Y 却显得高得多。这是因为 X 承担了多得多的困难手术。
| 简单手术 | 困难手术 | 总体 | |
|---|---|---|---|
| 医院 X | 9/10(90%) | 30/90(约 33%) | 39/100(39%) |
| 医院 Y | 85/100(85%) | 3/10(30%) | 88/110(80%) |
- 第1步:X 总体:(9 + 30) ÷ (10 + 90) = 39 ÷ 100 = 39%。
- 第2步:Y 总体:(85 + 3) ÷ (100 + 10) = 88 ÷ 110 = 80%。
- 第3步:X 的 100 名患者中有 90 名做的是困难手术,Y 的 110 名中只有 10 名做困难手术。总体成功率在很大程度上受到各医院所接诊患者构成的影响。
- 验算:简单手术 90% > 85%,困难手术约 33.3% > 30%,两组都是 X 更高。可是总体却是 39% < 80%。
📌 要点总结
- 条形图的纵轴不从 0 开始,差异就会被放大
- 相关关系不等于因果关系——先怀疑共同原因、方向和巧合
- 样本的抽取方法比大小更重要——要问漏掉了谁
- 把绝对数与比率、相对变化与绝对变化放在一起看
- 仅凭一个平均数看不出分散程度,合并的结果可能和分开的结果相反
🤖 可以这样问 AI
复制后把 [ ] 部分换成你的情况。不要直接相信回答,请与正文对照核实。
想批判性地阅读新闻或报告中的图表时
请看下面的图表(或数据)说明,用检查清单逐项指出可能存在的问题:截断坐标轴、基准(分母)、样本偏差、相关与因果、比率与绝对数、合并统计的陷阱。每一项还要写明,要确认它需要哪些补充信息。内容:[粘贴]
想练习识别图表陷阱时
请用虚构的数字设计 5 个容易引起误解的图表说明。先不要说每个里面藏着什么陷阱,等我找出来之后,再给出答案和正确的计算。请务必标注“举例”,不要让它们看起来像真实统计。
收到AI生成的数据摘要时
请说明刚才摘要中每个数字的出处和基准(以什么作分母)。无法核实出处的数字请单独标出。
- 高中数学教材的一般内容(统计、抽样调查)
- 基础统计学教材的一般说明(相关与因果、辛普森悖论)
达成全部学习目标后,请点击完成。
此浏览器无法保存记录,仅在当前页面显示。