---
title: "拆穿数据胡扯：1954 年的一本书，今天依然管用"
description: "Darrell Huff 用一本小册子教会普通人看穿被操纵的数据。没有公式，只有一双训练过的眼睛。"
date: "2026-08-26"
type: "notes"
kind: "note"
series: "data-judgment"
tags:
  - 数据
  - 统计学
  - 批判性思维
  - 图表
  - 媒体
---

**《拆穿数据胡扯》**（How to Lie with Statistics）由 Darrell Huff 写于 1954 年，原由 Irwin 出版，中文译本 2013 年由中信出版社推出。这本书很薄，几十页，几乎看不到一个统计公式。Huff 本人干的是记者和自由撰稿人，靠写作吃饭，学院派的统计学他接触不多。这种出身恰恰是这本书最大的优势。他没有学院派的包袱，也不用先给读者上一门统计学导论，直接把手上那些被数据操纵的招数一个一个拆给你看。

这本书的核心态度写在开头那句话里。数据不会说谎，但拿数据的人来说谎。这句话在今天仍然值得反复读，因为社交媒体、自媒体、商业广告让数据操纵这件事比以前更密集，也更隐蔽。

## 相关性不等于因果

书里出现频率最高的一个道理是，两个数字一起变动，不代表一个导致另一个。

比如，数据显示冰淇淋销量高的月份，溺水事故也高。这两件事确实有相关性，但彼此之间没有因果链。它们共同的幕后推手是夏天。温度升高，买冰淇淋的人多了，下水游泳的人也多了，溺水自然跟着变多。

这个例子几乎成了数据素养入门的标配。它的价值不在于教了一个具体反例，而在于建立一种条件反射。以后看到任何"研究发现 X 和 Y 有关"的新闻，第一反应是多问一句，它们之间到底有没有因果链，还是只是恰好一起变。

## 被截断的 Y 轴

图表是最容易下手的地方。Huff 花了不少篇幅讲图表怎么骗人，其中最经典的一招是被截断的 Y 轴。

正常的柱状图，Y 轴从零开始。这样两根柱子的高度差就是它们真实的比例。但如果把 Y 轴从中间某个数字开始，两根高度几乎一样的柱子，视觉上看起来差距可以差出一倍。数据本身没有变，只是坐标轴的起点挪了一下，结论就完全变了。

现在打开任何一篇商业稿、任何一篇竞选宣传稿，这种手法几乎无处不在。读者看到两根柱子一高一矮，大脑自动补上"差了一倍"的故事，没人去仔细看坐标轴从几开始。

Huff 还举了一个关于平均数的例子。把比尔·盖茨放进一个普通工薪族的房间，这个房间的"平均"身价立刻变成亿万级别，但房间里 99% 的人实际还是普通工薪阶层。均值被极端值拽偏了，用一个数字概括一整群人，有时候比不用还误导。

## 抽样的陷阱

Huff 反复强调一件事，抽样的质量决定了结论的可信度，而抽样这件事，外人几乎看不出来。

如果你调查的是自愿填表的人，那你得到的其实是"愿意填表的那一小撮人的意见"，跟真正代表大众的那个数字差得可以天翻地覆。1936 年美国总统大选，《文学文摘》杂志用电话簿和车主名单抽样，预测 Alf Landon 会大胜 Franklin Roosevelt，结果 Roosevelt 以压倒性优势连任。问题就出在抽样池本身有系统偏差，30 年代拥有电话和中产家庭更支持 Landon，样本从一开始就歪了。

"随机"这两个字听起来理所当然，实际上要做到真正的随机抽样，门槛不低。一个看起来严谨的调查，如果抽样这一步没做对，后面所有分析都是建立在歪地基上的。

## 和《度量一切》放在一起看

Huff 这本书和 Douglas Hubbard 的《度量一切》恰好互补。Huff 关注的是数据被人操纵之后怎么识破，训练的是"别人拿数据来，你怎么不被骗"。Hubbard 关注的是那些根本没有数据的情况怎么迈出第一步，训练的是"你自己没数据，你怎么开始度量"。

一个人如果只读 Huff，会变得很会挑别人数字的毛病，但面对自己没数据的局面仍然束手无策。如果只读 Hubbard，会学会怎么把模糊的东西变成数字，但可能忽略这些数字本身也可能被精心裁剪。两条腿走路才稳。

## 70 年后为什么还值得读

这本书 1954 年出版，到现在已经七十多年。数据的形式变了，从报纸上的统计图表变成了网页上的可视化、短视频里的信息图、AI 生成的分析报告。但操纵数据的手法没有本质变化，截断坐标轴、挑有利数据、混淆相关和因果、抽样偏差，这些老把戏只是换了更精美的外壳。

Huff 的书之所以七十年后还能用，是因为它不在教具体的统计方法，而在教一种看数据的反应。这种反应一旦练出来，以后不管数据用什么形式出现，你都会下意识多问一句。

## 关联词

- **拆穿数据胡扯**，Darrell Huff 1954 年所著，用大白话教普通人识破被操纵的数据。
- **相关性 ≠ 因果**，两个数据一起变动不代表一个导致另一个，书里反复强调的核心原则。
- **截断的 Y 轴**，从中间开始画坐标轴，让差距在视觉上被放大。
- **抽样偏差**，样本不是随机取的，结论就一定是歪的。
- **平均数被极值拽偏**，一个极端值就能让"平均"变得毫无代表性。

## 小结

《拆穿数据胡扯》真正留给读者的是一双被训练过的眼睛。读这本书之前，你看到的每一个数字都是结论。读完之后，每个数字背后都藏着一个问题，这个数据怎么来的，样本怎么选的，图表从哪里开始画的，谁挑了这些数字。这种"多问一句"的习惯，是这本书最有价值的部分。

## 参考资料

- [Wikipedia: How to Lie with Statistics](https://en.wikipedia.org/wiki/How_to_Lie_with_Statistics)
- [Wikipedia: Darrell Huff](https://en.wikipedia.org/wiki/Darrell_Huff)
- [度量一切 笔记](/notes/how-to-measure-anything/)