概率与统计第 2 章
Descriptive Statistics
本章目录
一列数字还不算是对任何东西的描述。这一章把原始数据变成一小组图和数字,说出数据实际上是什么样子:它的形状、中心和离散程度。每一个工具都建立在上一个之上,从开始,一直到章末的。
解读直方图:数据堆在哪里
直方图(histogram)把的数值按等宽的区间分组,每个区间叫做一个组(bin),然后在每一组上画一个直条,高度是该组所含数值的个数或比例。
检查两件事:直条彼此相接,因为各组在同一条连续的尺度上共用边界;直条的高度表示频数,从来不是原始数值本身。茎叶图、折线图或条形图也可以显示数据,但只有直方图会这样把取值范围很大的定量变量分组。
一个训练营记录了 60 名学员的完成时间,以小时计(假设的例子)。分到等宽的组之后,大部分直条聚集在中段,另有一两个较矮的直条伸向一边:这正是直方图存在的目的,在算出任何一个数字之前,先让你一眼看到这个形状。
“直方图不过是条形图,所以直条可以随便重新排列,怎么好看就怎么排。” 条形图的类别本身没有次序,直条是分开画的;直方图的组是数值,次序固定,而且彼此相接,因为次序本身就是这张图要显示的一部分。“最高的直条显示的是最常见的那一个值。” 它显示的是数值最多的那一组,而一组可以包含许多不同的值:直方图牺牲了个别的值,换来对数据整体形状的一览。
百分位数与四分位数:一个值在数据中的位置
第 p 百分位数(p-th percentile)是这样一个值:有百分之 p 的数据落在它以下。四分位数(quartile)是把已排序的数据切成四个大小相等的组的那三个百分位数:(第 25 百分位数)、中位数(第 50)和 (第 75)。
先把数据排序:在未排序的列表上,百分等级没有意义。要定位一个值,问已排序的数据有多大比例落在它或它以下,而不是问它本身有多大。四分位距(interquartile range),,衡量中间一半数据的宽度;一个值若低于 或高于 超过 ,就会被标记为可能的异常值(outlier)。
一次假设的分班考试以百分位数报告成绩。一个成绩位于第 40 百分位数,意思是 40% 的考生得分等于或低于它:大部分考生的得分都比它高,虽然 40 在 100 之中听起来很中等。
“考到第 90 百分位数,就等于答对了 90% 的题目。” 百分等级是拿你跟其他考生比较,不是跟满分比较:只要其他人考得更低,第 90 百分位数的成绩可以只是原始分数 65%。“ 和 跟中位数的距离永远相等。” 只有对称的数据才是这样:四分位数由位次定义,不是由距离定义,所以偏向一边的数据往往在一边伸得更远。
箱线图:五个数字,一张图
箱线图(box plot,又称箱形图或 box-and-whisker plot)把一组数据的五数概括(five-number summary),即最小值、、中位数、、最大值,画成一张图:一个从 到 的箱,箱内在中位数处画一条线,再从箱向两端伸出须(whisker)至最小值和最大值。约翰·图基(John Tukey)在 1977 年的一本书中让这种图普及起来。
箱的宽度就是,箱内是中间一半的数据;它显示这一半从哪里开始、到哪里结束,不是里面有多少个点。中位数线在箱内偏离中央,或者一边的须比另一边长得多,都在做任何算术之前就标示出一个偏向一边的分布。
一家补习班(假设的例子)抽取了 9 名学生作为样本,记录他们在小测验前用闪卡复习的分钟数:12、15、18、20、22、25、28、33 和 60,其中一名学生复习的时间远比其他人长。下面的例题详解逐步画出它的箱线图。
- 把数据排序。 12、15、18、20、22、25、28、33、60(已经排好序;)。
- 找中位数。 是奇数,所以中位数是中间(第 5 个)的值:22。
- 找 。 较低的四个值(12、15、18、20)的中位数: 。
- 找 。 较高的四个值(25、28、33、60)的中位数: 。
- 写出五数概括。 最小值 、、中位数 、、 最大值 ;箱从 16.5 画到 30.5,中位数线画在 22,须伸到 12 和 60。
常见失误:分成两半之前忘了重新排序;以及 是奇数时把中位数本身同时算进两半,使 和 移位。
“箱越宽,就说明里面塞了越多数据。” 和直方图不同:箱的宽度显示中间一半的数据有多分散,不是那里有多少个点;箱线图完全不带任何频数信息。“箱里面那条线是平均数。” 那是中位数;标准的箱线图不标平均数,而当数据偏态时,平均数可以落在箱外很远的地方。
平均数、中位数与众数:三种中心
平均数(mean)是把每一个值加起来再除以个数,样本的写作 ,总体的写作 。中位数(median)是已排序数据的中间值,个数是偶数时则是中间两个值的平均。众数(mode)是出现最多次的值;一组数据可以没有众数,也可以有一个或几个。
平均数用到每一个值的大小,所以一个极端值会把它拉动;中位数只用位次,几乎不动。没有任何值重复时,这组数据就没有众数:这是一个有效的描述,不是数据有缺口。
上面里的同一批 9 名学生,分别花了 12、15、18、20、22、25、28、33 和 60 分钟。平均数是 ;中位数,即排序后第 5 个值,是 22。九个分钟数各不相同,所以没有众数。
“平均数永远是最好的集中趋势度量,所以永远都该报告它。” 这里的平均数 25.9 被那名学生的 60 分钟拉高,比其他所有值都大,只有一个值例外;中位数 22 则更能代表一名典型的学生。两者都没有错,但挑一个看起来更好的来报告,就是不诚实。“每组数据都恰好有一个众数。” 一组数据可以像这里一样没有众数,也可以有一个,或者有几个同样常见的值。
偏态:当尾部把平均数拉走
一个分布的一条尾部比另一条伸得更远时,这个分布就是偏态(skewed)的;两条都没有伸得更远时,就是对称(symmetric)的。偏态把拉向长尾那边,而中位数会抵抗这种拉力,所以两者之间的差距就把偏态显示了出来。
先找出较长的尾部,再按它命名偏态:尾部向右伸就是右偏,向左伸就是左偏。里偏离中央的中位数,往往是最先看得见的迹象。右偏的数据平均数通常大于中位数,左偏的数据通常相反;OpenStax 指出,这只是一个概括,在某些离散数据集上可能不成立。
回到那 9 名学生: 25.9 在中位数 22 之上,被那一个 60 分钟的异常值拉高了。这是一个右偏的:长尾在右,大部分学生挤在低的一端。
“右偏就是大部分数据在右边。” 正好相反:在右边的是尾部,不是大部分数据;大部分的值和众数都在低的一边,也就是直条最高的地方。“就算数据偏态,平均数仍然是最有代表性的度量。” 偏态正是把平均数从大部分数据所在之处拉走的东西;抵抗这种拉力,正是中位数的职责。
标准差与方差:衡量离散程度
标准差(standard deviation)衡量数据值与之间的典型距离,以数据本身的单位计;方差(variance)是同一个概念在开平方根之前的平方单位版本。样本用 ,除以 ;总体用 ,除以 。
问一个离平均数“典型”的距离是什么样子,而不只是问两个极端值之间的距离:标准差用到每一个值,所以一个离得远的点会让它移动,但远不及它让极差(range)移动得那么多。两组数据可以平均数相同、极差相同,标准差却相差很远。
同一批 9 名学生的分钟数给出 。下面的例题详解逐步算出样本标准差 。
- 求平均数。 。
- 求每个偏差并取平方。 例如 ,平方后 ;对全部九个值重复做一次。
- 把偏差平方加起来。 。
- 除以 。 ,这就是样本方差。
- 开平方根。 分钟。
常见失误:样本除以 而不是 ,使 偏小。
“标准差较大,只是说那些数字本身较大。” 数值大小和离散程度是两回事:90 多分的考试分数,值与值之间的变化可以比 20 多岁的年龄更大。“标准差和极差衡量的基本上是同一件事。” 极差只用两个极端值;标准差用到每一个值,所以一个偏离的点会让极差大幅移动,让标准差只是轻微移动。
从头到尾描述一组数据综合运用
把九名学生用闪卡复习的分钟数放进本章每一个工具,它们讲的是同一个故事。许多这样的样本画成,会在低的一端显出一个高耸的堆,向高的一端则是一条渐渐变薄的尾部。 16.5 和 30.5 把中间一半框住;由它们画出的显示中位数线靠近箱的低边而不是高边,这是在做任何算术之前偏态的视觉线索。 25.9 和 22 相差接近四分钟,那个差距就是化成数字的:那一个 60 分钟的异常值把平均数拉向尾部,中位数则纹丝不动。大约 14.3 分钟,说的是一名典型学生的时间离那个被拉高的平均数有多远;如果手上还没有形状、中心和四分位数,这个数字几乎没有意思。这里没有一张图能代替数字,也没有一个数字能代替图;只有两者一致,一组数据才算描述完整。
资料来源
- 1 OpenStax Introductory Statistics §2.1: Stem-and-Leaf Graphs (Stemplots), Line Graphs, and Bar Graphs — 来源
- 2 OpenStax Introductory Statistics §2.2: Histograms, Frequency Polygons, and Time Series Graphs — 来源
- 3 OpenStax Introductory Statistics §2.3: Measures of the Location of the Data — 来源
- 4 OpenStax Introductory Statistics §2.4: Box Plots — 来源
- 5 OpenStax Introductory Statistics §2.5: Measures of the Center of the Data — 来源
- 6 OpenStax Introductory Statistics §2.6: Skewness and the Mean, Median, and Mode — 来源
- 7 OpenStax Introductory Statistics §2.7: Measures of the Spread of the Data — 来源
- 8 Wickham & Stryjewski, "40 Years of Boxplots" (on John Tukey's 1977 introduction of the box plot) — 来源
- 9 R stats::quantile documentation — nine quantile types after Hyndman & Fan (1996); type 7 is R's default — 来源
- 10 NIST/SEMATECH e-Handbook of Statistical Methods §1.3.3.7: Box Plot (the fence-based box plot is a variation; whiskers end at the farthest observations inside the inner fences) — 来源
- 11 R graphics::boxplot documentation (default range = 1.5; whiskers end at the most extreme data point within range and outliers are drawn as points) — 来源
- 12 Matplotlib 3.11.1 pyplot.boxplot documentation (default whis = 1.5; whiskers end at the farthest data within the cutoff and values beyond are plotted as outliers) — 来源