概率与统计第 2 章

Descriptive Statistics

6 个概念

本章目录

一列数字还不算是对任何东西的描述。这一章把原始数据变成一小组图和数字,说出数据实际上是什么样子:它的形状、中心和离散程度。每一个工具都建立在上一个之上,从开始,一直到章末的

解读直方图:数据堆在哪里

定义

直方图(histogram)把的数值按等宽的区间分组,每个区间叫做一个组(bin),然后在每一组上画一个直条,高度是该组所含数值的个数或比例

怎么判断

检查两件事:直条彼此相接,因为各组在同一条连续的尺度上共用边界;直条的高度表示频数,从来不是原始数值本身。茎叶图、折线图或条形图也可以显示数据,但只有直方图会这样把取值范围很大的定量变量分组。

例子

一个训练营记录了 60 名学员的完成时间,以小时计(假设的例子)。分到等宽的组之后,大部分直条聚集在中段,另有一两个较矮的直条伸向一边:这正是直方图存在的目的,在算出任何一个数字之前,先让你一眼看到这个形状。

误区

“直方图不过是条形图,所以直条可以随便重新排列,怎么好看就怎么排。” 条形图的类别本身没有次序,直条是分开画的;直方图的组是数值,次序固定,而且彼此相接,因为次序本身就是这张图要显示的一部分。“最高的直条显示的是最常见的那一个值。” 它显示的是数值最多的那一组,而一组可以包含许多不同的值:直方图牺牲了个别的值,换来对数据整体形状的一览。

百分位数与四分位数:一个值在数据中的位置

定义

第 p 百分位数(p-th percentile)是这样一个值:有百分之 p 的数据落在它以下四分位数(quartile)是把已排序的数据切成四个大小相等的组的那三个百分位数:Q1Q_1(第 25 百分位数)、中位数(第 50)和 Q3Q_3(第 75)。

怎么判断

先把数据排序:在未排序的列表上,百分等级没有意义。要定位一个值,问已排序的数据有多大比例落在它或它以下,而不是问它本身有多大。四分位距(interquartile range),IQR=Q3Q1IQR = Q_3 - Q_1,衡量中间一半数据的宽度;一个值若低于 Q1Q_1 或高于 Q3Q_3 超过 1.5×IQR1.5 \times IQR,就会被标记为可能的异常值(outlier)

例子

一次假设的分班考试以百分位数报告成绩。一个成绩位于第 40 百分位数,意思是 40% 的考生得分等于或低于它:大部分考生的得分都比它高,虽然 40 在 100 之中听起来很中等。

误区

“考到第 90 百分位数,就等于答对了 90% 的题目。” 百分等级是拿你跟其他考生比较,不是跟满分比较:只要其他人考得更低,第 90 百分位数的成绩可以只是原始分数 65%Q1Q_1Q3Q_3 跟中位数的距离永远相等。” 只有对称的数据才是这样:四分位数由位次定义,不是由距离定义,所以偏向一边的数据往往在一边伸得更远。

进一步说明

当你的计算器算出不同的答案。 计算四分位数有几种标准方法:统计软件实现了其中九种,依 Hyndman 和 Fan(1996)的整理编目。本书取每一半的中位数,这样算,本章通篇使用的九个复习时间得出 Q1=16.5Q_1 = 16.5Q3=30.5Q_3 = 30.5。R 的默认方法则在相邻的值之间插值,在完全相同的数据上得出 18 和 28。两个结果都没有错,差异也不在数据,而在定义。所以当一个工具跟这里的例题详解不一致时,先看它用的是哪一种四分位数计算方法,再去找算术上的错误。

箱线图:五个数字,一张图

定义

箱线图(box plot,又称箱形图或 box-and-whisker plot)把一组数据的五数概括(five-number summary),即最小值、Q1Q_1、中位数、Q3Q_3、最大值,画成一张图:一个从 Q1Q_1Q3Q_3 的箱,箱内在中位数处画一条线,再从箱向两端伸出须(whisker)至最小值和最大值。约翰·图基(John Tukey)在 1977 年的一本书中让这种图普及起来

怎么判断

箱的宽度就是,箱内是中间一半的数据;它显示这一半从哪里开始、到哪里结束,不是里面有多少个点。中位数线在箱内偏离中央,或者一边的须比另一边长得多,都在做任何算术之前就标示出一个偏向一边的分布。

例子

一家补习班(假设的例子)抽取了 9 名学生作为样本,记录他们在小测验前用闪卡复习的分钟数:12、15、18、20、22、25、28、33 和 60,其中一名学生复习的时间远比其他人长。下面的例题详解逐步画出它的箱线图。

例题详解
  1. 把数据排序。 12、15、18、20、22、25、28、33、60(已经排好序;n=9n = 9)。
  2. 找中位数。 nn 是奇数,所以中位数是中间(第 5 个)的值:22。
  3. Q1Q_1 较低的四个值(12、15、18、20)的中位数: (15+18)/2=16.5(15+18)/2 = 16.5
  4. Q3Q_3 较高的四个值(25、28、33、60)的中位数: (28+33)/2=30.5(28+33)/2 = 30.5
  5. 写出五数概括。 最小值 =12=12Q1=16.5Q_1=16.5、中位数 =22=22Q3=30.5Q_3=30.5、 最大值 =60=60;箱从 16.5 画到 30.5,中位数线画在 22,须伸到 12 和 60。

常见失误:分成两半之前忘了重新排序;以及 nn 是奇数时把中位数本身同时算进两半,使 Q1Q_1Q3Q_3 移位。

上面的例题详解所用的同一组九名学生数据的五数概括:最小值、Q1、中位数、Q3、最大值,画成一张箱线图。
上面的例题详解所用的同一组九名学生数据的五数概括:最小值、Q1、中位数、Q3、最大值,画成一张箱线图。由 figures/fig-boxplot-anatomy.py 绘制
误区

“箱越宽,就说明里面塞了越多数据。” 和直方图不同:箱的宽度显示中间一半的数据有多分散,不是那里有多少个点;箱线图完全不带任何频数信息“箱里面那条线是平均数。” 那是中位数;标准的箱线图不标平均数,而当数据偏态时,平均数可以落在箱外很远的地方。

进一步说明

为什么软件画出来不一样。 按上一节的 1.5×IQR1.5 \times IQR 法则,这九个时间的上围栏(upper fence)在 30.5+21=51.530.5 + 21 = 51.5,所以按本章自己的法则,60 会被标记为可能的异常值。上面的箱线图仍然把须伸到它那里,因为五数概括把须定义为伸至最小值和最大值。NIST 将带围栏的箱线图称为一种有助于识别异常值的变体:内围栏(inner fences)是 Q11.5×IQRQ_1 - 1.5 \times IQRQ3+1.5×IQRQ_3 + 1.5 \times IQR 这些数值截点;须却停在仍在截点内最远的观测值。base R 的 boxplot()range = 1.5)和 Matplotlib 3.11.1 的 pyplot.boxplot()whis = 1.5)默认采用这种 Tukey 式法则,并把须以外的值画成异常值。在这九个值中,两者都算出 Q1=18Q_1=18Q3=28Q_3=28,上截点是 43;上须停在 33,60 则单独画出。这些是它们各自算出的四分位数,不是本章手算的 16.5 和 30.5。同一组数据因此会画出两张不同的图,而两张都正确:须的画法是一种选择,不是数据本身的事实。

平均数、中位数与众数:三种中心

定义

平均数(mean)是把每一个值加起来再除以个数,样本的写作 xˉ\bar{x},总体的写作 μ\mu中位数(median)是已排序数据的中间值,个数是偶数时则是中间两个值的平均众数(mode)是出现最多次的值;一组数据可以没有众数,也可以有一个或几个。

怎么判断

平均数用到每一个值的大小,所以一个极端值会把它拉动;中位数只用位次,几乎不动。没有任何值重复时,这组数据就没有众数:这是一个有效的描述,不是数据有缺口。

例子

上面里的同一批 9 名学生,分别花了 12、15、18、20、22、25、28、33 和 60 分钟。平均数是 xˉ=233/925.9\bar{x} = 233/9 \approx 25.9;中位数,即排序后第 5 个值,是 22。九个分钟数各不相同,所以没有众数。

误区

“平均数永远是最好的集中趋势度量,所以永远都该报告它。” 这里的平均数 25.9 被那名学生的 60 分钟拉高,比其他所有值都大,只有一个值例外;中位数 22 则更能代表一名典型的学生。两者都没有错,但挑一个看起来更好的来报告,就是不诚实。“每组数据都恰好有一个众数。” 一组数据可以像这里一样没有众数,也可以有一个,或者有几个同样常见的值。

偏态:当尾部把平均数拉走

定义

一个分布的一条尾部比另一条伸得更远时,这个分布就是偏态(skewed)的;两条都没有伸得更远时,就是对称(symmetric)的。偏态把拉向长尾那边,而中位数会抵抗这种拉力,所以两者之间的差距就把偏态显示了出来

怎么判断

先找出较长的尾部,再按它命名偏态:尾部向右伸就是右偏,向左伸就是左偏。里偏离中央的中位数,往往是最先看得见的迹象。右偏的数据平均数通常大于中位数,左偏的数据通常相反;OpenStax 指出,这只是一个概括,在某些离散数据集上可能不成立

例子

回到那 9 名学生: 25.9 在中位数 22 之上,被那一个 60 分钟的异常值拉高了。这是一个右偏的:长尾在右,大部分学生挤在低的一端。

三个模拟分布:左偏、对称和右偏,每个都标出平均数(红色虚线)和中位数(蓝色点线),显示偏态怎么把两者分开。
三个模拟分布:左偏、对称和右偏,每个都标出平均数(红色虚线)和中位数(蓝色点线),显示偏态怎么把两者分开。由 figures/fig-skewness-shapes.py 绘制这张图在 App 中可以互动操作。
误区

“右偏就是大部分数据在右边。” 正好相反:在右边的是尾部,不是大部分数据;大部分的值和众数都在低的一边,也就是直条最高的地方“就算数据偏态,平均数仍然是最有代表性的度量。” 偏态正是把平均数从大部分数据所在之处拉走的东西;抵抗这种拉力,正是中位数的职责。

标准差与方差:衡量离散程度

定义

标准差(standard deviation)衡量数据值与之间的典型距离,以数据本身的单位计;方差(variance)是同一个概念在开平方根之前的平方单位版本。样本用 ss,除以 n1n-1;总体用 σ\sigma,除以 NN

怎么判断

问一个离平均数“典型”的距离是什么样子,而不只是问两个极端值之间的距离:标准差用到每一个值,所以一个离得远的点会让它移动,但远不及它让极差(range)移动得那么多。两组数据可以平均数相同、极差相同,标准差却相差很远。

例子

同一批 9 名学生的分钟数给出 xˉ25.9\bar{x} \approx 25.9。下面的例题详解逐步算出样本标准差 ss

例题详解
  1. 求平均数。 xˉ=233/925.9\bar{x} = 233/9 \approx 25.9
  2. 求每个偏差并取平方。 例如 1225.9=13.912-25.9=-13.9,平方后 193\approx 193;对全部九个值重复做一次。
  3. 把偏差平方加起来。 (xxˉ)21,642.9\sum(x-\bar{x})^2 \approx 1{,}642.9
  4. 除以 n1n-1 s2=1,642.9/8205.4s^2 = 1{,}642.9 / 8 \approx 205.4,这就是样本方差。
  5. 开平方根。 s=205.414.3s = \sqrt{205.4} \approx 14.3 分钟。

常见失误:样本除以 nn 而不是 n1n-1,使 ss 偏小。

误区

“标准差较大,只是说那些数字本身较大。” 数值大小和离散程度是两回事:90 多分的考试分数,值与值之间的变化可以比 20 多岁的年龄更大“标准差和极差衡量的基本上是同一件事。” 极差只用两个极端值;标准差用到每一个值,所以一个偏离的点会让极差大幅移动,让标准差只是轻微移动。

两组模拟数据,平均数相同而标准差不同,并排画出,让较大的离散程度直接看得见,而不只是公式里一个较大的数字。
两组模拟数据,平均数相同而标准差不同,并排画出,让较大的离散程度直接看得见,而不只是公式里一个较大的数字。由 figures/fig-spread-comparison.py 绘制

从头到尾描述一组数据综合运用

把九名学生用闪卡复习的分钟数放进本章每一个工具,它们讲的是同一个故事。许多这样的样本画成,会在低的一端显出一个高耸的堆,向高的一端则是一条渐渐变薄的尾部。 16.5 和 30.5 把中间一半框住;由它们画出的显示中位数线靠近箱的低边而不是高边,这是在做任何算术之前偏态的视觉线索。 25.9 和 22 相差接近四分钟,那个差距就是化成数字的:那一个 60 分钟的异常值把平均数拉向尾部,中位数则纹丝不动。大约 14.3 分钟,说的是一名典型学生的时间离那个被拉高的平均数有多远;如果手上还没有形状、中心和四分位数,这个数字几乎没有意思。这里没有一张图能代替数字,也没有一个数字能代替图;只有两者一致,一组数据才算描述完整。

资料来源

  1. 1 OpenStax Introductory Statistics §2.1: Stem-and-Leaf Graphs (Stemplots), Line Graphs, and Bar Graphs来源
  2. 2 OpenStax Introductory Statistics §2.2: Histograms, Frequency Polygons, and Time Series Graphs来源
  3. 3 OpenStax Introductory Statistics §2.3: Measures of the Location of the Data来源
  4. 4 OpenStax Introductory Statistics §2.4: Box Plots来源
  5. 5 OpenStax Introductory Statistics §2.5: Measures of the Center of the Data来源
  6. 6 OpenStax Introductory Statistics §2.6: Skewness and the Mean, Median, and Mode来源
  7. 7 OpenStax Introductory Statistics §2.7: Measures of the Spread of the Data来源
  8. 8 Wickham & Stryjewski, "40 Years of Boxplots" (on John Tukey's 1977 introduction of the box plot)来源
  9. 9 R stats::quantile documentation — nine quantile types after Hyndman & Fan (1996); type 7 is R's default来源
  10. 10 NIST/SEMATECH e-Handbook of Statistical Methods §1.3.3.7: Box Plot (the fence-based box plot is a variation; whiskers end at the farthest observations inside the inner fences)来源
  11. 11 R graphics::boxplot documentation (default range = 1.5; whiskers end at the most extreme data point within range and outliers are drawn as points)来源
  12. 12 Matplotlib 3.11.1 pyplot.boxplot documentation (default whis = 1.5; whiskers end at the farthest data within the cutoff and values beyond are plotted as outliers)来源