采集到大量的样本数据以后,常常需要用一些统计量来描述数据的集中程度和离散程度,并通过这些指标来对数据的总体特征进行归纳。[大谦Excel,dqexcel点com]
描述集中趋势
描述样本数据集中趋势的统计量有算术平均值、中值、众数、几何均值、调和均值和截尾均值等。
算术平均值是将所有数据求和后用和除以数据个数。中值是数据的中位数,即0.5分位数。排序后位置在中间。众数是数据中出现次数最多的数。
样本数据的几何均值m可以根据下式求得:
样本数据的调和平均值定义为:
截尾均值是数据排序后,将最大和最小部分删除指定百分比的数据后剩下的数据求算术平均值。
对图9-8所示工作表中A列数据求集中趋势统计量。
图9-8 描述数据的集中趋势
【Excel】
示例文件的存放路径为Samples\ch21\Excel函数\描述性统计-集中趋势.xlsx。
在工作表中,在D2单元格中输入公式:=AVERAGE(A2:A85),回车,得到数据的算术平均值143.7738。
在D3单元格中输入公式:=MEDIAN(A2:A85),回车,得到数据的中值143.5。
在D4单元格中输入公式:=MODE(A2:A85),回车,得到数据的众数142。
在D5单元格中输入公式:=GEOMEAN(A2:A85),回车,得到数据的几何均值143.6506。
在D6单元格中输入公式:=HARMEAN(A2:A85),回车,得到数据的调和均值143.5264。
在D7单元格中输入公式:=TRIMMEAN(A2:A85),回车,得到数据的截尾均值143.8。
各计算结果如图9-8中所示。
【Excel VBA, Python xlwings】
仿照9.3.3小节,可在Excel VBA和Python xlwings环境下实现对应的统计量计算,不再赘述。
【Python pandas】
使用Series对象的mean和median函数可以计算数据的均值和中值。
描述离中趋势
描述样本数据离散趋势的统计量包括极差、方差、均值绝对差、标准差和内四分极值等。极差等于数据的最大值减去最小值。均值绝对差等于各数据与数据均值的差的绝对值的均值。内四分极值等于0.75分位数减去0.25分位数。
对图9-9所示工作表中A列数据求离中趋势统计量。
图9-9 描述数据的离中趋势
【Excel】
示例文件的存放路径为Samples\ch21\Excel函数\描述性统计-离中趋势.xlsx。
在工作表中,在D2单元格中输入公式:=MAX(A2:A85)-MIN(A2:A85),回车,得到数据的极差32。
在D3单元格中输入公式:=VAR(A2:A85),回车,得到数据的方差35.64702。
在D4单元格中输入公式:=AVEDEV(A2:A85),回车,得到数据的均值绝对差4.630952。
在D5单元格中输入公式:=STDEV(A2:A85),回车,得到数据的标准差5.970512。
在D6单元格中输入公式:
=PERCENTILE.EXC(A2:A85,0.75)-PERCENTILE.EXC(A2:A85,0.25)
回车,得到数据的内四分极值8。
各计算结果如图9-9中所示。
【Excel VBA, Python xlwings】
仿照9.3.3小节,可在Excel VBA和Python xlwings环境下实现对应的统计量计算,不再赘述。
【Python pandas】
使用Series对象的max, min, var, std, mad和quantile等函数可以计算数据的极值、方差、标准差、均值绝对差和内四分极值。[大谦Excel,dqexcel点com]