1、第 3 章 统计整理,统计整理的一般问题,一. 数据审核二. 数据筛选三. 数据排序,数据的预处理,数据的审核检查数据中的错误数据的筛选找出符合条件的数据数据排序升序和降序寻找数据的基本特征,数据审核,数据审核原始数据(raw data), 审核的内容完整性审核检查应调查的单位或个体是否有遗漏所有的调查项目或指标是否填写齐全准确性审核检查数据是否真实反映客观实际情况,内容是否符合实际检查数据是否有错误,计算是否正确等,数据的审核原始数据(raw data),审核数据准确性的方法逻辑检查从定性角度,审核数据是否符合逻辑,内容是否合理,各项目或数字之间有无相互矛盾的现象主要用于对分类和顺序据的审核
2、计算检查检查调查表中的各项数据在计算结果和计算方法上有无错误主要用于对数值型数据的审核,数据的审核二手数据(second hand data),适用性审核弄清楚数据的来源、数据的口径以及有关的背景材料确定数据是否符合自己分析研究的需要时效性审核尽可能使用最新的数据确认是否必要做进一步的加工整理,数据筛选与排序,数据筛选(data filter),当数据中的错误不能予以纠正,或者有些数据不符合调查的要求而又无法弥补时,需要对数据进行筛选数据筛选的内容包括将某些不符合要求的数据或有明显错误的数据予以剔除将符合某种特定条件的数据筛选出来,而不符合特定条件的数据予以剔除,用Excel进行数据筛选,8名
3、学生的考试成绩数据,数据筛选(data filter),数据排序 (data rank),按一定顺序将数据排列,以发现一些明显的特征或趋势,找到解决问题的线索排序有助于对数据检查纠错,以及为重新归类或分组等提供依据在某些场合,排序本身就是分析的目的之一排序可借助于计算机完成,数据排序 (方法),分类数据的排序字母型数据,排序有升序降序之分,但习惯上用升序汉字型数据,可按汉字的首位拼音字母排列,也可按笔画排序,其中也有笔画多少的升序降序之分数值型数据的排序递增排序:设一组数据为x1,x2,xn,递增排序后可表示为:x(1)x(2)x(n),统计分组及统计表,一. 分组标志的选择与分组形式二. 频
4、数分布三. 统计表,分组标志的选择和分组形式,(一)按分组标志的性质不同,分为按品质标志分组和按数量标志分组,按品质标志分组示例,按数量标志分组示例,原始数据: 24, 26, 24, 21, 27, 27, 30, 41, 32, 38,组别Class,频数Frequency, 15 且 25,3, 25 且 35,5, 35 且 45,2,分组表按数量标志分组示例之二,(二)按分组标志的多少,有简单分组和复合分组1.简单分组表 :表的主词未经任何分组,仅列出总体各单位的名称或按时间顺序简单排列的统计表。,第四次人口普查我国三个直辖市的人口,简单表举例:,黄金和外汇储备,2.复合分组表:指表
5、的主词按两个以上的标志进行分组的统计表。,频数分布,分组方法,分组方法,单变量值分组(要点),1. 将一个变量值作为一组2. 适合于离散变量3. 适合于变量值较少的情况,举例:单项变量数列,按日产量分组 工人人数 比重 (件) (人) (%) 25 10 6 26 20 10 27 30 17 28 50 28 29 40 22 30 30 17 合计 180 100,组距分组 (要点),将变量值的一个区间作为一组适合于连续变量适合于变量值较多的情况需要遵循“不重不漏”的原则可采用等距分组,也可采用不等距分组,组距分组(步骤),确定组数:组数的确定应以能够显示数据的分布特征和规律为目的。在实际
6、分组时,可以按 Sturges 提出的经验公式来确定组数K,确定组距:组距(Class Width)是一个组的上限与下限之差,可根据全部数据的最大值和最小值及所分的组数来确定,即 组距( 最大值 - 最小值) 组数,统计出各组的频数并整理成频数分布表,组距分组(几个概念),1. 下限(low limit) :一个组的最小值2. 上限(upper limit) :一个组的最大值3. 组距(class width) :上限与下限之差4. 组中值(class midpoint) :下限与上限之间的中点值,组限:组距两端的数值 组限的确定: 突出质的差异 例:学习成绩60分、计划完成程度100% 互斥
7、性:确保每个数据只归入唯一组 完备性:包括全部原始数据,组限的确定,频数分布表的编制(例题分析),【例】某电脑公司2002年前四个月各天的销售量数据(单位:台)。试对数据进行分组。,频数分布表的编制(步骤),确定组数:根据 Sturges 提出的经验公式得组数K为:,确定各组的组距: 组距( 237 - 141) 10=9.6 10,用Excel制作频数分布表,等距分组表(上下组限重叠),等距分组表(上下组限间断),等距分组表(使用开口组),组距分组与不等距分组(在表现频数分布上的差异),等距分组各组频数的分布不受组距大小的影响可直接根据绝对频数来观察频数分布的特征不等距分组各组频数的分布受组
8、距大小不同的影响各组绝对频数的多少不能反映频数分布的实际状况需要用频数密度(频数密度=频数/组距)反映频数分布的实际状况,分组方法选择,选择等距分组还是不等距分组,主要根据研究的目的和观察值的特点决定。如果研究目的是要从数量上区分不同性质的类别,就必须根据被研究现象各类别在数量上的特点确定各组组距。如果所收集的原始数据中有极端值存在,为避免组数太多,分布特征无法详实的情况,也可能采用不等距分组,在数据分布密集的地方用较短组距,在数据分布疏散的地方采用较长组距。,举例:不等距分组的变量次数分配编制,某地区人口年龄分配情况 按年龄分组 人口数(万人) 1岁以下 2 17岁 12.2 718岁 24
9、.0 1825岁 14.8 2555岁 34.2 55岁以上 16.3 合计 103.5,某地区个人年收入额分配 按年收入额 各组所占百分比 分组(元) ( )05,000 23.95,00010,000 34.810,00015,000 20.115,00045,000 17.2845,00075,000 1.7475,000105,000 0.88105,000135,000 0.81135,000以上 0.48 合 计 100.00,变量数列的形式: 单项式数列、组距式数列 单:变量值变动幅度小,一个变量值为一组 组:变量值变动幅度大。 确定组距的大小、组数(全距组距)以尽量使各组间的差
10、异更明显化,变量数列(变量分布数列),例,例,组距变量数列 组 限 上限:各组中最大的变量值(每组的终点数值) 下限:各组中最小的变量值(每组的起点数值) 组中值 = (上限下限) / 2 = 下限 + 组距 / 2 组 距 = 该组上限 该组下限 全 距 = 最大变量值 最小变量值等距、不等距 等距:组距相等,标志值变动均匀。 不等距:组距不相等,标志值变动不均匀。,分组方法选择,组限的确定,闭口式、开口式 闭口式:有最大变量值,最小变量值 (最大组有上限,最小组有下限)。 开口式:最大组没上限或最小组没下限。 缺下限开口组组中值 = 该 组上限 邻组组距2 缺上限开口组组中值 = 该 组下
11、限 邻组组距2间断式、重叠式,例,统计表,一. 统计表的构成二. 统计表的设计,一、统计表的概念 统计表是用规范的表格来表现统计资料的一种形式。1.它是由纵横线交叉组成的一种表格,表格内所列的是整理后系统的统计资料。2.统计表一般采用开口式,即表的左右两条线不画。3.用统计表来显示统计资料,具有条理清晰、简明扼要的特点,便于从各方面进行比较、分析所表现的现象。,二.统计表的形式及结构1.总标题(也称统计表的名称),它用概括性的文字简单明了地说明统计资料的时间、基本内容和范围。一般写在表的上部中端。2. 横行标题反映统计表的主要项目,写在表的左方。3.纵栏标题是统计指标的名称,说明纵栏所列各项资
12、料的内容,写在表内右上方。,4.数字资料也称指标数值,它是统计表的具体内容,列在各横行标题和各纵栏标题的交叉处。任何一个具体数值都由横行标题和纵栏标题所限定。5.有些统计表还需要在下端增加注解,以说明资料的来源、某些指标数值的计算方法、填表单位和其他需要说明问题。,统计表的结构,行标题,列标题,数字资料,表头,附加,合理安排统计表的结构总标题内容应满足3W 要求数据计量单位相同时,可放在表的右上角标明,不同时应放在每个指标后或单列出一列标明表中的上下两条横线一般用粗线,其他线用细线通常情况下,统计表的左右两边不封口表中的数据一般是右对齐,有小数点时应以小数点对齐,而且小数点的位数应统一对于没有
13、数字的表格单元,一般用“”表示必要时可在表的下方加上注释,统计表的设计,统计表的设计(比较与选用),统计表的设计(比较与选用),选这个统计表,统计表的设计(比较与选用),统计数据的图示,一. 品质数据的图示二. 数量数据的图示,数据的整理与显示(基本问题),要弄清所面对的数据类型,因为不同类型的数据,所采取的处理方式和方法是不同的对分类数据和顺序数据主要是做分类整理对数值型数据则主要是做分组整理适合于低层次数据的整理和显示方法也适合于高层次的数据;但适合于高层次数据的整理和显示方法并不适合于低层次的数据,品质数据的整理与图示,一. 分类数据的整理与图示二. 顺序数据的整理与图示,分类数据的整理
14、与图示,分类数据的整理(基本过程),1. 列出各类别,3. 制作频数分布表4. 用图形显示数据,分类数据的整理(可计算的统计量),频数(frequency) :落在各类别中的数据个数比例(proportion) :某一类别数据占全部数据的比值百分比(percentage) :将对比的基数作为100而计算的比值比率(ratio) :不同类别数值的比值,分类数据整理频数分布表 (例题分析),【例】一家市场调查公司为研究不同品牌饮料的市场占有率,对随机抽取的一家超市进行了调查。调查员在某天对50名顾客购买饮料的品牌进行了记录,如果一个顾客购买某一品牌的饮料,就将这一饮料的品牌名字记录一次 。右边就是
15、记录的原始数据,用Excel制作频数分布表,分类数据的图示条形图(bar Chart),用宽度相同的条形的高度或长短来表示各类别数据的图形有单式条形图、复式条形图等形式主要用于反映分类数据的频数分布绘制时,各类别可以放在纵轴,称为条形图,也可以放在横轴,称为柱形图,分类数据的图示条形图 (例题分析),分类数据的图示饼图(pie Chart),也称圆形图,是用圆形及圆内扇形的角度来表示数值大小的图形主要用于表示总体或样本中各组成部分所占的比例,对于研究结构性问题十分有用绘制圆形图时,总体中各部分所占的百分比用圆内的各个扇形角度表示,这些扇形的中心角度,是按各部分数据百分比占3600的相应比例确定
16、的,分类数据的图示饼图 (例题分析),顺序数据的整理与图示,顺序数据的整理(可计算的指标),1. 累积频数(cumulative frequencies):各类别频数的逐级累加2. 累积频率(cumulative percentages):各类别频率(百分比)的逐级累加,顺序数据的频数分布表(例题分析),【例】在一项城市住房问题的研究中,研究人员在甲乙两个城市各抽样调查300户,其中的一个问题是:“您对您家庭目前的住房状况是否满意? 1非常不满意;2不满意;3一般;4满意;5非常满意。,顺序数据的频数分布表 (例题分析),顺序数据的图示累计频数分布图 (例题分析),甲城市家庭对住房状况评价的累
17、积频数分布,环形图(annular chart),环形图中间有一个“空洞”,总体中的每一部分数据用环中的一段表示环形图与圆形图类似,但又有区别圆形图只能显示一个总体各部分所占的比例环形图则可以同时绘制多个总体的数据系列,每一个总体的数据系列为一个环环形图可用于结构比较研究 环形图主要用于展示分类和顺序数据,环形图 (例题分析),数值型数据的图示,数值型数据的图示,分组数据直方图和折线图,分组数据直方图(histogram),用矩形的宽度和高度来表示频数分布的图形,实际上是用矩形的面积来表示各组的频数分布在直角坐标中,用横轴表示数据分组,纵轴表示频数或频率,各组与相应的频数就形成了一个矩形,即直
18、方图直方图下的总面积等于1,分组数据的图示(直方图的绘制),某电脑公司销售量分布的直方图,我一眼就看出来了,销售量在170180之间的天数最多!,分组数据直方图(直方图与条形图的区别),条形图是用条形的长度(横置时)表示各类别频数的多少,其宽度(表示类别)则是固定的直方图是用面积表示各组频数的多少,矩形的高度表示每一组的频数或百分比,宽度则表示各组的组距,其高度与宽度均有意义直方图的各矩形通常是连续排列,条形图则是分开排列条形图主要用于展示分类数据,直方图则主要用于展示数值型数据,分组数据折线图(frequency polygon),折线图也称频数多边形图是在直方图的基础上,把直方图顶部的中点
19、(组中值)用直线连接起来,再把原来的直方图抹掉折线图的两个终点要与横轴相交,具体的做法是第一个矩形的顶部中点通过竖边中点(即该组频数一半的位置)连接到横轴,最后一个矩形顶部中点与其竖边中点连接到横轴折线图下所围成的面积与直方图的面积相等,二者所表示的频数分布是一致的,分组数据的图示(折线图的绘制),折线图与直方图下的面积相等!,140,150,210,某电脑公司销售量分布的折线图,190,200,180,160,170,220,230,240,数值型数据的图示,时间序列数据线图,时间序列数据线图(line plot), 绘制线图时应注意以下几点时间一般绘在横轴,指标数据绘在纵轴图形的长宽比例要
20、适当,其长宽比例大致为10:7一般情况下,纵轴数据下端应从“0”开始,以便于比较。数据与“0”之间的间距过大时,可以采取折断的符号将纵轴折断,时间序列数据线图 (例题分析),【例】已知19912000年我国城乡居民家庭的人均收入数据如表。试绘制线图,时间序列数据线图 (例题分析),数值型数据的图示,多变量数据雷达图,显示多个变量的图示方法在显示或对比各变量的数值总和时十分有用假定各变量的取值具有相同的正负号,总的绝对值与图形所围成的区域成正比可用于研究多个样本之间的相似程度,多变量数据雷达图(radar chart), 设有n组样本S1,S2,Sn,每个样本测得P个变量X1,X2,Xp,要绘制
21、这P个变量的雷达图,其具体做法是,多变量数据雷达图(雷达图的制作),先做一个圆,然后将圆P等分,得到P个点,令这P个点分别对应P个变量,在将这P个点与圆心连线,得到P个幅射状的半径,这P个半径分别作为P个变量的坐标轴,每个变量值的大小由半径上的点到圆心的距离表示 再将同一样本的值在P个坐标上的点连线。这样,n个样本形成的n个多边形就是一个雷达图,多变量数据雷达图 (例题分析),【例】2000年我国城乡居民家庭平均每人各项生活消费支出构成数据如表。试绘制雷达图。,今天的主食是面包,多变量数据雷达图 (例题分析),数据类型及图示 (小结),本章小结,数据预处理的内容和目的分类和顺序数据的整理与显示方法数值型数据的整理与显示方法合理使用统计表用Excel作频数分布表和图形,结 束,