欢迎来到天天文库
浏览记录
ID:38359657
大小:200.91 KB
页数:5页
时间:2019-06-11
《SPSS异常值剔除》由会员上传分享,免费在线阅读,更多相关内容在行业资料-天天文库。
1、离群值(箱图/探索).值与框的上下边界的距离在1.5倍框的长度到3倍框的长度之间的个案。框的长度是内距。极端值(箱图).值距离框的上下边界超过3倍框的长度的个案。在回归模型诊断里面,一般称预测值与实际值的偏差为"残差",残差有几种表示方法:标准化残差,学生化残差等等,按照需要取一种残差,再按照某种标准取一个阀值来限定异常点,只要那个点的残差大于阀值,就可以认为它是异常点。data下拉菜单里有definevariableproperties,把变量选到右边的框里,点continue,在新窗口中有变量在样本中的所有取值,要定义某个值是异常值,就把相应的missing框勾上就ok啦
2、~~~然后再处理数据时这些值就已经被剔除,不参与分析了一、采用数据探索过程探测异常值 SPSS菜单实现程序为:主菜单-->“Analyze”-->“DescriptiveStatistics”-->“Explore……”选项-->“Statistics”按钮-->选中“Outliers”复选框。输出结果中将列出5个最大值和5个最小值作为异常的嫌疑值。一般数组应遵循正态分布,但一列数组中有可能会出现异常值,从而影响数据的方差和统计结果,因此挡在SPSS中输入数据后,首先要检查数据中是否存在异常值。方法如下:1.选择想要观察的数据,此处我们选择normal列中的数据进行查看2.
3、进入菜单栏中“分析”→“描述统计”→“探索”1.将“normal”数组放入因变量列表中2.点击“探索”窗口中的“统计量”,点掉“描述性”,选择“界外值”和“百分位数”3.点击“探索”窗口中“绘制”,选择“直方图”,去掉“茎叶图”1.选择结束后点击“探索”窗口“确定”查看结果:(1)百分位数图:百分位数百分位数5102550759095加权平均(定义1)normal16.817216.817217.839619.381026.028129.303929.3039Tukey的枢纽normal18.278419.381023.8990(2)以50%左右两个百分位数(即四分位数25和
4、75下方的加权平均值)的加权平均值计算最高和最低临界值,使用计算公式如下:Upper=Q3+(2.2*(Q3-Q1))Lower=Q1-(2.2*(Q3-Q1))此处Q3=26.0281,Q1=17.8396计算后,Upper=44.0428,Lower=-0.1751(3)查看“极值”表格:极值案例号值normal最高12029.3022229.3032429.3044629.3054729.30a最低18116.8227816.8237516.8245716.8255416.82ba.上限值表中仅显示一部分具有值29.30的案例。b.下限值表中仅显示一部分具有值16.82
5、的案例。如果有最高值查过Upper,或最低值小于Lower值,则被视为Outliers,即异常值。由图中看,此列数组并无异常值 二、采用箱线图(boxplot)探测异常值箱线图比较直观、形象,易于理解,因此它在统计分析中占有非常重要的地位。 1.利用上述的数据探测过程,在“Explore”对话框中单击“Plots”,出现如图2所示的对话框,通过“Boxplots”方框可以确定箱线图的生成方式。“Factorlevelstogether”复选框表示将要为每个因变量创建一个箱线图,“Dependenttogether”复选框表示将为每个分组变量水平创建箱线图,“None”复选
6、框表示不创建箱线图。 2.直接利用SPSS中的画图功能实现箱线图,SPSS给出了两种箱线图,一种是基本箱线图,另一种是交互式箱线图。基本箱线图的SPSS菜单实现为:点击主菜单中的“Graphs”选项,在弹出的一级菜单中选择“Boxplot……”选项。交互式箱形图的SPSS菜单实现为:点击主菜单中的“Graphs”选项,在弹出的一级菜单中点击“Interactive”选项,在弹出的二级菜单中选择“Boxplot……”选项。下面仍以A公司雇员分工种的开始工资为例构造基本箱线图(如图3)。箱线图中的“○”表示可疑的异常值,此处异常值的确定采用的是“五数概括法”,即:变量值超过第7
7、5百分位点和25百分位点上变量值之差的1.5倍(箱体上方)或变量值小于第75百分位点和25百分位点上变量值之差的1.5倍(箱体下方)的点对应的值。三、SPSS14后的新功能Data-->Validation:???如何设置。。。四、Z分标准化法(3δ法):±3δ以外的数据为高度异常值,应予剔除。 在异常数据的删除方法中,最常用的就是拉依达准则法,即我们所熟知的3δ法,也就是把一组观测数据中与平均值的偏差超过两倍标准差范围的数据剔除。spss中的步骤如下:一、analyze>>descriptivesta
此文档下载收益归作者所有