统计学12判别分析.ppt

统计学12判别分析.ppt

ID:52647221

大小:687.50 KB

页数:70页

时间:2020-04-12

统计学12判别分析.ppt_第1页
统计学12判别分析.ppt_第2页
统计学12判别分析.ppt_第3页
统计学12判别分析.ppt_第4页
统计学12判别分析.ppt_第5页
资源描述:

《统计学12判别分析.ppt》由会员上传分享,免费在线阅读,更多相关内容在PPT专区-天天文库

1、统计学─从数据到结论第十二章判别分析12.1判别分析(discriminantanalysis)某些昆虫的性别只有通过解剖才能够判别但雄性和雌性昆虫在若干体表度量上有些综合的差异。人们就根据已知雌雄的昆虫体表度量(这些用作度量的变量亦称为预测变量)得到一个标准,并以此标准来判别其他未知性别的昆虫。这样虽非100%准确的判别至少大部分是对的,而且用不着杀生。此即判别分析判别分析(discriminantanalysis)判别分析和聚类分析有何不同?在聚类分析中,人们一般事先并不知道应该分成几类及哪几类,全根据数据确定。在判别分析

2、中,至少有一个已经明确知道类别的“训练样本”,并利用该样本来建立判别准则,并通过预测变量来为未知类别的观测值进行判别了。判别分析例子数据disc.txt:企图用一套打分体系来描绘企业的状况。该体系对每个企业的一些指标(变量)进行评分。指标有:企业规模(is)、服务(se)、雇员工资比例(sa)、利润增长(prr)、市场份额(ms)、市场份额增长(msr)、流动资金比例(cp)、资金周转速度(cs)等.另外,有一些企业已经被某杂志划分为上升企业、稳定企业和下降企业。判别分析例子希望根据这些企业的上述变量的打分及其已知的类别(三个

3、类别之一:group-1代表上升,group-2代表稳定,group-3代表下降)找出一个分类标准,以对尚未被分类的企业进行分类。该数据有90个企业(90个观测值),其中30个属于上升型,30个属于稳定型,30个属于下降型。这个数据就是一个“训练样本”。Disc.sav数据1.根据距离判别的思想Disc.txt数据有8个用来建立判别标准(或判别函数)的(预测)变量,另一个(group)是类别每一个企业的打分在这8个变量所构成的8维空间中是一个点。这个数据在8维空间有90个点,由于已知所有点的类别,可以求得每个类型的中心。这样只

4、要定义了距离,就可以得到任何给定的点(企业)到这三个中心的三个距离。1.根据距离判别的思想最简单的办法就是:某点离哪个中心距离最近,就属于哪一类。一个常用距离是Mahalanobis距离。用来比较到各个中心距离的数学函数称为判别函数(discriminantfunction).这种根据远近判别的思想,原理简单,直观易懂。为判别分析的基础2.Fisher判别法(先进行投影)Fisher判别法就是一种先投影的方法。考虑只有两个(预测)变量的判别问题。假定只有两类。数据中的每个观测值是二维空间的一个点。见图。这里只有两种已知类型的训

5、练样本。一类有38个点(用“o”表示),另一类有44个点(用“*”表示)。按原来变量(横坐标和纵坐标),很难将这两种点分开。2.Fisher判别法(先进行投影)于是就寻找一个方向,即图上的虚线方向,沿该方向朝和这个虚线垂直的一条直线进行投影会使得这两类分得最清楚。可以看出,如果向其他方向投影,判别效果不会比这个好。有了投影之后,再用前面讲到的距离远近的方法得到判别准则。这种先投影的判别方法就是Fisher判别法。Fisher判别法的数学3.逐步判别法(仅仅是在前面的方法中加入变量选择的功能)有时,一些变量对于判别并没有什么作用

6、,为了得到对判别最合适的变量,可以使用逐步判别。即,一边判别,一边选择判别能力最强的变量,这个过程可以有进有出。一个变量的判别能力的判断方法有很多种,主要利用各种检验,例如Wilks’Lambda、Rao’sV、TheSquaredMahalanobisDistance、SmallestFratio或TheSumofUnexplainedVariations等检验。其细节这里就不赘述了;这些不同方法可由统计软件的各种选项来实现。逐步判别的其他方面和前面的无异。Disc.txt例子利用SPSS软件的逐步判别法淘汰了不显著的流动资

7、金比例(cp),还剩下七个变量。用x1,x2,x3,x4,x5,x6,x7分别表示标准化后的变量is,se,sa,prr,ms,msr,cs,得到两个典则判别函数(CanonicalDiscriminantFunctionCoefficients):这两个函数实际上是由Fisher判别法得到的向两个方向的投影。这两个典则判别函数的系数是下面的SPSS输出得到的:Disc.txt例子根据这两个函数,从任何一个观测值(每个观测值都有7个变量值)都可以算出两个数。把这两个数目当成该观测值的坐标,这样数据中的150个观测值就是二维平面

8、上的150个点。它们的点图在下面图中。Disc.txt例子从上图可以看出,第一个投影(相应于来自于第一个典则判别函数横坐标值)已经能够很好地分辨出三个企业类型了。这两个典则判别函数并不是平等的。其实一个函数就已经能够把这三类分清楚了。SPSS的一个输出就给出了这些判别函数(投

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。