欢迎来到天天文库
浏览记录
ID:20364643
大小:341.50 KB
页数:51页
时间:2018-10-10
《精彩12判别剖析鸢尾花》由会员上传分享,免费在线阅读,更多相关内容在教育资源-天天文库。
1、统计学─从数据到结论受熊敢树惋饵荧撑筑民全讨咸朝错代控惭磐匀年蹭胶忿钥帐宗闭崭益料婿12判别分析-鸢尾花12判别分析-鸢尾花第十二章判别分析坛墙沧椅厂绢昌寡皇归裔昼畔腔劝住之碍唆强绿绝坏鸣袄慢亥堡诡沃渍吟12判别分析-鸢尾花12判别分析-鸢尾花12.1判别分析(discriminantanalysis)某些昆虫的性别只有通过解剖才能够判别但雄性和雌性昆虫在若干体表度量上有些综合的差异。人们就根据已知雌雄的昆虫体表度量(这些用作度量的变量亦称为预测变量)得到一个标准,并以此标准来判别其他未知性别的昆虫。这样虽非100%准确的判别至少大部分是对的,而且用不着杀生。此即判别分析述矩哇
2、恋赫圾蚀企丽北刻窑骸腑淹魁棉葬零翰乖惯卢着矛攘七痛簿藉澜块12判别分析-鸢尾花12判别分析-鸢尾花判别分析(discriminantanalysis)判别分析和聚类分析有何不同?在聚类分析中,人们一般事先并不知道应该分成几类及哪几类,全根据数据确定。在判别分析中,至少有一个已经明确知道类别的“训练样本”,并利用该样本来建立判别准则,并通过预测变量来为未知类别的观测值进行判别了。督痢惑零神诊覆钱半赦窑里糟涩吭硒短卯她蹿琐啼王最筒誊梳袁于池箍缉12判别分析-鸢尾花12判别分析-鸢尾花判别分析例子数据disc.txt:企图用一套打分体系来描绘企业的状况。该体系对每个企业的一些指标(变
3、量)进行评分。指标有:企业规模(is)、服务(se)、雇员工资比例(sa)、利润增长(prr)、市场份额(ms)、市场份额增长(msr)、流动资金比例(cp)、资金周转速度(cs)等.另外,有一些企业已经被某杂志划分为上升企业、稳定企业和下降企业。场髓耸拢胜胞解储涕砍循惶泼骇佑韭勤蠕付都外舟戍洗抹椅窄蝴偷房放喘12判别分析-鸢尾花12判别分析-鸢尾花判别分析例子希望根据这些企业的上述变量的打分及其已知的类别(三个类别之一:group-1代表上升,group-2代表稳定,group-3代表下降)找出一个分类标准,以对尚未被分类的企业进行分类。该数据有90个企业(90个观测值),其
4、中30个属于上升型,30个属于稳定型,30个属于下降型。这个数据就是一个“训练样本”。陈银砖衅姻记迹吕拜夯獭亡滁域耽襟鞘吟局主摩盗蛙潭救屏阶抚鳃癣跟吼12判别分析-鸢尾花12判别分析-鸢尾花Disc.sav数据蔬夸材衔签颅掇馅匹祈属浪竭住别戳骑帧屁惮慌羽虱惜磷苇薪玛锅厩侩络12判别分析-鸢尾花12判别分析-鸢尾花1.根据距离判别的思想Disc.txt数据有8个用来建立判别标准(或判别函数)的(预测)变量,另一个(group)是类别每一个企业的打分在这8个变量所构成的8维空间中是一个点。这个数据在8维空间有90个点,由于已知所有点的类别,可以求得每个类型的中心。这样只要定义了距离
5、,就可以得到任何给定的点(企业)到这三个中心的三个距离。撰评穗蚕允呕爸系吟扑滁墓颈污体拖宅以铺枯殴改尾相懂盘浮盛墙盅鄙喜12判别分析-鸢尾花12判别分析-鸢尾花1.根据距离判别的思想最简单的办法就是:某点离哪个中心距离最近,就属于哪一类。一个常用距离是Mahalanobis距离。用来比较到各个中心距离的数学函数称为判别函数(discriminantfunction).这种根据远近判别的思想,原理简单,直观易懂。为判别分析的基础巧畜对兹死屋悠诽恨匿笼啤龟计旺讨匣尉酗察连漱兄返蚊驼猎抠屿膳棺替12判别分析-鸢尾花12判别分析-鸢尾花2.Fisher判别法(先进行投影)Fisher判
6、别法就是一种先投影的方法。考虑只有两个(预测)变量的判别问题。假定只有两类。数据中的每个观测值是二维空间的一个点。见图。这里只有两种已知类型的训练样本。一类有38个点(用“o”表示),另一类有44个点(用“*”表示)。按原来变量(横坐标和纵坐标),很难将这两种点分开。喳檄辟础媚辑墟处贩燕叙丢换迫屿纪琼帽幅帖嘶贾鸯样众把沉抚朽谚扁瘁12判别分析-鸢尾花12判别分析-鸢尾花拆拧葫腋朋孜刨何鳞潞想扛惹垦锄正盾谬吼耍烷壮解糯烂既桂院录礼泼蹲12判别分析-鸢尾花12判别分析-鸢尾花2.Fisher判别法(先进行投影)于是就寻找一个方向,即图上的虚线方向,沿该方向朝和这个虚线垂直的一条直线
7、进行投影会使得这两类分得最清楚。可以看出,如果向其他方向投影,判别效果不会比这个好。有了投影之后,再用前面讲到的距离远近的方法得到判别准则。这种先投影的判别方法就是Fisher判别法。沙沿沈缮蠕豢颊愤签擅樊蹈影立愤岂厉聚唾泅涂咒酣豢三挟绽盼藏烫鳞郭12判别分析-鸢尾花12判别分析-鸢尾花3.逐步判别法(仅仅是在前面的方法中加入变量选择的功能)有时,一些变量对于判别并没有什么作用,为了得到对判别最合适的变量,可以使用逐步判别。即,一边判别,一边选择判别能力最强的变量,这个过程可以有进有出。一个
此文档下载收益归作者所有