借数据一双慧眼

借数据一双慧眼

ID:20233757

大小:50.00 KB

页数:3页

时间:2018-10-11

借数据一双慧眼_第1页
借数据一双慧眼_第2页
借数据一双慧眼_第3页
资源描述:

《借数据一双慧眼》由会员上传分享,免费在线阅读,更多相关内容在学术论文-天天文库

1、借数据一双慧眼

2、第1  数据仓库(D的价值链上还是有所侧重的,数据仓库重在“建仓”,数据挖掘和知识发现重在“加工”,商务智能重在“应用”。虚线表示曾经拥有。第二,如果不这样画,理论界、应用厂商会不答应,因为不管原来是做数据库的(IBM,Sybase,NCR,Oracle,Microsoft,etc),还是做统计分析软件的(SAS,Statistica,SPSS,etc),甚至是做报表工具的(BO,Brio,Cognos,etc),都拼命在延伸自己的价值链。  所以,干脆叫数据管理(也就是DM)好了,一统天下。  至于ERP,CRM等,说白了,还是个DM,只不过限制在了具

3、体的社会经济活动上罢了。  六种挖掘武器  数据仓库的建设和数据挖掘建模是DM价值链上的两大技术要点。数据挖掘从狭义的角度讲,只管从数据到知识这一段。俗话说:“没有金刚钻,不揽瓷器活”。作为一个数据挖掘人员的起码要求,就是充分掌握各种挖掘工具的性能、局限、应用条件等。  一般说来,数据挖掘有如下六件武器:描述统计、关联和相关、分类和聚类、预测、优化、结构方程模型。简要说明如下:  (1)描述统计(Descriptivestatistics)  描述统计是数据挖掘的入门兵器,直观、简单,高手常常用来摘叶飞花。描述统计包括平均数、中位数、众数、分位数、百分比、求和等。描述统

4、计经常和统计图(如直方图,条形图,线图,散点图,茎叶图等)配合使用。目前应用最为广泛的OLAP,究其本质就是针对不同的数据群在做描述统计。  描述统计的应用十分广泛:比如当月公司利润总额,比较不同区域的销售量等等。  (2)关联和相关(AssociationandCorrelation)  关联规则从本质上讲是条件概率:A发生时,B同时也出现的概率是多大?只要B离50%较远,就是有意义的。  关联规则的一个典型的现代应用是“啤酒加尿布”。在应用关联规则时还需要多考虑的一个问题是:这条规则遵循者的数量怎样?通俗的说就是,如果超市的尿布只有一个人买(假设),但是这人每次买尿

5、布时,一定会买啤酒。尽管这条规则很可信(100%),但是意义却不大。  在应用关联规则时,要注意两点:关联不一定是因果,关联是有方向的。  相关也是考虑两个事物之间的关系,典型的度量方法有Pearson相关系数和Kendall相关系数。  (3)分类和聚类  分类和聚类是最常用的技术。  一般说来,分类的方法有三种:回归、决策树、神经网络。  聚类和分类的最大区别就是,分类是有监督的,聚类是无监督的。什么叫监督呢?就是标准,或者说有目标变量。聚类是没有目标的。“物以类聚,人以群分”。聚类是不知道每一类有什么特征的,聚后再总结,再发现共同点。  (4)预测  预测的常用方

6、法是时间序列,回归也可以用来预测。  时间序列常用的方法有:ARMA,指数平滑和趋势外推等。时间序列的最大特点就是充分挖掘事物本身随时间的规律。因为,任何事物,比如企业销售额,在没有特别的外在因素影响下,总是有规可循的。  (5)优化  优化本是运筹学中的一个概念,主要解决的一个问题是在各种约束条件下,如何合理配置资源,使目标要素最大(小)化。  (6)结构方程模型

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。