大数据挖掘——数据挖掘的方法.doc

ID：57753842

大小：15.50 KB

页数：2页

时间：2020-09-02

资源描述：

《大数据挖掘——数据挖掘的方法.doc》由会员上传分享，免费在线阅读，更多相关内容在教育资源-天天文库。

1、大数据挖掘——数据挖掘的方法来源：扣丁学堂　大数据挖掘——数据挖掘的方法一直是人们津津乐道的话题，今天小编废话就不多说了，我们一起来看一下大数据挖掘——数据挖掘的方法吧：　　一、神经网络方法　　神经网络由于本身良好的鲁棒性、自组织自适应性、并行处理、分布存储和高度容错等特性非常适合解决数据挖掘的问题，因此近年来越来越受到人们的关注。典型的神经网络模型主要分3大类：以感知机、BP反向传播模型、函数型网络为代表的，用于分类、预测和模式识别的前馈式神经网络模型;以Hopfield的离散模型和连续模型为代表的，分别用于联想记忆和优化计算的反馈式神经网络模型;以A

2、RT模型、Koholon模型为代表的，用于聚类的自组织映射方法。神经网络方法的缺点是"黑箱"性，人们难以理解网络的学习和决策过程。　　二、遗传算法　　遗传算法是一种基于生物自然选择与遗传机理的随机搜索算法，是一种仿生全局优化方法。遗传算法具有的隐含并行性、易于和其它模型结合等性质使得它在数据挖掘中被加以应用。　　Sunil已成功地开发了一个基于遗传算法的数据挖掘工具，利用该工具对两个飞机失事的真实数据库进行了数据挖掘实验，结果表明遗传算法是进行数据挖掘的有效方法之一[4]。遗传算法的应用还体现在与神经网络、粗集等技术的结合上。如利用遗传算法优化神经网络结

3、构，在不增加错误率的前提下，删除多余的连接和隐层单元;用遗传算法和BP算法结合训练神经网络，然后从网络提取规则等。但遗传算法的算法较复杂，收敛于局部极小的较早收敛问题尚未解决。　　三、决策树方法　　决策树是一种常用于预测模型的算法，它通过将大量数据有目的分类，从中找到一些有价值的，潜在的信息。它的主要优点是描述简单，分类速度快，特别适合大规模的数据处理。最有影响和最早的决策树方法是由Quinlan提出的著名的基于信息熵的ID3算法。它的主要问题是：ID3是非递增学习算法;ID3决策树是单变量决策树，复杂概念的表达困难;同性间的相互关系强调不够;抗噪性差。

4、针对上述问题，出现了许多较好的改进算法，如Schlimmer和Fisher设计了ID4递增式学习算法;钟鸣，陈文伟等提出了IBLE算法等。　　四、粗集方法　　粗集理论是一种研究不精确、不确定知识的数学工具。粗集方法有几个优点：不需要给出额外信息;简化输入信息的表达空间;算法简单，易于操作。粗集处理的对象是类似二维关系表的信息表。目前成熟的关系数据库管理系统和新发展起来的数据仓库管理系统，为粗集的数据挖掘奠定了坚实的基础。但粗集的数学基础是集合论，难以直接处理连续的属性。而现实信息表中连续属性是普遍存在的。因此连续属性的离散化是制约粗集理论实用化的难点。现

5、在国际上已经研制出来了一些基于粗集的工具应用软件，如加拿大Regina大学开发的KDD-R;美国Kansas大学开发的LERS等。　　五、覆盖正例排斥反例方法　　它是利用覆盖所有正例、排斥所有反例的思想来寻找规则。首先在正例集合中任选一个种子，到反例集合中逐个比较。与字段取值构成的选择子相容则舍去，相反则保留。按此思想循环所有正例种子，将得到正例的规则(选择子的合取式)。比较典型的算法有Michalski的AQ11方法、洪家荣改进的AQ15方法以及他的AE5方法。　　六、统计分析方法　　在数据库字段项之间存在两种关系：函数关系(能用函数公式表示的确定性关

6、系)和相关关系(不能用函数公式表示，但仍是相关确定性关系)，对它们的分析可采用统计学方法，即利用统计学原理对数据库中的信息进行分析。可进行常用统计(求大量数据中的最大值、最小值、总和、平均值等)、回归分析(用回归方程来表示变量间的数量关系)、相关分析(用相关系数来度量变量间的相关程度)、差异分析(从样本统计量的值得出差异来确定总体参数之间是否存在差异)等。　　七、模糊集方法　　即利用模糊集合理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。系统的复杂性越高，模糊性越强，一般模糊集合理论是用隶属度来刻画模糊事物的亦此亦彼性的。李德毅等人在传

7、统模糊理论和概率统计的基础上，提出了定性定量不确定性转换模型--云模型，并形成了云理论。　　扣丁学堂大数据视频教程讲师：关于大数据挖掘——数据挖掘的方法就先为大家分享到这，感谢大家阅读由扣丁学堂分享的“大数据挖掘——数据挖掘的方法”我们会不定期的分享更多关于大数据的文章，供广大大数据学员进行学习，更多精彩内容请关注扣丁学堂官网。

当前文档最多预览五页，下载文档查看全文

侵权申诉



1 1 2 / 2



此文档下载收益归作者所有

当前文档最多预览五页，下载文档查看全文

温馨提示：
1. 部分包含数学公式或PPT动画的文件，查看预览时可能会显示错乱或异常，文件下载后无此问题，请放心下载。
2. 本文档由用户上传，版权归属用户，天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容，确认文档内容符合您的需求后进行下载，若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误，付费完成后未能成功下载的用户请联系客服处理。

大数据挖掘——数据挖掘的方法.doc

大数据挖掘——数据挖掘的方法.doc

相关文章

相关标签