大数据下数据挖掘技术的算法.doc

大数据下数据挖掘技术的算法.doc

ID:61773904

大小:28.00 KB

页数:4页

时间:2021-03-20

大数据下数据挖掘技术的算法.doc_第1页
大数据下数据挖掘技术的算法.doc_第2页
大数据下数据挖掘技术的算法.doc_第3页
大数据下数据挖掘技术的算法.doc_第4页
资源描述:

《大数据下数据挖掘技术的算法.doc》由会员上传分享,免费在线阅读,更多相关内容在应用文档-天天文库

1、大数据下数据挖掘技术的算法在大数据背景下,许多传统科学技术的发展达到了新的高度,同时也衍生出一些新兴技术,这些推动着互联网行业的前行。新技术的发展也伴随着新问题的产生,现有的数据处理技术难以满足大数据发展的需要,在数据保护等方面依旧存在着一定的风险。因此,进一步完善大数据技术是当下需要攻克的难题。本文主要进行了大数据的简单引入,介绍数据挖掘技术及其应用,分析了当下的发展进度和面临的困难。1大数据的相关引入4学海无涯1.1大数据的概念。大数据主要指传统数据处理软件无法处理的数据集,大数据有海量、多样、高速和易变四大特点,通过大数据的使

2、用,可以催生出新的信息处理形式,实现信息挖掘的有效性。大数据技术存在的意义不仅在于收集海量的信息,更在于专业化的处理和分析,将信息转化为数据,从数据中提取有价值的知识。大数据分析与云计算关系密切,数据分析必须依托于云计算的分布式处理、分布式数据库等。1.2大数据的特点。伴随着越来越多的学者投入到对大数据的研究当中,其特点也逐渐明晰,都广泛的提及了这四个特点。(1)海量的数据规模,信息的数据体量明显区别于以往的GB、TB等计量单位,在大数据领域主要指可以突破IZP的数量级。(2)快速的数据流转,大数据作用的领域时刻处在数据更新的环境下

3、,高效快速的分析数据是保证信息处理有效的前提。(3)多样的数据类型,广泛的数据来源催生出更加多样的数据结构。(4)价值低密度,也是大数据的核心特征,相较于传统数据,大数据更加多变、模糊,给数据分析带来困扰,从而难以从中高密度的取得有价值的信息。1.3大数据的结构。大数据主要分为结构化、半结构化和非结构化三种数据结构。结构化一般指类似于数据库的数据管理模式。半结构化具有一定的结构性,但相比结构化来说更加灵活多变。目前非结构化数据占据所有数据的70%-80%,原因在于互联网上的信息内容多种多样,暂时无法找到有序的存储归类方法。1.4大数

4、据技术大数据技术是指如何从各种类型的数据中,获得有利用价值的信息,其中大数据技术包括数据收集、数据存取、数据架构、数据处理、统计分析、数据挖掘、数据预测和结果呈现。在大数据的生命周期中,数据收集处于第一阶段,主要来源有管理信息系统、Web信息系统等。根据数据结构类型不同,大数据的存取采用三种不同的形式,这样有利于其他技术的应用。数据架构源于谷歌提出的一种基于软件的可靠文件存储体系GFS(Google文件系统),相应推出的还有MapReduce计算模型,二者共同解决了当时的文件存储和运算问题。而后随着需求的不断增多,有学者基于谷歌的研

5、究,开发出可以满足更多需求的Hadoop。2数据挖掘技术2.1数据挖掘技术以及云计算。如今全球每年都有数十亿人使用着计算机等电子设备,并产生了庞大的数据,各行各业都已经被数据所渗透,在大数据时代,数据挖掘已成为不可或缺的技术。数据挖掘通过统计、在线分析、情报检索、机器学习、专家系统和模式识别等诸多方法来实现从海量数据中搜索隐藏于其中的信息这一过程。云计算是分布计算的其中一种,通常是指:通过网络搜集共享计算资源,并以最低的管理代价和最精准的计算方式获取结果的新型IT运算模式。也就是说云计算技术将庞大的数据计算处理程序拆分为一个个小程序

6、,再通过多个服务器分别计算、处理和分析,最后将结果汇总并返回给用户。这项技术可以在短时间内迅速完成海量的数据处理,从而为日益更新的互联网服务。2.2数据挖掘的发展现状。从最早的数据库技术,到如今逐渐发展成熟的大数据技术,其目的都是实现数据的高效管理和有效利用。数据在我们身边无处不在,数据的收集已经不再是困扰我们的难题,如何将隐藏在数据背后的信息高效率的挖掘出来,才是我们需要探索的道路。如今数据挖掘技术已发展为:数据源提供数据,再将预处理的数据整合成适用的模式,由模式分析出这些数据中有用的知识。2.3数据挖掘中的经典算法。2.3.1C

7、4.5算法C4.5算法是在决策树算法的基础之上改进的,根据对目标变量产生的效果的不同而构建的分类规则,其原理是根据每次选择一个特征或分裂点作为当前节点的分类条件。C4.5算法继承了决策树算法的优点:过程可见、操作4学海无涯简便、准确率高,可同时也有难以基于组合的形式发现规律。2.3.2K-Means算法即K均值聚类算法K均值聚类算法顾名思义是一种聚类算法,将n个对象根据属性分为k个分割,计算出每个对象与各个种子聚类间的距离,然后将每类对象分配给最近的聚类中心,这样每个聚类中心再不断重复以上操作以达到某个终止条件。这种算法的优点是容易

8、实现,但在大规模数据的运用上效率较低,一般适用于数值型数据。3最新数据挖掘技术及其应用在新时代大数据的发展中,信息数据在我们的生活中无处不在,衣、食、住、行中都有大数据技术作为支撑,从“暗处”给用户提供帮助。随着大数据的出现到发展为现

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。