大数据时代索引与数据库事业的发展与创新

大数据时代索引与数据库事业的发展与创新

ID:26683392

大小:742.35 KB

页数:56页

时间:2018-11-28

大数据时代索引与数据库事业的发展与创新_第1页
大数据时代索引与数据库事业的发展与创新_第2页
大数据时代索引与数据库事业的发展与创新_第3页
大数据时代索引与数据库事业的发展与创新_第4页
大数据时代索引与数据库事业的发展与创新_第5页
资源描述:

《大数据时代索引与数据库事业的发展与创新》由会员上传分享,免费在线阅读,更多相关内容在教育资源-天天文库

1、大数据时代索引与数据库事业的发展与创新大纲结语大数据时代索引与数据库事业面临的挑战及创新索引与数据库的发展现状大数据时代引言RCCSE中国科学评价研究中心1引言“大数据”(BigData)已经在全球引起了广泛关注,正在引领了又一轮数据技术的革命。美国EMC公司于2011年5月在美国拉斯维加斯举办第11届EMCWorld大会,大会的核心是帮助企业利用IT变革的重要趋势。此次大会以“云计算相遇大数据(CloudMeetsBigData)”为主题,着重展现当今两个最重要的技术趋势,正式提出了“大数据”概念。RCCSE中国科学评价研究中心根据IDC《数字世界》

2、研究项目在2012年的统计,2010年全球数字资源的规模首次突破了ZB(1ZB=1万亿GB)级别,达到了1.227ZB;而2005年只有130Eb,五年增长了10倍。如果保持这种爆炸式的增长速度,到了2020年,我们的数字资源规模将超过40ZB,相当于世界上每个人拥有超过5200GB的数据。无疑,我们已进入了大数据时代。RCCSE中国科学评价研究中心单位:ZB1引言在2011年12月,我国工信部发布了物联网“十二五”规划,提出了4项关键技术创新工程。信息处理技术的内容包括海量数据存储、数据挖掘、图像视频智能分析等,都是大数据技术的重要组成部分;另外3项

3、关键技术创新工程,包括信息感知技术、信息传输技术、信息安全技术,这些也都与“大数据”密切相关。我国也对大数据技术给予了足够的重视。RCCSE中国科学评价研究中心1引言1引言基于以上概述,我们认为,大数据时代已经到来,已经对我们的社会产生了重大影响。本文将尝试对大数据时代我国的索引和数据库事业的发展与创新进行研究和展望。RCCSE中国科学评价研究中心2大数据时代2.1大数据的定义和特征许多权威机构和企业对大数据给予了不同的定义。麦肯锡认为,“大数据所涉及的数据集规模已经超过了传统数据库软件获取、存储、管理和分析的能力。”RCCSE中国科学评价研究中心2大

4、数据时代IBM公司认为,可以用3个特征相结合来定义大数据:数量(Volume)、种类(Variety)和速度(Velocity),即庞大容量、极快速度和种类丰富的数据。IDC公司认为,“大数据不是一个事物,而是一个跨多个信息技术领域的现象。大数据技术描述了新一代的技术和架构,通过使用高速(Velocity)的采集、发现或分析方法,从超大容量(Volume)的多样(Variety)数据中经济地提取价值(Value)。”RCCSE中国科学评价研究中心综合以上几种不同的见解,我们认为,具备以下特征的就是大数据。(1)数量大(Volume)。大数据所包含的数据

5、量很大,而且在急剧增长之中。但是,在可供使用的数据数量不断增长的同时,可处理、理解和分析的数据比例却在不断下降。RCCSE中国科学评价研究中心2大数据时代2大数据时代(2)种类多(Variety)。随着技术的发展,数据源不断增多,数据的类型也不断增加。不仅包含传统的关系型数据,还包含来自网页、互联网、搜索引擎、论坛、电子邮件、传感器数据等原始的、半结构化和非结构化数据。(3)速度快(Velocity)。除了收集数据的数量和种类发生变化,需要处理和生成数据的速度也在变化。数据流动的速度在加快,要有效的处理大数据,需要在数据变化的过程中实时的对其进行分析,

6、而不是滞后的进行处理。RCCSE中国科学评价研究中心2大数据时代(4)价值量(Value)。在信息时代,信息具有很重要的商业价值。但是,信息具有生命周期,数据的价值会随时间快速减少。另外,大数据的数量庞大,种类繁多,变化也快,数据的价值密度很低。如何从大量多样的数据中尽快的分析出有价值的信息非常重要。对海量的数据进行挖掘和分析,这也是大数据技术的难点。RCCSE中国科学评价研究中心(5)真实性(Veracity)。这是一个衍生特征。真实有效的数据才具有意义。随着新数据源的增加,信息量的爆炸式增长,我们很难对数据的真实性和安全性进行控制,因此需要对大数据

7、进行有效的信息治理。大数据在结构类型上也有其特点:大多数的大数据都是半结构化或非结构化的。RCCSE中国科学评价研究中心2大数据时代半结构化的数据是指具有一定的结构性并可被解析或者通过使用工具可以使之格式化的数据,如包含不一致的数据和格式的员工薪酬数据。非结构化的数据是指没有固定结构,通常无法直接知道其内容,保存为不同类型文件的数据,如各种图像、视频文件。根据目前大数据的发展状况,未来数据增长的绝大部分将是半结构化或非结构化的数据。RCCSE中国科学评价研究中心2大数据时代2.2大数据时代已经到来(1)大数据时代已经到来理论的提出:2008年,《Nat

8、ure》杂志出版一期专刊,专门讨论未来的大数据(BigData)处理相关的一系列技术问题和挑战

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。