欢迎来到天天文库
浏览记录
ID:57654009
大小:57.00 KB
页数:7页
时间:2020-08-30
《hadoop版本差异详解.docx.doc》由会员上传分享,免费在线阅读,更多相关内容在教育资源-天天文库。
1、Hadoop版本的关键特性调研报高ApacheHadoopApache版本衍化ApacheHadoop版本分为两代,我们将第一代Hadoop称为Hadoop1.0,第二代Hadoop称为Hadoop2.0。第一代Hadoop包含三个大版本,分别是0.20.x,0.21.x和0.22.x,其中,0.20.x最后演化成1.0.x,变成了稳定版,而0.21.x和0.22.x则NameNodeHA等新的重大特性。第二代Hadoop包含两个版本,分别是0.23.x和2.x,它们完全不同于Hadoop1.0,是一套全新的架构,均包含HDFSFeder
2、ation和YARN两个系统,相比于0.23.x,2.x增加了NameNodeHA和Wire-compatibility两个重大特性。经过上面的大体解释,大家可能明白了Hadoop以重大特性区分各个版本的,总结起来,用于区分Hadoop版本的特性有以下几个:(1)Append支持文件追加功能,如果想使用HBase,需要这个特性。(2)RAID在保证数据可靠的前提下,通过引入校验码较少数据块数目.(3)Symlink支持HDFS文件(4)SecurityHadoop安全。需要注意的是,Hadoop2.0主要由Yahoo独立出来的horton
3、works公司主持开发。2013年10月,Hadoop2.0发布。关键特性包括:a)YARNYARN是“YetAnotherResourceNegotiator”的简称,它是Hadoop2.0引入的一个全新的通用资源管理系统,可在其之上运行各种应用程序和框架,比如MapReduce、Tez、Storm等,它的引入使得各种应用运行在一个集群中成为可能。YARN是在MRv1基础上衍化而来的,是MapReduce发展到一定程度的必然产物,它的出现使得Hadoop计算类应用进入平台化时代,我的博客中包含大量介绍YARN的文章,有兴趣的读者可阅读:
4、dongxicheng.org/category/mapreduce-nextgen/b)HDFS单点故障得以解决Hadoop72.2.0同时解决了NameNode单点故障问题和存受限问题,其中,单点故障是通过主备NameNode切换实现的,这是一种古老的解决服务单点故障的方案,主备NameNode之间通过一个共享存储同步元数据信息,因此共享存储系统的选择称为关键,而Hadoop则提供了NFS、QJM和Bookeeper三种可选的共享存储系统,具体可阅读我的这篇文章:Hadoop2.0单点故障问题方案总结。c)HDFSFederation
5、前面提到HDFS的NameNode存在存受限问题,该问题也在2.2.0版本中得到了解决。这是通过HDFSFederation实现的,它允许一个HDFS集群中存在多个NameNode,每个NameNode分管一部分目录,而不同NameNode之间彼此独立,共享所有DataNode的存储资源,注意,NameNodeFederation中的每个NameNode仍存在单点问题,需为每个NameNode提供一个backup以解决单点故障问题。d)HDFS快照HDFS快照是指HDFS文件系统(或者子系统)在某一时刻的只读镜像,它的出现使得管理员可定时
6、为重要文件或目录做快照,以防止数据误删、丢失等。具体可阅读:SnapshotsforHDFS(使用说明),SupportforRW/ROsnapshotsinHDFS。通过NFSv3访问HDFSNFS允许用户像访问本地文件系统一样访问远程文件系统,而将NFS引入HDFS后,用户可像读写本地文件一样读写HDFS上的文件,大大简化了HDFS使用,这是通过引入一个NFSgateway服务实现的,该服务能将NFS协议转换为HDFS访问协议,具体如下图所示。有兴趣的读者可阅读:SupportNFSv3interfacetoHDFS,以及相关设计文档
7、:HDFSNFSGateway。e)支持Windows操作系统在2.2.0版本之前,Hadoop仅支持Linux操作系统,而Windows仅作为实验平台使用。从2.2.0开始,Hadoop开始支持Windows操作系统,具体可阅读我之前写的一篇文章:HadoopForWindows。f)兼容1.x上运行的MapReduce应用程序与Hadoop生态系统其他系统进行了充分的集成测试除了HDFS、MapReduce和YARN这三个核心系统外,Hadoop生态系统还包括Hbase、Hive、Pig等系统,这些系统底层依赖于Hadoop核,而相比
8、于Hadoop1.0,Hadoop2.0的最大变化出现在核(HDFS、MapReduce和YARN),但与生态系统中其他系统进行集成测试是必需的。除了以上特性外,Apache官方还给出了两个特
此文档下载收益归作者所有