上的数据仓库平台,其设计目标是使hadoop上的数据操作

上的数据仓库平台,其设计目标是使hadoop上的数据操作

ID:3856756

大小:1.91 MB

页数:19页

时间:2017-11-24

上的数据仓库平台,其设计目标是使hadoop上的数据操作_第1页
上的数据仓库平台,其设计目标是使hadoop上的数据操作_第2页
上的数据仓库平台,其设计目标是使hadoop上的数据操作_第3页
上的数据仓库平台,其设计目标是使hadoop上的数据操作_第4页
上的数据仓库平台,其设计目标是使hadoop上的数据操作_第5页
资源描述:

《上的数据仓库平台,其设计目标是使hadoop上的数据操作》由会员上传分享,免费在线阅读,更多相关内容在教育资源-天天文库

1、数据仓库-HiveCloudComputing主要内容简介Hive的组成Hive的数据模型查询语言Hive是一个构建在Hadoop上的数据仓库平台,其设计目标是使Hadoop上的数据操作与传统SQL结合,让熟悉SQL编程的开发人员能够向Hadoop平台迁移。Hive可以在HDFS上构建数据仓库来存储结构化的数据,这些数据来源于HDFS上的原始数据,Hive提供了类似SQL的查询语言HiveQL,可以执行查询,变换数据等操作。通过解析,HiveQL语言在底层被转化为相应的MapReduce操作。简介Hive的体系结构Hive的组成HadoopHJobTrackerN

2、ameNodeHiveDriver(Compiler,Optimizer,Executor)ThriftServerCLIJDBC/ODBCWebGUIMetastoreHive相关组件:外部接口:Hive提供了例如命令行(CLI)、Web界面等用户接口,还提供了应用程序接口(API)例如JDBC,ODBC等。Thrift服务器:HiveThrift服务器是一种跨语言服务的可伸缩软件框架。它结合律功能强大的软件堆栈的代码生成引擎,可以无缝的与C++、C#、Java、Python、PHP和Ruby结合。Thrift允许用户简单地定义文件中的数据类型和服务接口,编译器

3、生成代码来实现RPC客户端和服务器之间的通信。Hive内部集成了Thrift服务,支持在多种语言中运行Hive命令,使客户端可以跨平台连接Hive。Hive的组成Hive相关组件:解析器(Driver):包括解释器,编译器,优化器,执行器,通过这一系列对HiveQL查询语句的处理,最后生成查询计划。解析器管理着HiveQL语句在编译,优化和执行时的生命周期。当接收到一个HiveQL查询语句时,解析器会创建一个相对的句柄,这个句柄被用来追踪执行时间,输出行数等数据。Hadoop:数据仓库和查询计划存储在HDFS上,计算过程由MapReduce执行。Hive的组成Hi

4、ve相关组件:元数据库(Metastore):管理系统目录,通常存储在关系数据库如MySQL,Derby中。Hive所有其他的组件都会与它进行交互。Hive的元数据中保存了表的属性和服务信息,为查询操作提供依据,默认的元数据库是内部的Derby,这种情况下metastore和其他Hive服务运行在同一个Java虚拟机里,只能允许建立单个会话,要实现多用户多会话支持,需要配置一个独立的元数据库。Hive的组成Hive的数据模型数据在Hive里组织成表,分区和桶的形式表:Hive里的表类似于关系数据库中的表。每个表都有一个对应的HDFS目录。表中的数据被序列化后存储在

5、该目录的文件中。Hive提供了内置的序列化格式。用户还可以通过自定义序列化和反序列化的方法去支持新的数据格式。每张表的序列化格式存储在原数据库中,并在查询编译和执行时被自动调用。Hive同时还支持数据存储在NFS,本地目录的外部表。数据在Hive里组织成表,分区和桶的形式分区:分区是表的部分列的集合。一个表可以有一个或者多个分区,这些分区确定了数据在表目录下的分布情况。假设表T的数据是在/wh/T目录下。如果T在列ds和ctry上被分区,那么ds值为20090101和ctry值为US的数据将会被存储到/wh/T/ds=20090101/ctry=US的目录下。桶:

6、在每个分区中的数据可以根据列的哈希值进一步划分成桶,每个桶在分区目录下都存在一个文件中。Hive的数据模型Hive支持的数据类型(基本类型)Hive的数据模型基本类型大小描述TINYINT1字节有符号整数SMALLINT2字节有符号整数INT4字节有符号整数BIGINT8字节有符号整数FLOAT4字节单精度浮点数DOUBLE8字节双精度浮点数BOOLEAN~取true/falseSTRING最大2GB字符串,类似于sql的varcharHive支持的数据类型(复杂类型)Hive的数据模型复杂类型大小描述ARRAY不限一组有序字段,字段类型必须相同MAP不限无序键值

7、对,键值内部字段类型必须相同STRUCT不限一组字段,字段类型可以不同Hive提供了类似于SQL的查询语言HiveQL。HiveQL支持选择,投影,连接,聚合,合并以及From中嵌套的子查询语句。HiveQL允许在创建表的时候申明表的序列化格式,分区等HiveQL目前不支持行的删除和更新。HiveQL支持多表的插入操作。Hive的查询语言HiveQL的常用操作创建表:创建一张名为userinfo的表,表中有两列id和name,HiveShell中的创建命令为:createtableuserinfo(idint,namestring)rowformatdelimit

8、edfie

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。