欢迎来到天天文库
浏览记录
ID:32004595
大小:20.56 MB
页数:63页
时间:2019-01-30
《数据仓库技术在通信行业的应用-研究》由会员上传分享,免费在线阅读,更多相关内容在教育资源-天天文库。
1、南京邮电大学工程硕士研究生学位论文第一章数据仓库概述给数据仓库一个定义的话,那么数据仓库就是一个作为决策支持系统和联机分析应用数据源的结构化数据环境。数据仓库所要研究和解决的问题就是从数据库中获取信息的问题。以辨证的眼光来看,数据仓库的兴起实际上是数据管理的一种回归,是螺旋式的上升。今天的数据库就好比当年的层次数据库和网型数据库,它们面向事务处理;今天的数据仓库就好比是当年的关系数据库,它针对联机分析。所不同的是,今天的数据仓库不必再为联机事务处理的特性而无谓奔忙,由于技术的专业化,它可更专心于联机分析领域的发展和
2、探索。1.3数据仓库和数据集市数据仓库一词尚没有一个统一的定义,著名的数据仓库专家W.H.Inmon在其著作《BuildingtheDataWarehouse》一书中给予如下描述:数据仓库(DataWarehouse)是一个面向主题的(SubjectOriented)、集成的(Integrate)、相对稳定的(Non—V01atile)、反映历史变化(TimeVariant)的数据集合,用于支持管理决策。对于数据仓库的概念我们可以从两个层次予以理解,首先,数据仓库用于支持决策,面向分析型数据处理,它不同于企业现有的
3、操作型数据库;其次,数据仓库是对多个异构的数据源有效集成,集成后按照主题进行了重组,并包含历史数据,而且存放在数据仓库中的数据一般不再修改。根据数据仓库概念的含义,数据仓库拥有以下四个特点:1、面向主题操作型数据库的数据组织面向事务处理任务,各个业务系统之间各自分离,而数据仓库中的数据是按照一定的主题域进行组织。主题是一个抽象的概念,是指用户使用数据仓库进行决策时所关心的重点方面,一个主题通常与多个操作型信息系统相关。在本次数据仓库建设中我们确定了如下7个主题:用户发展分析、用户流失分析、用户状态分析、业务应收分析
4、、欠费分析分析、套餐数量分析、竞争对手分析等。2、集成的面向事务处理的操作型数据库通常与某些特定的应用相关,数据库之间相互独立,并且往往是异构的。而数据仓库中的数据是在对原有分散的数据库数据抽南京邮电大学工程硕士研究生学位论文第一章数据仓库概述取、清理的基础上经过系统加工、汇总和整理得到的,必须消除源数据中的不一致性,以保证数据仓库内的信息是关于整个企业的一致的全局信息。在本次数据仓库建设过程中,我们对分散在各个系统中客户信息进行了了统一的客户视图。3、相对稳定的操作型数据库中的数据通常实时更新,数据根据需要及时发
5、生变化。数据仓库的数据主要供企业决策分析之用,所涉及的数据操作主要是数据查询,一旦某个数据进入数据仓库以后,一般情况下将被长期保留,也就是数据仓库中一般有大量的查询操作,但修改和删除操作很少,通常只需要定期的加载、刷新。在设计数据仓库过程中,充分考虑到了数据相对稳定的特点,在设计数据模型时尽量考虑到长期需求,保留一些冗余。4、反映历史变化操作型数据库主要关心当前某一个时间段内的数据,而数据仓库中的数据通常包含历史信息,系统记录了企业从过去某一时点(如开始应用数据仓库的时点)到目前的各个阶段的信息,通过这些信息,可以
6、对企业的发展历程和未来趋势做出定量分析和预测。企业数据仓库的建设,是以现有企业业务系统和大量业务数据的积累为基础。数据仓库不是静态的概念,只有把信息及时交给需要这些信息的使用者,供他们做出改善其业务经营的决策,信息才能发挥作用,信息才有意义。而把信息加以整理归纳和重组,并及时提供给相应的管理决策人员,是数据仓库的根本任务。因此,从产业界的角度看,数据仓库建设是一个工程,是一个过程。数据集市(datamart)又叫做“小数据仓库",可以说数据仓库指综合了很多主题的,可以说是全部的有价值数据,是建立在企业级的数据模型上
7、,而数据集市是代表面向单个或几个主题,进行拆分和重组的数据仓库简单版,它把对某一类(部门)用户有用的数据单独拿出来进行筛选,转载并开发利用,生成报表等等,是企业级数据仓库的一个子集。数据集市与数据仓库的建设方法一般有两种:一是“自顶向下”,即先建立一个企业级数据仓库,再建立部门级数据集市,这样有利于各级数据仓库的一致性控制,缺点是企业级数据仓库的规模往往较大,实施周期常,见效慢,费用昂贵。另一种方法是“自底向上”即在数据仓库的实施过程中,从一个部门的数据南京邮电大学工程硕士研究生学位论文第一章数据仓库概述集市开始,
8、形成独立数据集市,然后再将几个数据集市组成一个完整的数据仓库,其优点是易于实现,花费小,见效快,但应注意在实施不同的数据集市时,同一含义的字段定义一定要相容。独立数据集市尽管可以快速的建立起来满足某个部门的某个决策需求,表面看来,可以大大降低开发时间和开发费用。但是,如果各个部门都要开发数据集市,当多个数据集市分别从数据准备区取数据时,由于各个部门的需求不同
此文档下载收益归作者所有