欢迎来到天天文库
浏览记录
ID:42646617
大小:129.74 KB
页数:6页
时间:2019-09-19
《基于贝叶斯的文本分类》由会员上传分享,免费在线阅读,更多相关内容在工程资料-天天文库。
1、南京理工大学经济管理学院课程作业课程名称:本文信息处理作业题目:基于朴素贝叶斯实现文本分类姓名:赵华学号:门4107000778成绩:任课教师评语:签名:基于朴素贝叶斯实现文本分类摘要贝叶斯分类是一类分类算法的总称,这类算法均以贝叶斯定理为基础,故统称为贝叶斯分类。*文作为分类算法的第一篇,将首先介绍分类问题,对分类问题进行一个正式的定义。然后,介绍贝叶斯分类算法的基础一一贝叶斯定理。故后,通过实例讨论贝叶斯分类中故简单的一种:朴素贝叶斯分类。关键词社区发现标签传播算法社会网络分析社区结构1引言数据挖掘在上个世纪末在数据的智能分析
2、技术上得到了广泛的应用。分类作为数据挖掘中一项非常重要的任务,目前在商业上应用很多。分类的目的是学会一个分类函数或分类模型(也常常称作分类器),该分类器可以将数据集合中的数据项映射到给定类别中的某一个,从而可以用于后续数据的预测和状态决策。目前,分类方法的研究成果较多,判别方法的好坏可以从三个方面进行:1)预测准确度,对非样本数据的判别准确度;2)计算复杂度,方法实现时对时间和空间的复杂度;3)模式的简洁度,在同样效果情况下,希望决策树小或规则少。分类是数据分析和机器学习领域的基本问题。没有一个分类方法在对所有数据集上进行分类学习
3、均是最优的。从数据中学习高精度的分类器近年来一直是研究的热点。各种不同的方法都可以用来学习分类器。例如,人工神经元网络⑴、决策树⑵、非参数学习算法⑶等等。与其他精心设计的分类器相比,朴素贝叶斯分类器⑷是学习效率和分类效果较好的分类器之O朴素贝叶斯方法,是目前公认的一种简单有效的分类方法,它是一种基于概率的分类方法,被广泛地应用于模式识别、自然语言处理、机器人导航、规划、机器学习以及利用贝叶斯网络技术构建和分析软件系统。2贝叶斯分类2.1分类问题综述对于分类问题,其实谁都不会陌生,说我们每个人每天都在执行分类操作一点都不夸张,只是我
4、们没有意识到罢了。例如,当你看到一个陌生人,你的脑子下意识判断TA是男是女;你可能经常会走在路上对身旁的朋友说“这个人一看就很有钱、那边有个非主流”之类的话,其实这就是一种分类操作。从数学角度来说,分类问题可做如下定义:已知集合:C"={几他和/={心、:丫2、…、…},确定映射规则y=/(/),使得任意%€/有且仅有一个的eu使得町=成立。(不考虑模糊数学里的模糊集情况)其中C叫做类别集合,其中每一个元素是一个类别,而I叫做项集合,其中每一个元素是一个待分类项,f叫做分类器。分类算法的任务就是构造分类器f。这里要着重强调,分类问
5、题往往采用经验性方法构造映射规则,即一般情况下的分类问题缺少足够的信息来构造100%正确的映射规则,而是通过对经验数据的学习从而实现一定概率意义上正确的分类,因此所训练出的分类器并不是一定能将每个待分类项准确映射到其分类,分类器的质量与分类器构造方法、待分类数据的特性以及训练样本数量等诸多因素有关。例如,医生对病人进行诊断就是一个典型的分类过程,任何一个医生都无法直接看到病人的病情,只能观察病人表现出的症状和各种化验检测数据来推断病情,这吋医生就好比一个分类器,而这个医生诊断的准确率,与他当初受到的教育方式(构造方法)、病人的症状
6、是否突岀(待分类数据的特性)以及医生的经验多少(训练样本数量)都有密切关系。2.2贝叶斯分类的基础——贝叶斯定理贝叶斯定理解决了现实生活里经常遇到的问题:已知某条件概率,如何得到两个事件交换后的概率,也就是在已知P(A
7、B)的情况下如何求得P(B
8、A)0这里先解释什么是条件概率:尸(小〃)表示事件B已经发生的前提下,事件A发生的概率,叫做事件B发生下事件A刊平)=中的条件概率。其基本求解公式为:PW)贝叶斯定理之所以有用,是因为我们在生活屮经常遇到这种情况:我们可以很容易直接得出P(A
9、B),P(B
10、A)则很难直接得出,但我们更关
11、心P(B
12、A),贝叶斯定理就为我们打通从P(A
13、B)获得P(B
14、A)的道路。贝叶斯定理公式如下:2.3朴素贝叶斯分类的原理与流程朴素贝叶斯分类是一种十分简单的分类算法,叫它朴素贝叶斯分类是因为这种方法的思想真的很朴素,朴素贝叶斯的思想基础是这样的:对于给出的待分类项,求解在此项出现的条件下各个类别岀现的概率,哪个最大,就认为此待分类项属于哪个类别。通俗来说,就好比这么个道理,你在街上看到一个黑人,我问你你猜这哥们哪里来的,你十有八九猜非洲。为什么呢?因为黑人中非洲人的比率最高,当然人家也可能是美洲人或亚洲人,但在没有其它可用信息下
15、,我们会选择条件概率最大的类别,这就是朴素贝叶斯的思想基础。朴素贝叶斯分类的正式定义如下:1、设不={如、。2、…、。加}为一个待分类项,而每个a为x的一个特征属性。2、有类别集合3、计算戸伽叭戸伽卜),…,P(如叭4、如果卩(加広)=…円弘
16、富)
此文档下载收益归作者所有