数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类

数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类

ID:6810591

大小:595.50 KB

页数:48页

时间:2018-01-26

数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类_第1页
数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类_第2页
数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类_第3页
数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类_第4页
数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类_第5页
资源描述:

《数学建模竞赛论文-基于模糊聚类及bp神经网络的dna序列分类》由会员上传分享,免费在线阅读,更多相关内容在学术论文-天天文库

1、基于模糊聚类及BP神经网络的DNA序列分类48摘要本文通过对已知分类的DNA序列的分析,对未标明类别的第21-40组以及182组DNA序列进行了分类。首先运用4种常用的模糊聚类方法:相关系数法、夹角余弦法、海明距离法、欧氏距离法对第1-20组序列分类。根据分类结果的正确率,发现相关系数法的分类效果很不理想,所以将除相关系数法外的3种方法所得到的分类结果进行综合,分别得到了模糊聚类方法在以碱基含量和氨基酸含量为序列特征下的分类结果及正确率。再构造三层BP神经网络,应用Matlab神经网络工具箱,将已知分类的1-20组DNA序列中的1—6,11—16组作为学习样本确定较优的网

2、络参数,并以7—10,17—20组序列作为检验样本,检验此神经网络算法在以碱基含量和氨基酸含量为序列特征下的分类结果及正确率。然后将这四种不同聚类方案的分类效果进行分析比较,选出正确率较高的方案对第21-40组以及182组DNA序列进行了分类。最后对分类结果进行了合理性分析,客观地指出了模型的优缺点,还针对建模过程中简化、忽略的因素给出了模型改进的方向。关键词DNA序列分类碱基含量氨基酸含量模糊聚类BP神经网络48一、问题重述2000年6月,人类基因组计划中DNA全序列草图完成,预计2001年可以完成精确的全序列图,此后人类将拥有一本记录着自身生老病死及遗传进化的全部信息

3、的“天书”。这本大自然写成的“天书”是由4个字符A,T,C,G按一定顺序排成的长约30亿的序列,其中没有“断句”也没有标点符号,这4个字符表示4种碱基。破译这部世界上最巨量信息的“天书”要研究DNA全序列具有什么结构,由这4个字符排成的看似随机的序列中隐藏着什么规律,这是生物信息学(Bioinformatics)最重要的课题之一。人类发现了DNA序列中的一些规律性和结构。例如,在全序列中有一些是用于编码蛋白质的序列片段,即由这4个字符组成的64种不同的3字符串,其中大多数用于编码构成蛋白质的20种氨基酸。又例如,在不用于编码蛋白质的序列片段中,A和T的含量特别多些,于是以

4、某些碱基特别丰富作为特征去研究DNA序列的结构也取得了一些结果。此外,利用统计的方法还发现序列的某些片段之间具有相关性,等等。这些发现让人们相信,DNA序列中存在着局部的和全局性的结构,充分发掘序列的结构对理解DNA全序列是十分有意义的。目前在这项研究中最普通的思想是省略序列的某些细节,突出特征,然后将其表示成适当的数学对象。这种被称为粗粒化和模型化的方法往往有助于研究规律性和结构。需完成的工作是:1.从题中所给的已知类别的人工制造序列(序列标号1—10为A类,11-20为B类)中提取特征,构造分类方法,并用这些已知类别的序列衡量本文所采用的方法是否足够好。2.选取最适宜

5、的方法对另外20个未标明类别的人工序列(标号21-40)进行分类。要详细描述所采用的方法,给出计算程序,并准确注明所使用的现成的分类方法的名称。3.用本文所采用的方法对数据文件Nat-model-data中给出的182个较长的自然DNA序列进行分类,给出分类结果。二、问题分析2.1背景知识(1)转录:以DNA双链中的一条为模板合成mRNA的过程。(2)翻译:将mRNA中的碱基序列翻译为蛋白质的氨基酸序列的过程。(3)密码子:mRNA链上决定一个氨基酸的相邻的三个碱基叫做一个“密码子”。共有64种密码子,其中有61种能合成氨基酸的密码子(包括起始密码子)及3个终止密码子,由

6、它们决定多肽链的氨基酸种类和排列顺序的特异性以及翻译的起始和终止。(4)起始密码子:mRNA翻译起始时的第一个密码子。48(5)由61种能合成氨基酸的密码子能够合成20中氨基酸。(6)DNA,mRNA,密码子及氨基酸的关系:(7)密码子与氨基酸对照表1.表1.密码子与氨基酸对照表2.2问题的分析要构造对题中所给的1-20条人工制造序列的分类方法,就要首先确定从序列中提取何种特征来进行分类。而序列特征需要满足以下两个条件:1.可以标志A组和B组;2.有一定的生物学意义。其中,第二个条件可以看做是在分类正确率达到要求后,对分类方法是否有实用性的一种衡量标准。运用excel对题

7、中已分类序列(第1-20组)进行分析,得出碱基含量分布图(如图1):48图1碱基含量分布表发现在不同段的DNA中,每个碱基出现的概率不同,从大体分布来看,序列所以考虑将4种碱基各自的含量作为序列的特征。又因为有科学研究结果表明:在不用于编码蛋白质的序列片断中,A和T的含量特别多些,因此,以碱基含量作为特征去研究DNA序列的分类是具有一定的生物学意义的。而这种只考虑了碱基含量的方法并没有考虑到碱基排列顺序上的不同而造成翻译产生的氨基酸不同。如表1中,序列(UCA)与序列(CUA)有着相同的碱基含量,却因排列顺序的不同而可以分别转

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。