欢迎来到天天文库
浏览记录
ID:20964739
大小:50.00 KB
页数:11页
时间:2018-10-18
《基于朴素贝叶斯分类器文本分类算法(c语言)》由会员上传分享,免费在线阅读,更多相关内容在行业资料-天天文库。
1、基于朴素贝叶斯分类器的文本分类算法(C语言)#include#include//_getcwd(),_chdir()#include//_MAX_PATH,system()#include//_finddata_t,_findfirst(),_findnext(),_findclose()charvocabulary[1000][20];/*声明公有二维数组,用来存储分割好的单词*//*=================将要
2、分类的文本分割成单词存储在二维数组vocabulary中================*///@输入参数:要分类的文本//@输出参数:该文本中总单词数intSplitToWord(chartext[]){inti=0;charseps[]=",.";/*定义单词的分隔符*/char*substring;/******利用分隔符将文本内容分割成单词并存储******/substring=strtok(text,seps);while(substring!=NULL){strcpy(vocab
3、ulary[i],substring);//将单词存储到vocabulary数组中substring=strtok(NULL,seps);i++;}returni;//返回一共多少个单词}/*===============================计算该目录下的文件数================================*///@输入参数:无//@输出参数:该目录下.txt文件数intCountDirectory(){intcount=0;//txt文件计数器longhFile;
4、_finddata_tfileinfo;/********查找.txt文件,记录文件数**********/if((hFile=_findfirst("*.txt",&fileinfo))!=-1L){do{count++;}while(_findnext(hFile,&fileinfo)==0);}returncount;}/*===================================计算某类别中∏P(ai
5、vj)==================================
6、=*///@输入参数:分类文本中单词数//@输出参数:该类别下∏P(ai
7、vj)floatCalculateWordProbability(intwordCount){intcountSame;//分类文本中的某单词在所有训练样本中出现次数intcountAll=0;//训练样本中总单词数chartoken;FILE*fp;floatwordProbability=1;//为后面联乘做准备inti,j;longhFile;_finddata_tfileinfo;for(j=0;j8、nt;j++)//对于分类样本中的每一个单词{countSame=0;countAll=0;if((hFile=_findfirst("*.txt",&fileinfo))!=-1L)//对于该类别下每一个.txt文本{do{if((fp=fopen(fileinfo.name,"r"))==NULL)//是否能打开该文本{printf("Sorry!Cannotopenthefile!");exit(0);}/********存储此.txt文件中每个单词并与分类文本的单词作比较******9、*/while((token=fgetc(fp))!=EOF){charkeyword[1024];i=0;keyword[0]=token;//将每个词第一个字符赋给数组第一个元素while((keyword[++i]=fgetc(fp))!=''&&keyword[i]!='t'&&keyword[i]!=EOF&&keyword[i]!='');//开始读字符,直到遇到空白符,说明找到一个词keyword[i]=' ';//加结束符countAll++;if(strcmp(keyw10、ord,vocabulary[j])==0)//比较两个单词是否相同countSame++;}fclose(fp);}while(_findnext(hFile,&fileinfo)==0);}wordProbability*=(float)(countSame+1)/(float)(wordCount+countAll)*300;//计算∏P(wj11、vi),为了扩大效果而*380}returnwordProbability;}/*============================计算每个
8、nt;j++)//对于分类样本中的每一个单词{countSame=0;countAll=0;if((hFile=_findfirst("*.txt",&fileinfo))!=-1L)//对于该类别下每一个.txt文本{do{if((fp=fopen(fileinfo.name,"r"))==NULL)//是否能打开该文本{printf("Sorry!Cannotopenthefile!");exit(0);}/********存储此.txt文件中每个单词并与分类文本的单词作比较******
9、*/while((token=fgetc(fp))!=EOF){charkeyword[1024];i=0;keyword[0]=token;//将每个词第一个字符赋给数组第一个元素while((keyword[++i]=fgetc(fp))!=''&&keyword[i]!='t'&&keyword[i]!=EOF&&keyword[i]!='');//开始读字符,直到遇到空白符,说明找到一个词keyword[i]=' ';//加结束符countAll++;if(strcmp(keyw
10、ord,vocabulary[j])==0)//比较两个单词是否相同countSame++;}fclose(fp);}while(_findnext(hFile,&fileinfo)==0);}wordProbability*=(float)(countSame+1)/(float)(wordCount+countAll)*300;//计算∏P(wj
11、vi),为了扩大效果而*380}returnwordProbability;}/*============================计算每个
此文档下载收益归作者所有