CAJ、NH、KDH、PDF等格式转换成Word

CAJ、NH、KDH、PDF等格式转换成Word

ID:8238231

大小:29.00 KB

页数:3页

时间:2018-03-11

CAJ、NH、KDH、PDF等格式转换成Word_第1页
CAJ、NH、KDH、PDF等格式转换成Word_第2页
CAJ、NH、KDH、PDF等格式转换成Word_第3页
资源描述:

《CAJ、NH、KDH、PDF等格式转换成Word》由会员上传分享,免费在线阅读,更多相关内容在应用文档-天天文库

1、从中国知网下载而来的资料,大都是.CAJ、.NH、.KDH、.PDF等格式,需使用CAJViewer全文浏览器进行查看。现在网上的许多资料都是以CAJ、PDF等文件格式提供的,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、PDF等文件中提取全部文本的方法,简便快捷,效率很高。一、CAJ文件的识别方法一、(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。(二)然后,启动CAJViewer浏览器程序,并在该程序中打

2、开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为MicrosoftOfficeDocumentImageWriter打印机,勾选打印到文件选项和确定打印页数。(四)保存打印文件(*.prn)到适当位置。等待打印完成后,MicrosoftOfficeDocumentImage自动打开刚才保存的打印文件。(五)在MicrosoftOfficeDocumentImage窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工

3、具”菜单中的“使用OCR识别文本”提取文本。(六)选择“工具”下的“将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。方法二、CAJ文件直接可以复制、粘贴获得,打开文件→工具→文本选择、选择图像→复制、粘贴就可以了。方法三、首先,启动CAJViewer浏览器程序,用CAJViewer7.02打开刚才保存的CAJ格式的文件,然后在每页的左右两边分区域选取文字,再在选取区域内,单击右键“文字识别”,这时会出现“文字识别结果”对话框,单击“复制到剪贴板”或“发送到Word”,即可大功告成。不足:就是不能对整篇

4、、整页文档进行识别。二、PDF文件的识别方法一、(一)以文本形式保存的PDF文件,用acrobat5专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。(二)以图片形式保存的PDF文件,将PDF文件打印到MicrosoftOfficeDocumentImageWriter打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用MicrosoftOfficeDocumentImage打开此文件,然后在Micr

5、osoftOfficeDocumentImage中选择“工具”菜单中的“使用OCR识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。(三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2)进行。(四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中文繁简转换”方法二、PDF和WORD相互转化,可以下载一个转化软件即SolidConverterPDF6.0Build669,直接转化也很方便。方法三、打开文件

6、→工具→基本工具→选择→选择文字复制、粘贴就可以了,非常方便。三、超星文件的识别(一)全文件识别打印到MicrosoftOfficeDocumentImageWriter打印机,然后按上述PDF文件的识别步骤中第二点操作,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到Word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意识别速度比其他格式要慢很多,请保持耐心。一般一本200多页的书,识别需要

7、几分钟的时间。(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word。四、后记经过试验,发现MicrosoftOfficeDocumentImage存在一些不稳定的问题,如在用CAJ打印到MicrosoftOfficeDocumentImageWriter时,发现用CAJ5.5版本比较快,而CAJ5.0有时出现假死机。页面显示大时,转化的识别率较高。如果页数多的文件,包括超星,可以分多次转化。由于虚拟打印到MicrosoftOfficeDocumen

8、tImageWriter比较慢,并且形成的虚拟文件很大,1本200多页的书大约是60M,因此会严重影响机器的运行速度、C盘和内存空间。建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在任务栏中会出现打印机图标,可以双击,看到打印任务的进度,避免误以为死机。转化

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。