dianzi67的个人空间 https://blog.eetop.cn/loveer [收藏] [复制] [分享] [RSS]

空间首页 动态 记录 日志 相册 主题 分享 留言板 个人资料

日志

怎么把CAJ与PDF文件转换为word

已有 1857 次阅读| 2010-5-15 10:18 |个人分类:学习技巧

怎么把CAJPDF文件转换为word

现在网上的许多资料都是以CAJPDF等文件格式提供的,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJPDF等文件中提取全部文本的方法,简便快捷,效率很高。
    从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat 5 专业版浏览器软件安装Office2003,并完全安装Of?fice工具Microsoft Office Document Imaging,然后在打印机里面会增加Microsoft Office Document Image Writer打印机。 Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格。
    一、CAJ文件的识别
    (一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。
    (二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。
    (三)在CAJ浏览器程序窗口中,选择文件”→“打印,并选择打印机为Microsoft Office Document Image Writer打印机,勾选打印到文件选项和确定打印页数。
    (四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft Office Document Image 自动打开刚才保存的打印文件。
    (五)在Microsoft Office Document Image窗口中,选择页面菜单中的选择所有页面菜单项,然后选择工具菜单中的使用OCR识别文本提取文本。
    (六)选择工具下的将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。
    二、PDF文件的识别
    (一)以文本形式保存的PDF文件,用acrobat 5 专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。
     (二)以图片形式保存的PDF文件,将PDF文件打印到Microsoft Office Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,然后在Microsoft Office Document Image中选择工具菜单中的使用OCR识别文本,识别完成后,在选择工具下的,将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。
    (三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2) 进行。
    (四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的工具”→“语言”→“中文繁简转换

 


点赞

评论 (0 个评论)

facelist

您需要登录后才可以评论 登录 | 注册

  • 关注TA
  • 加好友
  • 联系TA
  • 0

    周排名
  • 0

    月排名
  • 0

    总排名
  • 0

    关注
  • 2

    粉丝
  • 1

    好友
  • 4

    获赞
  • 28

    评论
  • 490

    访问数
关闭

站长推荐 上一条 /1 下一条

小黑屋| 关于我们| 联系我们| 在线咨询| 隐私声明| EETOP 创芯网
( 京ICP备:10050787号 京公网安备:11010502037710 )

GMT+8, 2024-5-23 16:21 , Processed in 0.024461 second(s), 15 queries , Gzip On, Redis On.

eetop公众号 创芯大讲堂 创芯人才网
返回顶部