这篇文章最初只描述使用 PDFBox 来解析PDF文件。现在它已经被扩展到包括使用 IFilter 和 iTextSharp 的例程了。
   这篇文章和对应的Visual Studio项目已经更新到目前最新的 PDFBox 版本(1.8.4)。可以下载包含所有依赖内容的完整项目(要消除依赖关系有点棘手)。
   如何解析 PDF 文件
   在。NET中从PDF文件里提取文本的几种主要方法有:
   Microsoft 的 IFilter 接口 和 Adobe 的 IFilter 实现;
   iTextSharp;
   PDFBox.
   不幸的是这些 PDF 解析方案都不完美。我们将在下面讨论这些方法。
   Adobe PDF IFilter
   为了使用 IFilter 接口来解析 PDF 文件,你需要:
   Windows 2000 或者后续版本
   Adobe Acrobat 或 Reader 7.0.5+ (或单独的 Adobe PDF IFilter [adobe.com])
   IFilter COM 封装类 [dotlucene.net]
   样例代码:
   using IFilter;
   // …
   public static string ExtractTextFromPdf(string path) {
   return DefaultParser.Extract(path);
   }
   缺点:
   使用了不可靠的 COM 互操作来处理 IFilter 接口 (并且组合 IFilter COM、 Adobe PDF IFilter 特别麻烦)。
   需要在目标系统上单独安装 Adobe IFilter.如果你需要对其它人发布可索引的解决方案,会很痛苦。
   iTextSharp www.yztrans.com
   iTextSharp是一个 Java 的PDF 操作库iText的。NET输出。它主要着眼于编辑PDF而不是阅读,但它当然也支持从PDF中提取文本(尽管有点大材小用)。
   例程:
   using iTextSharp.text.pdf;
   using iTextSharp.text.pdf.parser;
   // …
   public static string ExtractTextFromPdf(string path)
   {
   using (PdfReader reader = new PdfReader(path))
   {
   StringBuilder text = new StringBuilder();
   for (int i = 1; i <= reader.NumberOfPages; i++)
   {
   text.Append(PdfTextExtractor.GetTextFromPage(reader, i));
   }
   return text.ToString();
   }
   }
   信用证: 成员号 10364982
   缺点:
   需要许可证(如果你不喜欢 AGPL许可证 的话)
   PDFBox www.tygj123.com
   PDFBox是另一个Java PDF类库。它同时也可以与原来的Java Lucene一同使用(参见LucenePDFDocument)。
   幸运的是,PDFBox有一个使用IKVM.NET开发的。NET版本 (只需访问PDFBox下载页)。
   在。NET中使用PDFBox需要引用:
   IKVM.OpenJDK.Core.dll
   IKVM.OpenJDK.SwingAWT.dll
   pdfbox-1.8.4.dll
   并将下列文件复制到bin文件夹下:
   commons-logging.dll
   fontbox-1.8.4.dll
   IKVM.OpenJDK.Util.dll
   IKVM.Runtime.dll
   使用PDFBox解析PDF十分简单:
   using org.apache.pdfbox.pdmodel;
   using org.apache.pdfbox.util;
   // …
   private static string ExtractTextFromPdf(string path)
   {
   PDDocument doc = null;
   try {
   doc = PDDocument.load(path)
   PDFTextStripper stripper = new PDFTextStripper();
   return stripper.getText(doc);
   }
   finally {
   if (doc != null) {
   doc.close();
   }
   }
   }
   编译后的大小加起来差不多有18MB:
   IKVM.OpenJDK.Core.dll (4 MB)
   IKVM.OpenJDK.SwingAWT.dll (6 MB)
   pdfbox-1.8.4.dll (4 MB)
   commons-logging.dll (82 kB)
   fontbox-1.8.4.dll (180 kB)
   IKVM.OpenJDK.Util.dll (2 MB)
   IKVM.Runtime.dll (1 MB)
   速度还可以:解析U.S. Copyright Act PDF (5.1 MB)文件用了13秒。
   感谢bobrien100提供的改进建议。
   缺点:
   IKVM.NET依赖 (18 MB)
   速度(尤其是IKVM.NET的启动时间)

C# 实现将PDF转文本的功能的更多相关文章

  1. C# 实现将 PDF 转文本的功能

    更新 2014年2月27日: 这篇文章最初只描述使用 PDFBox 来解析PDF文件.现在它已经被扩展到包括使用 IFilter 和 iTextSharp 的例程了. 这篇文章和对应的Visual S ...

  2. PDF编辑:pdfFactory文本备注功能详解

    除了word的doc文件外,PDF也是我们经常接触到的文件格式,经常需要在pdf文件上进行编辑与修改,或者给内容做提示和备注. 文件的文本备注功能可以用pdfFactory来进行,编辑打印PDF一条龙 ...

  3. 个人永久性免费-Excel催化剂功能第50波-批量打印、导出PDF、双面打印功能

    在倡导无纸化办公的今天,是否打印是一个碍眼的功能呢,某些时候的确是,但对于数据的留存,在现在鼓吹区块链技术的今天,仍然不失它的核心价值,数据报表.单据打印出来留存,仍然是一种不可或缺的数据存档和防篡改 ...

  4. ABBYY FineReader 15新增智能PDF文档转换功能

    ABBYY FineReader 15(Windows系统)新增智能PDF文档转换功能,可自动检测导入PDF数字文档的文本层质量,确保转变为可编辑格式后的准确结果:从表单字段和文本框中提取文本,准确保 ...

  5. ABBYY FineReader 15 PDF文档查看功能

    PDF文档查看功能是ABBYY FineReader 15(Windows系统)OCR文字识别软件中PDF编辑器的一项基础功能,可供用户查看,搜索PDF文档,无需进入编辑模式,也可复制其中的文本,图片 ...

  6. ABBYY FineReader 15 PDF文档编辑功能详解

    ABBYY FineReader 15(Windows系统)OCR文字识别软件作为一款通用 PDF 工具,能轻松有效地对各种 PDF文档和纸质文档,进行数字化.检索.编辑.转换.包含.分享和合作,而其 ...

  7. 设置Adobe Reader打开PDF文件保持记忆功能

    设置Adobe Reader打开PDF文件保持记忆功能 打开菜单“编辑”->“首选项”. 选择种类中的“文档”,在“打开设置”区域勾上“重新打开文档时恢复上次视图设置(R)”,确定之后就可以在下 ...

  8. 个人永久性免费-Excel催化剂功能第25波-小白适用的文本处理功能

    翻看各大插件,都不约而同地出现系列文本处理的功能,自己在使用Excel过程中,在临时性的需求时,也会用上这几种文本处理,但仅适用于小范围的使用,使用这些功能不是数据处理的正确的之道,数据处理的核心需求 ...

  9. java -PDF添加文本水印与图片水印

    java pdf添加水印文本及图片文本 PDF文件添加文本水印: private static int interval = 30; public static void waterMark(Stri ...

随机推荐

  1. centos7安装VLC播放器

    centos7安装VLC播放器 1.安装eple 下载地址:https://dl.fedoraproject.org/pub/epel/7/x86_64/e/epel-release-7-5.noar ...

  2. centos ppp拨号

    CentOS 6.4 电信ADSL 拨号连接的配置,亲测 .下载 rp-pppoe-3.8.tar.gz http://down1.chinaunix.net/distfiles/rp-pppoe-3 ...

  3. EDM(邮件营销)

    官冲拉手网CTO举了个EDM(邮件营销)的例子: 在做大数据分析应用之前,通过EDM带来的订单转化率很低.在采用大数据解决方案后,可以根据用户之前的浏览习惯猜测他的喜好和购买习惯,从而针对性的推送个性 ...

  4. Java中的局部代码块、构造代码块、静态代码块

    局部代码块: 作用:控制变量的生命周期: 在程序中,当我们已经使用完 x 后,并且在接下来的代码中,不会再用到x,那么就没必要让x 在内存中占用空间了,这用情况下,可以使用 局部代码块,将x及其所设计 ...

  5. 关于C#中Thread.Join()的一点理解

    原文地址:http://www.cnblogs.com/slikyn/articles/1525940.html 今天是第一次在C#中接触Thread,自己研究了一下其中Thread.Join()这个 ...

  6. IE浏览器下面要实现滤镜(transparent),必须要加filter

    遇到的问题是: ie9下面的a标签样式是background-color:transparent;导致链接失效,点不动.这个问题跟IE9及其以下a标签链接加 background-color:tran ...

  7. python_Opencv_读取视频

    目标 • 学会读取视频文件,显示视频,保存视频文件 • 学会从摄像头获取并显示视频 • 你将会学习到这些函数:cv2.VideoCapture(),cv2.VideoWrite()用摄像头捕获视频 使 ...

  8. 关于Web Api的HelpPage文档注释问题

    之前使用Microsoft.AspNet.WebApi.HelpPage的时候,一直为返回对象的注释发愁,以为这是个BUG. 这个注释的解决办法其实要从其原理理解就明白了. 因为HelpPage是读取 ...

  9. mysql5.5.17源代码安装

    1. 源代码包下载  源代码包通常也採用tar.gz压缩.名称中仅仅包括版本号信息,大小也比RPM包.二进制包小非常多,解压后的文件里含有INSTALL-SOURCE文件.可从MySQL官网(http ...

  10. android 监听短信数据库,制作短信控制工具,控制别人的手机!!(一)

    序言:本程序示例本着简洁易懂的目的,只做了简单的功能实现,需要用户启动应用,收到短信才有效果.作者将会在后面的(二)篇中加入服务后台运行.自动启动功能,实现一个真正的短信控制工具.本文的目的很简单,让 ...