利用java从docx文档中提取文本内容

使用Apache的第三方jar包，地址为https://poi.apache.org/

docx文档内容如图：

目录结构：

每个文件夹的名称为日期加上来源，例如：20180618医院，每个docx文档的名称是被试的姓名和来源地，例如：小明-xx社区。

代码如下：

MriReportService.java

package services;

import java.io.BufferedWriter;

import java.io.File;

import java.io.FileWriter;

import java.io.IOException;

import java.util.ArrayList;

import java.util.LinkedList;

import java.util.regex.Pattern;

public class MriReportService {

    public static String[] findYearAndSource(File file) {

        String[] result = new String[2];

        // 日期

        String dateStr = file.getParentFile().getName();

//        System.out.println(dateStr);

        if (Pattern.compile("\\d").matcher(dateStr).find()) {

            dateStr = Pattern.compile("-").matcher(dateStr).replaceAll("");

            result[0] = dateStr.substring(0, 8);

        } else {

            result[0] = "";

        }

        // 社区

        String fileName = file.getName();

        if (fileName.indexOf("-") < 0) {

            fileName = Pattern.compile("\\.").matcher(fileName).replaceAll("-.");

        }

        fileName = Pattern.compile("--+").matcher(fileName).replaceAll("-");

        result[1] = fileName.substring(fileName.indexOf("-") + 1, fileName.indexOf("."));

        return result;

    }

    public static LinkedList<File> findAllFile(String rootPath) {

        File file = new File(rootPath);

        LinkedList<File> list = new LinkedList<>();

        if (file.exists()) {

            File[] subDirs = file.listFiles();

            for (File tmpDir : subDirs) {

//                System.out.println(tmpDir);

                for (File tmpFile : tmpDir.listFiles()) {

                    if (tmpFile.isFile() && tmpFile.getName().indexOf("~$") < 0) {

                        list.add(tmpFile);

                    }

                }

            }

        }

        return list;

    }

    public static ArrayList<String> findSub(String docx) {

        String name = "";

        String gender = "";

        String age = "";

        String MRICheck = "";

        String MRIMem = "";

        if (!Pattern.compile("性别：").matcher(docx).find() || !Pattern.compile("年龄：").matcher(docx).find()) {

            try {

                name = docx.substring(docx.indexOf("姓名：") + 3, docx.indexOf("检查项目："));

                MRICheck = docx.substring(docx.indexOf("MRI检查描述：") + 8, docx.indexOf("MRI印象："));

                MRIMem = docx.substring(docx.indexOf("MRI印象：") + 6, docx.indexOf("报告医师："));

            } catch (StringIndexOutOfBoundsException e) {

//                name = "";

            }

        } else {

            name = docx.substring(docx.indexOf("姓名：") + 3, docx.indexOf("性别："));

            gender = docx.substring(docx.indexOf("性别：") + 3, docx.indexOf("年龄："));

            age = docx.substring(docx.indexOf("年龄：") + 3, docx.indexOf("检查项目："));

            MRICheck = docx.substring(docx.indexOf("MRI检查描述：") + 8, docx.indexOf("MRI印象："));

            MRIMem = docx.substring(docx.indexOf("MRI印象：") + 6, docx.indexOf("报告医师："));

        }

        ArrayList<String> result = new ArrayList<>();

        result.add(name);

        result.add(gender);

        result.add(age);

        result.add(MRICheck);

        result.add(MRIMem);

        return result;

    }

}

Main.java

import org.apache.poi.xwpf.extractor.XWPFWordExtractor;

import org.apache.poi.xwpf.usermodel.XWPFDocument;

import java.io.*;

import java.util.ArrayList;

import java.util.regex.*;

import static services.MriReportService.findAllFile;

import static services.MriReportService.findSub;

import static services.MriReportService.findYearAndSource;

public class Main {

    public static void main(String[] args) throws Exception {

        if (args.length < 2) {

            System.out.println("请输入源文件和目标文件的完整路径！");

            System.out.println("举个例子：java -jar docx2csv.jar d:\\核磁报告 d:\\result.csv");

            System.exit(-1);

        }

        String srcPath = args[0];

        String outPath = args[1];

        ArrayList<ArrayList<String>> result = new ArrayList<>();

        for (File tmpFile : findAllFile(srcPath)) {

            String[] yearAndSrc = findYearAndSource(tmpFile);

            FileInputStream fis = new FileInputStream(tmpFile);

            XWPFDocument xdoc = new XWPFDocument(fis);

            XWPFWordExtractor extractor = new XWPFWordExtractor(xdoc);

            String docx = extractor.getText();

            docx = Pattern.compile("\\s").matcher(docx).replaceAll("");

            ArrayList<String> tmpRe = findSub(docx);

            tmpRe.add(yearAndSrc[0]);

            tmpRe.add(yearAndSrc[1]);

            result.add(tmpRe);

            fis.close();

        }

        write(result, outPath);

    }

    public static void write(ArrayList<ArrayList<String>> result, String outPath) throws IOException {

        BufferedWriter bufferedWriter = new BufferedWriter(new OutputStreamWriter(

                new FileOutputStream(outPath), "GBK"));

        for (ArrayList<String> tmpStrs : result) {

//            System.out.println();

            bufferedWriter.write(tmpStrs.get(0) + "," + tmpStrs.get(1) + ","

                    + tmpStrs.get(2) + "," + tmpStrs.get(3) + ","

                    + tmpStrs.get(4) + "," + tmpStrs.get(5) + ","

                    + tmpStrs.get(6));

            bufferedWriter.newLine();

        }

        bufferedWriter.close();

    }

}

利用java从docx文档中提取文本内容的更多相关文章

如何使用免费PDF控件从PDF文档中提取文本和图片
如何使用免费PDF控件从PDF文档中提取文本和图片概要现在手头的项目有一个需求是从PDF文档中提取文本和图片,我以前也使用过像iTextSharp, PDFBox 这些免费的PD ...
MVC架构下，使用NPOI读取.DOCX文档中表格的内容
1.使用NPOI,可以在没有安装office的设备上读wiod.office.2.本文只能读取.docx后缀的文档.3.MVC架构中,上传文件只能使用form表单提交,转到控制器后要依次实现文件上传. ...
使用Python中的HTMLParser、cookielib抓取和解析网页、从HTML文档中提取链接、图像、文本、Cookies（二）（转）
对搜索引擎.文件索引.文档转换.数据检索.站点备份或迁移等应用程序来说,经常用到对网页(即HTML文件)的解析处理.事实上,通过 Python语言提供的各种模块,我们无需借助Web服务器或者Web浏览 ...
【python】使用HTMLParser、cookielib抓取和解析网页、从HTML文档中提取链接、图像、文本、Cookies
一.从HTML文档中提取链接模块HTMLParser,该模块使我们能够根据HTML文档中的标签来简洁.高效地解析HTML文档. 处理HTML文档的时候,我们常常需要从其中提取出所有的链接.使用HTM ...
Python中的HTMLParser、cookielib抓取和解析网页、从HTML文档中提取链接、图像、文本、Cookies（二）
对搜索引擎.文件索引.文档转换.数据检索.站点备份或迁移等应用程序来说,经常用到对网页(即HTML文件)的解析处理.事实上,通过 Python语言提供的各种模块,我们无需借助Web服务器或者Web浏览 ...
python 解析docx文档的方法，以及利用Python从docx文档提取插入的文本对象和图片
首先安装docx模块,通过pip install docx或者在docx官方链接上下载安装都可以下面来看下如何解析docx文档:文档格式如下有3个部分组成 1 正文:text文档 2 一个表格. ...
java使用正则从爬虫爬的txt文档中提取QQ邮箱
我的需求是从一堆文档中提取出qq邮箱,写了这篇帖子,希望能帮助和我有一样需求的人,谢谢!...... import java.io.BufferedReader; import java.io.Fil ...
Java 在 Word 文档中使用新文本替换指定文本
创作一份文案,经常会高频率地使用某些词汇,如地名.人名.人物职位等,若表述有误,就需要整体撤换.文本将介绍如何使用Spire.Doc for Java,在Java程序中对Word文档中的指定文本进行替 ...
Java 在PDF文档中绘制图形
本篇文档将介绍通过Java编程在PDF文档中绘制图形的方法.包括绘制矩形.椭圆形.不规则多边形.线条.弧线.曲线.扇形等等.针对方法中提供的思路,也可以自行变换图形设计思路,如菱形.梯形或者组合图形等 ...

随机推荐

oracle关于rownum的使用【oracle】
转自:https://blog.csdn.net/qiuzhi__ke/article/details/78892822 关于rownum是怎么产生的(网上有不少的文章,下面是摘录): rownum是 ...
深入理解Java虚拟机（1）
对于Java程序员,在虚拟机自动内存管理机制的帮助下,不需要再为每一个操作写配对的释放资源操作,不容易出现内存泄露和内存溢出问题.加深对Java虚拟机的理解,有助于在发现问题时精准定位问题,排 ...
【python 爬虫】fake-useragent Maximum amount of retries reached解决方案
前言在用fake-useragent的时候发生报错,fake_useragent.errors.FakeUserAgentError: Maximum amount of retries reach ...
Linux 下批量杀死进程
ps aux|grep python|grep -v grep|cut -c 9-15|xargs kill -15 管道符“|”用来隔开两个命令,管道符左边命令的输出会作为管道符右边命令的输入.下面 ...
afert和b的伪类画三角形
/* 提示信息 */ .content-tishi{ width: 6.93rem; margin: 0 auto; background: #e9eaea; display: flex; flex- ...
vue 上拉刷新组件
背景,项目中经常会出现需要上拉加载更多或者下拉刷新的需求,一直以来呢都是借用各种UI库来实现,但是不知道啥情况,最近在使用的时候,一直有问题,出不了效果,然人很恼火,于是只能自己动手来实现以下, 这次 ...
Docker 入门：Dockerfile
主要内容: 什么是 Dockerfile 查看 DockerHub 中镜像的 Dockerfile Dockerfile 编写 Dockerfile 常用命令什么是 Dockerfile 使用 Do ...
[JavaWeb基础] 001.简单的JavaWeb代码和Tomcat配置部署
简介: 其实说明白了就是J2EE应用开发,前端可以有很多的展现方式,后端由Java做逻辑运算和数据支撑.适用于创建服务器应用程序和服务,为搭建具有可伸缩性.灵活性.易维护性的商务系统提供了良好的机制. ...
Gauge框架在JS中的简单应用
gauge框架简介 Gauge是一个轻量级的跨平台测试自动化工具. gauge安装[Win10 64位下测试] [百度网盘链接]https://pan.baidu.com/s/1bidE34gLLrS ...
最小生成树——Kruskal算法理解
背景:本文是在小甲鱼数据结构教学视频中的代码的基础上,添加详细注释而完成的.该段代码并不完整,仅摘录了核心算法部分,结合自己的思考,谈谈理解. Prim算法理解: 如图(摘录自小甲鱼教学视频中的图片) ...

利用java从docx文档中提取文本内容

利用java从docx文档中提取文本内容

利用java从docx文档中提取文本内容的更多相关文章

随机推荐

热门专题