poi word 转html (.DOC .DOCX )

注：不支持图片，支持表格

package com.bjhy.platform.report.commons;

import java.io.BufferedWriter;

import java.io.ByteArrayOutputStream;

import java.io.File;

import java.io.FileInputStream;

import java.io.FileNotFoundException;

import java.io.FileOutputStream;

import java.io.IOException;

import java.io.InputStream;

import java.io.OutputStream;

import java.io.OutputStreamWriter;

import java.util.List;

import javax.xml.parsers.DocumentBuilderFactory;

import javax.xml.parsers.ParserConfigurationException;

import javax.xml.transform.OutputKeys;

import javax.xml.transform.Transformer;

import javax.xml.transform.TransformerException;

import javax.xml.transform.TransformerFactory;

import javax.xml.transform.TransformerFactoryConfigurationError;

import javax.xml.transform.dom.DOMSource;

import javax.xml.transform.stream.StreamResult;

import org.apache.poi.hwpf.HWPFDocument;

import org.apache.poi.hwpf.converter.PicturesManager;

import org.apache.poi.hwpf.converter.WordToHtmlConverter;

import org.apache.poi.hwpf.usermodel.Picture;

import org.apache.poi.hwpf.usermodel.PictureType;

import org.apache.poi.poifs.filesystem.OfficeXmlFileException;

import org.apache.poi.xwpf.converter.core.FileImageExtractor;

import org.apache.poi.xwpf.converter.core.FileURIResolver;

import org.apache.poi.xwpf.converter.xhtml.XHTMLConverter;

import org.apache.poi.xwpf.converter.xhtml.XHTMLOptions;

import org.apache.poi.xwpf.usermodel.XWPFDocument;

import org.w3c.dom.Document;

public class Word2Html {

    public static void main(String argv[]) {

        try {

            // newfunc("D://213.docx");

            // convert2Html("D://狱情月报表.docx","D://1.html");

        } catch (Exception e) {

            e.printStackTrace();

        }

    }

    public static void writeFile(String content, String path) {

        FileOutputStream fos = null;

        BufferedWriter bw = null;

        try {

            File file = new File(path);

            fos = new FileOutputStream(file);

            bw = new BufferedWriter(new OutputStreamWriter(fos, "utf-8"));

            bw.write(content);

        } catch (FileNotFoundException fnfe) {

            fnfe.printStackTrace();

        } catch (IOException ioe) {

            ioe.printStackTrace();

        } finally {

            try {

                if (bw != null)

                    bw.close();

                if (fos != null)

                    fos.close();

            } catch (IOException ie) {

            }

        }

    }

    public static String convert2Html(String fileName)

            throws TransformerException, IOException,

            ParserConfigurationException, OfficeXmlFileException {

        try {

            HWPFDocument wordDocument = new HWPFDocument(new FileInputStream(

                    fileName));// WordToHtmlUtils.loadDoc(new

                                // FileInputStream(inputFile));

            WordToHtmlConverter wordToHtmlConverter = new WordToHtmlConverter(

                    DocumentBuilderFactory.newInstance().newDocumentBuilder()

                            .newDocument());

            wordToHtmlConverter.setPicturesManager(new PicturesManager() {

                public String savePicture(byte[] content,

                        PictureType pictureType, String suggestedName,

                        float widthInches, float heightInches) {

                    return "/" + suggestedName;

                }

            });

            wordToHtmlConverter.processDocument(wordDocument);

            // save pictures

            List pics = wordDocument.getPicturesTable().getAllPictures();

            if (pics != null) {

                for (int i = 0; i < pics.size(); i++) {

                    Picture pic = (Picture) pics.get(i);

                    try {

                        pic.writeImageContent(new FileOutputStream("D://"

                                + pic.suggestFullFileName()));

                    } catch (FileNotFoundException e) {

                        e.printStackTrace();

                    }

                }

            }

            Document htmlDocument = wordToHtmlConverter.getDocument();

            ByteArrayOutputStream out = new ByteArrayOutputStream();

            DOMSource domSource = new DOMSource(htmlDocument);

            StreamResult streamResult = new StreamResult(out);

            TransformerFactory tf = TransformerFactory.newInstance();

            Transformer serializer = tf.newTransformer();

            serializer.setOutputProperty(OutputKeys.ENCODING, "UTF-8");

            serializer.setOutputProperty(OutputKeys.INDENT, "yes");

            serializer.setOutputProperty(OutputKeys.METHOD, "html");

            serializer.transform(domSource, streamResult);

            out.close();

            // writeFile(new String(out.toByteArray()), outPutFile);

            return new String(out.toByteArray());

        } catch (OfficeXmlFileException e) {

            // 1) Load DOCX into XWPFDocument

            InputStream in = new FileInputStream(new File(fileName));

            XWPFDocument document = new XWPFDocument(in);

            // 2) Prepare XHTML options (here we set the IURIResolver to

            // load images from a "word/media" folder)

            File imageFolderFile = new File("d://");

            XHTMLOptions options = XHTMLOptions.create().URIResolver(

                    new FileURIResolver(imageFolderFile));

            options.setExtractor(new FileImageExtractor(imageFolderFile));

            options.setIgnoreStylesIfUnused(false);

            options.setFragment(true);

            // 3) Convert XWPFDocument to XHTML

            // OutputStream out = new FileOutputStream(new File(

            // "d:/test.htm"));

            ByteArrayOutputStream out = new ByteArrayOutputStream();

            XHTMLConverter.getInstance().convert(document, out, options);

            out.close();

            // writeFile(new String(out.toByteArray()), outPutFile);

            return new String(out.toByteArray());

        } catch (IllegalArgumentException e) {

            // TODO Auto-generated catch block

            e.printStackTrace();

            return "";

        } catch (FileNotFoundException e) {

            // TODO Auto-generated catch block

            return "";

        } catch (TransformerFactoryConfigurationError e) {

            // TODO Auto-generated catch block

            e.printStackTrace();

            return "";

        }

    }

    // private static void newfunc(String fileName) throws IOException {

        // InputStream in = new FileInputStream(fileName);

        // XWPFDocument document = new XWPFDocument(in);

        // XHTMLOptions options = XHTMLOptions.create().indent( 4 );

        // OutputStream out = System.out;

        // XHTMLConverter.getInstance().convert( document, out, options );

    // }

}

本文转自：http://www.360doc.com/content/15/0507/16/25381599_468762015.shtml

poi word 转html (.DOC .DOCX )的更多相关文章

Apache POI Word基本使用
Apache POI Word 1.什么是Apache POI? Apache POI是一个流行的API,使用Java程序创建,修改和显示MS-Office文件. 它是由Apache Software ...
poi读取word2003（.doc文档）中的表格
poi读取word2003(.doc文档)中的表格 Jakarta POI 是apache的子项目,目标是处理ole2对象.它提供了一组操纵Windows文档的Java API.在网上见到好多通过po ...
IOS 使用webview 显示 doc/docx/xls/pdf等
在一款项目里添加阅读各种文档功能那么对在线的文档或者是下载后的文档进行阅读,比如 doc/docx/xls/pdf等文件有两种方法总结如下: 1. - (void)viewDidLoad { [ ...
C#仪器数据文件解析-Word文件（doc、docx）
不少仪器数据报告输出为Word格式文件,同Excel文件,Word文件doc和docx的存储格式是不同的,相应的解析Word文件的方式也类似,主要有以下方式: 1.通过MS Word应用程序的DCOM ...
利用pdfbox和poi抽取pdf、doc以及docx格式的内容
使用pdfbox1.5.0抽取pdf格式文档内容,使用poi3.7抽取doc及docx文档内容: /** * Created by yan.shi on 2017/9/25. */ import or ...
pywin32 pywin32 docx文档转html页面 word doc docx 提取文字图片 html 结构
https://blog.csdn.net/X21214054/article/details/78873338# python docx文档转html页面 - 程序猿tx - 博客园 https:/ ...
JAVA实现word doc docx pdf excel的在线浏览 - 仿百度文库源码
我们具体实现思路是这样的首先下载并安装openoffice和swftools openoffice下载地址:http://www.openoffice.org/download/index.html ...
POI实现DOC/DOCX转HTML
1.使用HWPF处理DOC public class DocToHtml { private static final String encoding = "UTF-8"; pub ...
poi操作word，简单写docx
参考博客: https://www.cnblogs.com/guilty/p/3977016.html 在HWPF中换行符是"\013",在XWPF中是run.addBreak() ...

随机推荐

Proftpd快速搭建FTP服务器
前言在Linux系统中,FTP服务器软件有很多,都已经成熟,像vsftpd, wu-ftp, Pure-FTPd等.但这些软件安装配置起来都比较麻烦,搭建个人的FTP服务器,还是Proftpd比较简 ...
[Guava源代码阅读笔记]-Basic Utilities篇-1
欢迎訪问:个人博客写该系列文章的目的是记录Guava源代码中个人感觉不错且值得借鉴的内容. 一.MoreObjects类 //MoreObjects.ToStringHelper类的toString ...
PS 抠图如何使用通道法处理头发
通道抠图法抠出美女飘逸头发-PS抠图实例教程抠图更换背景后效果图通道抠图法抠出美女飘逸头发-PS抠图实例教程教程步骤: 1 打开原图,进入通道面板. 通道抠图法抠出美女飘逸头发-PS抠图实 ...
vue-router钩子beforeRouteEnter函数获取到this实例
官方文档: const Foo = { template: `...`, beforeRouteEnter (to, from, next) { // 在渲染该组件的对应路由被 confirm 前调用 ...
javascript 高级编程系列 - 继承
1. 原型链继承 (缺点:子类继承父类的引用类型的属性值会在各个实例中共享,创建子类实例时无法向父类构造函数传递参数) // 定义父类构造函数 function SuperClass(father, ...
man screen
http://www.gnu.org/software/screen/manual/screen.html Screen User's Manual Next: Overview, Previous: ...
使用openssl 生成RSA pem格式的公钥私钥
1.生存私钥 openssl genrsa -des3 -out private_key.pem 1024 2.生成公钥 openssl rsa -in private_key.pem -pubout ...
使用C#解决部分Win8.1系统窗体每隔几秒失去焦点的问题
使用了Win8.1 With Update 1后,发现重新启动系统后,当前激活的窗体总是每隔几秒失去焦点.过0.5~1秒焦点回来.导致输入无法正常工作,严重影响使用心情和效率. 在网上找了非常久,也没 ...
嵌套的EasyUI 怎么获取对象
说明: 1.本篇文章介绍的是,怎么获取嵌套的Easyui 中的id为pageDetail的iframe对象 2.刚开始的页面效果如下图,是一个只有north,center区域的easyUI easy ...
HLS切片机
参考: 1,linux下搭建生成HLS所需的.ts和.m3u8文件http://www.cnblogs.com/mystory/archive/2013/04/07/3006200.html2,iPh ...

poi word 转html (.DOC .DOCX )

poi word 转html (.DOC .DOCX )的更多相关文章

随机推荐

热门专题