tesseract-ocr 识别中文扫描图片

原文链接：http://www.cnblogs.com/alex-blog/articles/2714984.html

项目主页地址：http://code.google.com/p/tesseract-ocr/

相关资源下载地址：http://code.google.com/p/tesseract-ocr/downloads/list

需要下载的资源有：

1、tesseract-ocr-setup-3.01-1.exe

因我本地为windows系统，所以用这个

2、chi_sim.traineddata.gz

中文识别时需要的。

安装tesseract-ocr

自定义安装语言包

在Tesseract-OCR安装目录下找到 tessdata目录，其是用来存放语言包，可把 chi_sim.traineddata.gz 解压缩之后的chi_sim.traineddata文件复制到该目录下即可。

本文使用参考blog中的例子

如下：

package org.img;

import java.awt.image.BufferedImage;

import java.io.File;

import java.io.IOException;

import java.util.Iterator;

import java.util.Locale;

import javax.imageio.IIOImage;

import javax.imageio.ImageIO;

import javax.imageio.ImageReader;

import javax.imageio.ImageWriteParam;

import javax.imageio.ImageWriter;

import javax.imageio.metadata.IIOMetadata;

import javax.imageio.stream.ImageInputStream;

import javax.imageio.stream.ImageOutputStream;

import com.sun.media.imageio.plugins.tiff.TIFFImageWriteParam;

public class ImageIOHelper {

    /**

     * 图片文件转换为tif格式

     * @param imageFile 文件路径

     * @param imageFormat 文件扩展名

     * @return

     */

    public static File createImage(File imageFile, String imageFormat) {

        File tempFile = null;

        try {

            Iterator<ImageReader> readers = ImageIO.getImageReadersByFormatName(imageFormat);

            ImageReader reader = readers.next();

            ImageInputStream iis = ImageIO.createImageInputStream(imageFile);

            reader.setInput(iis);

            //Read the stream metadata

            IIOMetadata streamMetadata = reader.getStreamMetadata();

            //Set up the writeParam

            TIFFImageWriteParam tiffWriteParam = new TIFFImageWriteParam(Locale.CHINESE);

            tiffWriteParam.setCompressionMode(ImageWriteParam.MODE_DISABLED);

            //Get tif writer and set output to file

            Iterator<ImageWriter> writers = ImageIO.getImageWritersByFormatName("tiff");

            ImageWriter writer = writers.next();

            BufferedImage bi = reader.read(0);

            IIOImage image = new IIOImage(bi,null,reader.getImageMetadata(0));

            tempFile = tempImageFile(imageFile);

            ImageOutputStream ios = ImageIO.createImageOutputStream(tempFile);

            writer.setOutput(ios);

            writer.write(streamMetadata, image, tiffWriteParam);

            ios.close();

            writer.dispose();

            reader.dispose();

        } catch (IOException e) {

            e.printStackTrace();

        }

        return tempFile;

    }

    private static File tempImageFile(File imageFile) {

        String path = imageFile.getPath();

        StringBuffer strB = new StringBuffer(path);

        strB.insert(path.lastIndexOf('.'),0);

        return new File(strB.toString().replaceFirst("(?<=//.)(//w+)$", "tif"));

    }

}

package org.img;

import java.io.BufferedReader;

import java.io.File;

import java.io.FileInputStream;

import java.io.InputStreamReader;

import java.util.ArrayList;

import java.util.List;

import org.jdesktop.swingx.util.OS;

public class OCR {

    private final String LANG_OPTION = "-l";  //英文字母小写l，并非数字1

    private final String EOL = System.getProperty("line.separator");

    private String tessPath = "C://Program Files//Tesseract-OCR"; //

注意这个路径，为安装的tesseract-OCR的路径

    //private String tessPath = new File("tesseract").getAbsolutePath();

    public String recognizeText(File imageFile,String imageFormat)throws Exception{

        File tempImage = ImageIOHelper.createImage(imageFile,imageFormat);

        File outputFile = new File(imageFile.getParentFile(),"output");

        StringBuffer strB = new StringBuffer();

        List<String> cmd = new ArrayList<String>();

        if(OS.isWindowsXP()){

            cmd.add(tessPath+"//tesseract");

        }else if(OS.isLinux()){

            cmd.add("tesseract");

        }else{

            cmd.add(tessPath+"//tesseract");

        }

        cmd.add("");

        cmd.add(outputFile.getName());

        cmd.add(LANG_OPTION);

        cmd.add("chi_sim");

        //cmd.add("eng");

        ProcessBuilder pb = new ProcessBuilder();

        pb.directory(imageFile.getParentFile());

        cmd.set(1, tempImage.getName());

        pb.command(cmd);

        pb.redirectErrorStream(true);

        Process process = pb.start();

        //tesseract.exe 1.jpg 1 -l chi_sim

        int w = process.waitFor();

        //删除临时正在工作文件

        tempImage.delete();

        if(w==0){

            BufferedReader in = new BufferedReader(new InputStreamReader(new FileInputStream(outputFile.getAbsolutePath()+".txt"),"UTF-8"));

            String str;

            while((str = in.readLine())!=null){

                strB.append(str).append(EOL);

            }

            in.close();

        }else{

            String msg;

            switch(w){

                case 1:

                    msg = "Errors accessing files.There may be spaces in your image's filename.";

                    break;

                case 29:

                    msg = "Cannot recongnize the image or its selected region.";

                    break;

                case 31:

                    msg = "Unsupported image format.";

                    break;

                default:

                    msg = "Errors occurred.";

            }

            tempImage.delete();

            throw new RuntimeException(msg);

        }

        new File(outputFile.getAbsolutePath()+".txt").delete();

        return strB.toString();

    }

}

package org.img;

import java.io.File;

import java.io.IOException;

public class TestOCR {

    /**

     * @param args

     */

    public static void main(String[] args) {

        String path = "D:\\temp\\img\\untitled8.png";

        try {

            String valCode = new OCR().recognizeText(new File(path), "png");

            //6905_1294109277pAj9.jpg

            System.out.println(valCode);

        } catch (IOException e) {

            e.printStackTrace();

        } catch (Exception e) {

            e.printStackTrace();

        }

    }

}

对于报错，请检查tessPath 这个参数是否设置正确

本文参考以下两位的blog：

http://blog.csdn.net/foamflower/article/details/6110211

http://blog.csdn.net/zhoushuyan/article/details/5948289

tesseract-ocr 识别中文扫描图片的更多相关文章

tesseract-ocr识别中文扫描图片实例讲解
当我浏览http://code.google.com/p/tesseract-ocr并下载了几个文件下来之后顿时感到一头雾水,不知该如何下手.网上看到有人在linux操作系统下的实现, 如: 利用开源 ...
使用Tesseract OCR识别验证码
1.下载Tessrac OCR,默认安装 2.把验证码code.jpg图片放在D盘 3.打开cmd,进入D盘,输入:tesseract code.jpg result 4.进入D盘,生成了resul ...
身份证扫描识别/身份证OCR识别的正确姿势，你get到了吗？
自从国家规定电信实名制之后,实名制已经推广到各个领域:办理通信业务需要实名制.银行开户需要实名制.移动支付需要实名制,就连注册个自媒体账户都需要实名制. 而实名制的背后,就是身份证信息的采集和录入验证 ...
Python 进行 OCR识别 -- pytesseract库
pip install pytesseract 报错:tesseract is not installed or it's not in your path 下载安装 Tesseract-OCR ht ...
tesseract-ocr识别英文和中文图片文字以及扫描图片实例讲解
本文来源:http://blog.csdn.net/wanghui2008123/article/details/37694307 本文参考http://blog.sina.com.cn/s/blog ...
开源图片文字识别引擎——Tesseract OCR
Tessseract为一款开源.免费的OCR引擎,能够支持中文十分难得.虽然其识别效果不是很理想,但是对于要求不高的中小型项目来说,已经足够用了. 文字识别可应用于许多领域,如阅读.翻译.文献资料的检 ...
深入学习OpenCV文档扫描及OCR识别（文档扫描，图像矫正，透视变换，OCR识别）
如果需要处理的原图及代码,请移步小编的GitHub地址传送门:请点击我如果点击有误:https://github.com/LeBron-Jian/ComputerVisionPractice 下面 ...
【图片识别】java 图片文字识别 ocr （转）
http://www.cnblogs.com/inkflower/p/6642264.html 最近在开发的时候需要识别图片中的一些文字,网上找了相关资料之后,发现google有一个离线的工具,以下为 ...
图片文字OCR识别-tesseract-ocr
帮助文件:https://github.com/tesseract-ocr/tesseract/blob/master/doc/tesseract.1.asc 下载地址:https://github. ...

随机推荐

Luogu P1966 火柴排队
这还是一道比较简单的题目,稍微想一下就可以解决.终于有NOIP难度的题目了首先我们看那个∑(ai-bi)^2的式子,发现这个的最小值就是排序不等式所以我们只需要改变第一组火柴的顺序,使它和第二组火 ...
java垃圾回收诡异现象
在知乎上看到一篇提问,于是做了个实验帮助他解答,这里整理成一篇文章分享一下. 先看代码如下代码: /** * Created on 2017/12/16. * * -verbose:gc -XX:+U ...
如何手动写一个Python脚本自动爬取Bilibili小视频
如何手动写一个Python脚本自动爬取Bilibili小视频国庆结束之余,某个不务正业的码农不好好干活,在B站瞎逛着,毕竟国庆嘛,还让不让人休息了诶-- 我身边的很多小伙伴们在朋友圈里面晒着出去游玩 ...
Linux下部署SSH登录时的二次身份验证环境记录（利用Google Authenticator）
一般来说,使用ssh远程登录服务器,只需要输入账号和密码,显然这种方式不是很安全.为了安全着想,可以使用GoogleAuthenticator(谷歌身份验证器),以便在账号和密码之间再增加一个验证码, ...
Beta阶段爬取数目预估
预计于12月29号能进行Beta版本发布. Beta阶段我们的爬取动作应该更有针对性,在爬取期间如若数据处理小组有需求,会优先爬取数据处理小组提供的种子链接.预估在项目展示之前能够爬取的数目: 普通网 ...
ubuntu16.04下载安装navicate
1.下载试用版本地址: https://www.navicat.com.cn/download/navicat-premium 2.解压缩 tar -zxvf /home/rain/download ...
HDU 5702 Solving Order
http://acm.hdu.edu.cn/showproblem.php?pid=5702 Problem Description Welcome to HDU to take part in th ...
转：为Docker容器设置固定IP实现网络联通(1)——通过Pipework为Docker容器设置
https://blog.csdn.net/chinagissoft/article/details/51250839 1. 创建并启动一个容器: docker run --cap-add=NET_A ...
CentOS查看版本及架构信息
https://blog.csdn.net/shuaigexiaobo/article/details/78030008
Java使用HTTPClient3.0.1开发的公众平台消息模板的推送功能
package com.company.product.manager.busniess.impl; import java.io.IOException;import java.nio.charse ...

tesseract-ocr 识别中文扫描图片

tesseract-ocr 识别中文扫描图片的更多相关文章

随机推荐

热门专题