http://www.cnblogs.com/CheeseZH/archive/2012/11/27/2791037.html

吃水不忘挖井人,这篇文章给了我很大帮助:http://blog.csdn.net/caimo/article/details/7686872,这篇文章写的蛮详细,不过是ICTCLAS在web项目中的应用,于是我借花献佛,把它整理了一下成为java项目的应用。

1、到ICTCLAS官网下载最新版本分词器:http://ictclas.org/ictclas_download.aspx,点击下载后需要填写反馈信息——姓名,邮箱;

注:听学长说这个分词器有时间限制,所以一段时间之后需要重新下载。

2、将下载的ICTCLAS50_Windows_32_JNI.rar解压,其中有API,Demo,Doc,Sample四个文件夹;

API文件夹中的东西就是我们需要使用的;

Demo文件夹中的东西是一个用MFC实现的分词程序;

Doc文件夹中的东西是两个文档,注:ICTCLAS5.0接口文档.doc中提及的部分接口在最新的ICTCLAS中已经不再提供,还有的做了少量修改;

Sample文件夹中是一个java使用ICTCLAS例子:

比如我把ICTCLAS50_Windows_32_JNI.rar解压到C盘根目录,那我只需要在命令行中输入:

cd ICTCLAS50_Windows_32_JNI\Sample\Windows_32_jni_Demo

javac TestMain.java

java TestMain

就可以看到运行结果了;

3、如何将ICTCLAS整合到自己Java 项目中:

在myeclipse中创建项目为ICTCLAS003,那么将ICTCLAS的API目录中的ICTCLAS文件夹拷贝到ICTCLAS003文件夹的src目录下(ctrl+v粘贴到工程src即可),然后把DATA和其他的文件放到ICTCLAS003文件夹中即可。

刷新项目(Refresh)就可以看到这些内容已经导入了;

然后新建一个Test.java,

写上:import ICTCLAS.I3S.AC.ICTCLAS50;

就可以使用接口了。

下边就是API文件加中的ICTCLAS50.java文件,可以看出它提供的几个接口:

package ICTCLAS.I3S.AC;
import java.io.*;
public class ICTCLAS50
{
//public enum eCodeType
//{
// CODE_TYPE_UNKNOWN,//type unknown
// CODE_TYPE_ASCII,//ASCII
// CODE_TYPE_GB,//GB2312,GBK,GB10380
// CODE_TYPE_UTF8,//UTF-8
// CODE_TYPE_BIG5//BIG5
//} public native boolean ICTCLAS_Init(byte[] sPath);
public native boolean ICTCLAS_Exit();
public native int ICTCLAS_ImportUserDictFile(byte[] sPath,int eCodeType);
public native int ICTCLAS_SaveTheUsrDic();
public native int ICTCLAS_SetPOSmap(int nPOSmap);
public native boolean ICTCLAS_FileProcess(byte[] sSrcFilename, int eCodeType, int bPOSTagged,byte[] sDestFilename);
public native byte[] ICTCLAS_ParagraphProcess(byte[] sSrc, int eCodeType, int bPOSTagged);
public native byte[] nativeProcAPara(byte[] sSrc, int eCodeType, int bPOStagged);
/* Use static intializer */
static
{
System.loadLibrary("ICTCLAS50");
}
}

下边是我自己写的测试TestMain.java:

/*
* ICTCLAS_Init
* ICTCLAS_ParagraphProcess
* ICTCLAS_Exit
* ICTCLAS_ImportUserDictFile[接口文档中的函数为:ICTCLAS_ImportUserDict]
* ICTCLAS_SetPOSmap
* */
import ICTCLAS.I3S.AC.ICTCLAS50;
public class TestMain {
public static void main(String[] args){
try{
ICTCLAS50 testICTCLAS50 = new ICTCLAS50();
String argu = ".";
if(testICTCLAS50.ICTCLAS_Init(argu.getBytes("GB2312")) == false){
System.out.println("Init Fail");
}else{
System.out.println("Init Succeed!");
} String sInput = "随后温总理就离开了舟曲县城,预计温总理今天下午就回到北京。以上就是今天上午的最新动态。";
//未导入用户词典
byte nativeBytes[] = testICTCLAS50.ICTCLAS_ParagraphProcess(sInput.getBytes("GB2312"), 0, 1);
System.out.println(nativeBytes.length);
String nativeStr = new String(nativeBytes,0,nativeBytes.length,"GB2312");
System.out.println("未导入用户词典分词结果:"+nativeStr);
//导入用户词典
int nCount = 0;
String usrdir = "userdict.txt";
byte[] usrdirb = usrdir.getBytes();
//第一个参数为用户字典路径,第二个参数为用户字典的编码类型(0:type unknown;1:ASCII码;2:GB2312,GBK,GB10380;3:UTF-8;4:BIG5)
nCount = testICTCLAS50.ICTCLAS_ImportUserDictFile(usrdirb, 2);
System.out.println("导入用户词个数:"+nCount);
nCount = 0;
//导入用户词典之后再分词
byte[] nativeBytes1 = testICTCLAS50.ICTCLAS_ParagraphProcess(sInput.getBytes("GB2312"), 0, 1);
System.out.println(nativeBytes1.length);
String nativeStr1 = new String(nativeBytes1,0,nativeBytes1.length,"GB2312");
System.out.println("导入用户词典分词结果:"+nativeStr1); /*
* ICT_POS_MAP_SECOND 计算所二级标注集 0
* ICT_POS_MAP_FIRST 计算所一级标注集 1
* PKU_POS_MAP_SECOND 北大二级标注集 2
* PKU_POS_MAP_FIRST 北大一级标注集 3
* */
//使用计算所二级标注集
testICTCLAS50.ICTCLAS_SetPOSmap(0);
byte[] nativeBytes2 = testICTCLAS50.ICTCLAS_ParagraphProcess(sInput.getBytes("GB2312"), 0, 1);
System.out.println(nativeBytes2.length);
String nativeStr2 = new String(nativeBytes2,0,nativeBytes2.length,"GB2312");
System.out.println("计算所二级标注集:"+nativeStr2);
//使用北大二级标注集
testICTCLAS50.ICTCLAS_SetPOSmap(2);
byte[] nativeBytes3 = testICTCLAS50.ICTCLAS_ParagraphProcess(sInput.getBytes("GB2312"), 0, 1);
System.out.println(nativeBytes3.length);
String nativeStr3 = new String(nativeBytes3,0,nativeBytes3.length,"GB2312");
System.out.println("北大二级标注集:"+nativeStr3);
//释放分词组件资源
testICTCLAS50.ICTCLAS_Exit(); }catch(Exception ex){ }
}
}

使用的时候需要注意一下各个函数不同参数的含义。

bool ICTCLAS_Init( );参数就是一个目录的String,这个目录下包含分词器所需的系统词表以及配置文件;

boolean ICTCLAS_Exit();无参数

int ICTCLAS_ImportUserDictFile(byte[] sPath);参数就是用户自定义词表文件名字,记得把词表放在工程根目录中;返回值是词表中的词条数目;

public native byte[] ICTCLAS_ParagraphProcess(byte[] sSrc, int eCodeType, int bPOSTagged);第一个参数就是待处理文本,注意要将String转换为bytes数组,第二个参数是字符集类型【我的源码中有介绍】,第三个参数0:无标注,1:有标注

public native int ICTCLAS_SetPOSmap(int nPOSmap);选择标注集【我的源码中有介绍】

中文分词器ICTCLAS使用方法(Java)的更多相关文章

  1. 11大Java开源中文分词器的使用方法和分词效果对比,当前几个主要的Lucene中文分词器的比较

    本文的目标有两个: 1.学会使用11大Java开源中文分词器 2.对比分析11大Java开源中文分词器的分词效果 本文给出了11大Java开源中文分词的使用方法以及分词结果对比代码,至于效果哪个好,那 ...

  2. 11大Java开源中文分词器的使用方法和分词效果对比

    本文的目标有两个: 1.学会使用11大Java开源中文分词器 2.对比分析11大Java开源中文分词器的分词效果 本文给出了11大Java开源中文分词的使用方法以及分词结果对比代码,至于效果哪个好,那 ...

  3. 【Lucene3.6.2入门系列】第04节_中文分词器

    package com.jadyer.lucene; import java.io.IOException; import java.io.StringReader; import org.apach ...

  4. 如何在Elasticsearch中安装中文分词器(IK)和拼音分词器?

    声明:我使用的Elasticsearch的版本是5.4.0,安装分词器前请先安装maven 一:安装maven https://github.com/apache/maven 说明: 安装maven需 ...

  5. Solr6.5配置中文分词器

    Solr作为搜索应用服务器,我们在使用过程中,不可避免的要使用中文搜索.以下介绍solr自带的中文分词器和第三方分词器IKAnalyzer.  注:下面操作在Linux下执行,所添加的配置在windo ...

  6. Lucene的中文分词器

    1 什么是中文分词器 学过英文的都知道,英文是以单词为单位的,单词与单词之间以空格或者逗号句号隔开. 而中文的语义比较特殊,很难像英文那样,一个汉字一个汉字来划分. 所以需要一个能自动识别中文语义的分 ...

  7. Lucene 03 - 什么是分词器 + 使用IK中文分词器

    目录 1 分词器概述 1.1 分词器简介 1.2 分词器的使用 1.3 中文分词器 1.3.1 中文分词器简介 1.3.2 Lucene提供的中文分词器 1.3.3 第三方中文分词器 2 IK分词器的 ...

  8. 转:从头开始编写基于隐含马尔可夫模型HMM的中文分词器

    http://blog.csdn.net/guixunlong/article/details/8925990 从头开始编写基于隐含马尔可夫模型HMM的中文分词器之一 - 资源篇 首先感谢52nlp的 ...

  9. Lucene系列四:Lucene提供的分词器、IKAnalyze中文分词器集成、扩展 IKAnalyzer的停用词和新词

    一.Lucene提供的分词器StandardAnalyzer和SmartChineseAnalyzer 1.新建一个测试Lucene提供的分词器的maven项目LuceneAnalyzer 2. 在p ...

随机推荐

  1. lvs+keepalived 02

    LVS keepalived 高可用负载均衡 环境 IP HOSTNAME Describe 192.168.100.30 lvs01 主负载 192.168.100.31 lvs02 备负载 192 ...

  2. UVALive 6916 Punching Robot dp

    Punching Robot 题目连接: https://icpcarchive.ecs.baylor.edu/index.php?option=com_onlinejudge&Itemid= ...

  3. WebMvcConfigurerAdapter已经过时的问题解决

    spring 5开始已经废弃WebMvcConfigurerAdapter,替代的是WebMvcConfigurer接口. 参考: https://blog.csdn.net/lenkvin/arti ...

  4. JDK7新特性<八>异步io/AIO

    概述 JDK7引入了Asynchronous I/O.I/O编程中,常用到两种模式:Reactor 和 Proactor.Reactor就是Java的NIO.当有事件触发时,我们得到通知,进行相应的处 ...

  5. STM32 通用定时器相关寄存器

    TIMx_CR1(控制寄存器1) 9-8位:CKD[1:0]时钟分频因子,定义在定时器时钟(CK_INT)频率与数字滤波器(ETR,TIx)使用的采样频率之间的分频比例. 定义:00(tDTS = t ...

  6. [Go] sync.Once 的用法

    sync.Once.Do(f func()) 是一个非常有意思的东西,能保证 once 只执行一次,无论你是否更换 once.Do(xx) 这里的方法,这个 sync.Once块 只会执行一次. pa ...

  7. HDU 4920 Matrix multiplication(矩阵相乘)

    各种TEL,233啊.没想到是处理掉0的情况就能够过啊.一直以为会有极端数据.没想到居然是这种啊..在网上看到了一个AC的奇妙的代码,经典的矩阵乘法,仅仅只是把最内层的枚举,移到外面就过了啊...有点 ...

  8. 使用React改版网站

    网站是毕业设计的作品,开发这个网站的目的主要用于记录一些笔记,以及聚合一些资讯信息,也算自己在网络世界中的一块静地吧,可以在这里一些技术上想法的实践. 网站最初前端使用vue开发,在前段时间由于项目的 ...

  9. 安装oracle10g“程序异常终止。发生内部错误。请将以下文件提供给oracle技术支持部门

    发生情景:测试环境搭建的是windows 2008 r2 sp1系统 在安装Oracle 10g数据库时发生了错误,现在把解决问题的方法和原因分享给大家. *  安装出现的现象: 输入完密码后下一步时 ...

  10. chrome浏览器调试报错:Failed to load resource: the server responsed width a status of 404 (Not Found)…http://127.0.0.1:5099/favicon.ico

    chrome浏览器在调试的时候默认会查找根目录下的favicon.ico文件,如果不存在就会报错. 解决办法:F12,点击<top frame>左侧漏斗形状的filter,勾选上" ...