ICTCLAS计算所中文分词(当前最好的汉语词法分析器)系统特点:准确度高(98.5%),性能优越(500KB/s分词速度),词性标注(POS tagging)且支持多种标注集,支持用户自定义词典,支持用户自定义词性标注,支持多平台,支持模块组合关闭(在
Configure.xml
中设置),支持多编码(UTF-8, GB(GB2312, GBK, GB10380)和BIG5)且可以自动识别编码等。更多详见官网文档FAQ

使用ICTCLAS库实现中文分词(Linux 32 bit)
下载ICTCLAS:

从ICTCLAS下载
ICTCLAS2011_Linux_32_c
(ICTCLAS 2011,内核版本5.0)。

    wget http://www.ictclas.org/down/50/ICTCLAS50_Linux_RHAS_32_C.rar      
unrar -x ICTCLAS50_Linux_RHAS_32_C.rar  

创建测试目录,并拷贝API到该目录下

mkdir test  
cd test  
mkdir ICTCLAS_API  
cp -fR ICTCLAS50_Linux_RHAS_32_C/API/* ./ICTCLAS_API  


test
目录下创建用户词典
userdict.txt
,填写:

洛杉矶@@LA  
奥巴马@@Obama  
最新动态@@nr  


test
目录下创建文件
test.c

 
/* 编译
动态: g++ test.c -L./ICTCLAS_API -lICTCLAS50 -DOS_LINUX -o test
静态: g++ test.c -L./ICTCLAS_API -lICTCLAS50 -DOS_LINUX -o test -static
*/
/* 处理字符串
#define ICTCLAS_API_PATH "ICTCLAS_API"
#include <stdio.h>
#include <stdlib.h>
#include <string.h>
#include "ICTCLAS_API/ICTCLAS50.h"
int main(int argc, char *argv[]) {
    //# 初始化
    if (!ICTCLAS_Init(ICTCLAS_API_PATH)) {
        fprintf(stderr, "Error: init failed, please put the ICTCLAS API under `%s` directory\n\n", ICTCLAS_API_PATH);
        exit(EXIT_FAILURE);
    }
    printf("init ICTCLAS succeed\n");
    //# 设置词性标注集
    ICTCLAS_SetPOSmap(ICT_POS_MAP_SECOND);
    //# 处理
    const char *srcTxt = "随后奥巴马就离开了洛杉矶,预计奥巴马今天下午就回到华盛顿。以上就是今天上午的最新动态";
    int srcLen = strlen(srcTxt);
    //未导入用户字典之前的处理
    char *resTxt = NULL;
    resTxt = (char *) malloc(srcLen * 6);
    int resLen = 0;
    resLen = ICTCLAS_ParagraphProcess(srcTxt, srcLen, resTxt, CODE_TYPE_UNKNOWN, 1);
    printf("before:\n%s\n\n", resTxt);
    free(resTxt);
    resTxt = NULL;
    //导入用户词典(文本文件:一行一词(词和词性使用`@@`分隔,词性可以省略,且可以自定义任意词性),例如:中科院@@nr或北京市)
    unsigned int itemsNum = ICTCLAS_ImportUserDictFile("./userdict.txt", CODE_TYPE_UNKNOWN);
    printf("%d items loaded\n", itemsNum);
    /*
    //也可以以字符串形式导入词典(词与词之间使用`;`分隔,如果指定词性,词与词性之间使用`@@`分隔,例如`中科院@@nr;分词@@v;系统@@adj;`或`中科院;分词;系统;`)
    const char *dictStr = "洛杉矶@@LA;奥巴马@@Obama;最新动态@@nr";
    unsigned int itemsNum = ICTCLAS_ImportUserDict(dicStr, strlen(dicStr), CODE_TYPE_UNKNOWN);
    printf("%d items loaded\n", itemsNum);
    */
    //如果保存用户词典,则下次分词的时候依然有效
    ICTCLAS_SaveTheUsrDic();
    //导入用户词典之后分词
    resTxt = (char *) malloc(srcLen * 6);
    resLen = ICTCLAS_ParagraphProcess(srcTxt, srcLen, resTxt, CODE_TYPE_UNKNOWN, 1);
    printf("after:\n%s\n\n", resTxt);
    free(resTxt);
    //# 释放资源
    ICTCLAS_Exit();
    return 0;
}
*/
 
/*处理文件#define ICTCLAS_API_PATH "ICTCLAS_API"
#include <stdio.h>
#include <stdlib.h>
#include <string.h>
#include "ICTCLAS_API/ICTCLAS50.h"
#include <unistd.h>
#include "restart.h"
#include <errno.h>
#include <fcntl.h>
#define BLKSIZE 1024
char buf[BLKSIZE];
int main(int argc, char *argv[]) {
    if (!ICTCLAS_Init(ICTCLAS_API_PATH)) {
        fprintf(stderr, "Error: init failed, please put the ICTCLAS API under `%s` directory\n\n", ICTCLAS_API_PATH);
        exit(EXIT_FAILURE);
    }
    printf("init ICTCLAS succeed\n");
    
    ICTCLAS_SetPOSmap(ICT_POS_MAP_SECOND);
    char *fromfile=argv[1];
    char *tofile=argv[2];
    int fromfd;
    int tofd;
    while (fromfd = open(fromfile, O_RDONLY), fromfd == -1 && errno == EINTR) ;
    printf("fromfd:\n%d\n\n", fromfd);
    while (tofd = open(tofile,O_WRONLY|O_APPEND), tofd == -1 && errno == EINTR);
    printf("tofd:\n%d\n\n", tofd);
    int bytesread,byteswritten;
    for( ; ; ) {
      if ((bytesread=read(fromfd,buf,BLKSIZE))<=0)   break;
    char resTxt[bytesread * 3];
    int resLen = 0;
    resLen = ICTCLAS_ParagraphProcess(buf,bytesread, resTxt, CODE_TYPE_UNKNOWN, 1);
    printf("before:\n%s\n\n", resTxt);
    printf("before:\n%d\n\n", resLen);
    resLen=strlen(resTxt);
    if((byteswritten = write(tofd,resTxt,resLen))==-1) break;
    printf("byteswritten:\n%d\n\n", byteswritten);
    }
    ICTCLAS_Exit();
    return 0;
}
                                                                                        
*/
 

编译和运行(推荐静态编译):

g++ test.c -L./ICTCLAS_API -lICTCLAS50 -DOS_LINUX -o test -static  
./test  

根据输出的结果,可以得到ICTCLAS支持:用户词典,自定义词性等。

ICTCLAS中文分词库的使用的更多相关文章

  1. Hanlp等七种优秀的开源中文分词库推荐

    Hanlp等七种优秀的开源中文分词库推荐 中文分词是中文文本处理的基础步骤,也是中文人机自然语言交互的基础模块.由于中文句子中没有词的界限,因此在进行中文自然语言处理时,通常需要先进行分词. 纵观整个 ...

  2. 共有11款Python 中文分词库开源软件

    件过滤: 排序: 收录时间 | 浏览数 Python 中文分词库 Yaha "哑哈"中文分词,更快或更准确,由你来定义.通过简单定制,让分词模块更适用于你的需求. "Ya ...

  3. 中文分词库及NLP介绍,jieba,gensim的一些介绍

    六款中文分词软件介绍: https://blog.csdn.net/u010883226/article/details/80731583 里面有jieba, pyltp什么的.另外下面这个博客有不少 ...

  4. python 中文分词库 jieba库

    jieba库概述: jieba是优秀的中文分词第三方库 中文文本需要通过分词获得单个的词语 jieba是优秀的中文分词第三方库,需要额外安装 jieba库分为精确模式.全模式.搜索引擎模式 原理 1. ...

  5. jieba分词-强大的Python 中文分词库

    1. jieba的江湖地位 NLP(自然语言)领域现在可谓是群雄纷争,各种开源组件层出不穷,其中一支不可忽视的力量便是jieba分词,号称要做最好的 Python 中文分词组件. 很多人学习pytho ...

  6. python中文分词库——pyltp

    pyltp在win10下安装比较麻烦,因此参考以下安装方式, 1.下载 win10下python3.6 2.安装 下载好了以后, 在命令行下, cd到wheel文件所在的目录, 然后使用命令pip i ...

  7. python中文分词库——pynlpir

    安装 pip install pynlpir import pynlpir #加载包 pynlpir.open() #加载nlpir的库,这步是必须的 #否则会出现 段错误/段转储 segment f ...

  8. Solr6.6 配置中文分词库mmseg4j

    1.准备 首先安装solr:参照搜索引擎Solr-6.6.0搭建,如果版本高于6,可能会不支持,需要改mmseg4j包 mmseg4j包下载: mmseg4j-solr-2.3.0-with-mmse ...

  9. jieba中文分词的.NET版本:jieba.NET

    简介 平时经常用Python写些小程序.在做文本分析相关的事情时免不了进行中文分词,于是就遇到了用Python实现的结巴中文分词.jieba使用起来非常简单,同时分词的结果也令人印象深刻,有兴趣的可以 ...

随机推荐

  1. 使用mysql的长连接

    有个资料看得我云里雾里的.现在用自己的言语来总结一下,写文字,能够加深自己的理解.也会在写的过程中帮助自己发现理解方面瑕疵,继续查资料求证. 短链接的缺点:创建一个连接,程序执行完毕后,就会自动断掉与 ...

  2. 「Ionic」創建新項目

    1.創建新項目 创建一个名为myApp的还有tabs的项目(ionic start <project-name> <optional-template>) 可选模板为sidem ...

  3. tomcat jdk servlet websocket版本对应关系

    最近在考虑公司主要基础三方库版本统一和升级的问题,特看了下tomcat jdk servlet websocket版本的对应关系,如下:

  4. Masonry – 实现 Pinterest 模式的网格砌体布局

    Masonry 是一款 JavaScript 网格布局插件,可以实现类似 Pinterest 模式的砌体布局效果.通过把元素自动填充在垂直的空白区域,就像墙上堆砌的石头一样.这个库还可以作为 jQue ...

  5. jQuery立体式数字动态增加(animate方法)

    1.HTML结构 <div class="integral">已有<span class="ii"></span>积分< ...

  6. jQuery的deferred对象使用详解——实现ajax线性请求数据

    最近遇到一个ajax请求数据的问题 ,就是想要请求3个不同的接口,然后请求完毕后对数据进行操作,主要问题就是不知道这3个请求誰先返回来,或者是在进行操作的时候不能保证数据都已经回来,首先想到能完成的就 ...

  7. Hybrid框架UI重构之路:四、分而治之

    上文回顾:Hybird框架UI重构之路:三.工欲善其事,必先利其器 上一篇文章有说到less.grunt这两个工具,是为了css.js分模块使用的.UI框架提供给使用者的时候,是一个大的xxx.js. ...

  8. github-ssh

        # lsb_release -a    No LSB modules are available.    Distributor ID:    Ubuntu    Description:   ...

  9. OpenGL显示图片

    最近想用C++在windows下实现一个基本的图像查看器功能,目前只想到了使用GDI或OpenGL两种方式.由于实在不想用GDI的API了,就用OpenGL的方式实现了一下基本的显示功能. 用GDAL ...

  10. Android的进程等级

    Android五个进程等级 1.前台进程(Foreground process): 用户当前工作所需要的.一个进程如果满足下列任何条件被认为是前台进程: 正运行着一个正在与用户交互的活动(Activi ...