【Lucene3.6.2入门系列】第04节

package com.jadyer.lucene;

import java.io.IOException;

import java.io.StringReader;

import org.apache.lucene.analysis.Analyzer;

import org.apache.lucene.analysis.SimpleAnalyzer;

import org.apache.lucene.analysis.StopAnalyzer;

import org.apache.lucene.analysis.TokenStream;

import org.apache.lucene.analysis.WhitespaceAnalyzer;

import org.apache.lucene.analysis.standard.StandardAnalyzer;

import org.apache.lucene.analysis.tokenattributes.CharTermAttribute;

import org.apache.lucene.analysis.tokenattributes.OffsetAttribute;

import org.apache.lucene.analysis.tokenattributes.PositionIncrementAttribute;

import org.apache.lucene.analysis.tokenattributes.TypeAttribute;

import org.apache.lucene.util.Version;

import com.chenlb.mmseg4j.analysis.ComplexAnalyzer;

import com.chenlb.mmseg4j.analysis.MMSegAnalyzer;

/**

 * 【Lucene3.6.2入门系列】第04节_中文分词器

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see Lucene3.5推荐的四大分词器:SimpleAnalyzer,StopAnalyzer,WhitespaceAnalyzer,StandardAnalyzer

 * @see 这四大分词器有一个共同的抽象父类,此类有个方法public final TokenStream tokenStream(),即分词的一个流

 * @see 假设有这样的文本"how are you thank you",实际它是以一个java.io.Reader传进分词器中

 * @see Lucene分词器处理完毕后,会把整个分词转换为TokenStream,这个TokenStream中就保存所有的分词信息

 * @see TokenStream有两个实现类,分别为Tokenizer和TokenFilter

 * @see Tokenizer---->用于将一组数据划分为独立的语汇单元(即一个一个的单词)

 * @see TokenFilter-->过滤语汇单元

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see 分词流程

 * @see 1)将一组数据流java.io.Reader交给Tokenizer,由其将数据转换为一个个的语汇单元

 * @see 2)通过大量的TokenFilter对已经分好词的数据进行过滤操作,最后产生TokenStream

 * @see 3)通过TokenStream完成索引的存储

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see Tokenizer的一些子类

 * @see KeywordTokenizer-----不分词,传什么就索引什么

 * @see StandardTokenizer----标准分词,它有一些较智能的分词操作,诸如将'jadyer@yeah.net'中的'yeah.net'当作一个分词流

 * @see CharTokenizer--------针对字符进行控制的,它还有两个子类WhitespaceTokenizer和LetterTokenizer

 * @see WhitespaceTokenizer--使用空格进行分词,诸如将'Thank you,I am jadyer'会被分为4个词

 * @see LetterTokenizer------基于文本单词的分词,它会根据标点符号来分词,诸如将'Thank you,I am jadyer'会被分为5个词

 * @see LowerCaseTokenizer---它是LetterTokenizer的子类,它会将数据转为小写并分词

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see TokenFilter的一些子类

 * @see StopFilter--------它会停用一些语汇单元

 * @see LowerCaseFilter---将数据转换为小写

 * @see StandardFilter----对标准输出流做一些控制

 * @see PorterStemFilter--还原一些数据,比如将coming还原为come,将countries还原为country

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see eg:'how are you thank you'会被分词为'how','are','you','thank','you'合计5个语汇单元

 * @see 那么应该保存什么东西,才能使以后在需要还原数据时保证正确的还原呢???其实主要保存三个东西,如下所示

 * @see CharTermAttribute(Lucene3.5以前叫TermAttribute),OffsetAttribute,PositionIncrementAttribute

 * @see 1)CharTermAttribute-----------保存相应的词汇,这里保存的就是'how','are','you','thank','you'

 * @see 2)OffsetAttribute-------------保存各词汇之间的偏移量(大致理解为顺序),比如'how'的首尾字母偏移量为0和3,'are'为4和7,'thank'为12和17

 * @see 3)PositionIncrementAttribute--保存词与词之间的位置增量,比如'how'和'are'增量为1,'are'和'you'之间的也是1,'you'和'thank'的也是1

 * @see                               但假设'are'是停用词(StopFilter的效果),那么'how'和'you'之间的位置增量就变成了2

 * @see 当我们查找某一个元素时,Lucene会先通过位置增量来取这个元素,但如果两个词的位置增量相同,会发生什么情况呢

 * @see 假设还有一个单词'this',它的位置增量和'how'是相同的,那么当我们在界面中搜索'this'时

 * @see 也会搜到'how are you thank you',这样就可以有效的做同义词了,目前非常流行的一个叫做WordNet的东西,就可以做同义词的搜索

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see 中文分词器

 * @see Lucene默认提供的众多分词器完全不适用中文

 * @see 1)Paoding--庖丁解牛分词器,官网为http://code.google.com/p/paoding(貌似已托管在http://git.oschina.net/zhzhenqin/paoding-analysis)

 * @see 2)MMSeg4j--据说它使用的是搜狗的词库,官网为https://code.google.com/p/mmseg4j(另外还有一个https://code.google.com/p/jcseg)

 * @ses 3)IK-------https://code.google.com/p/ik-analyzer/

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @see MMSeg4j的使用

 * @see 1)下载mmseg4j-1.8.5.zip并引入mmseg4j-all-1.8.5-with-dic.jar

 * @see 2)在需要指定分词器的位置编写new MMSegAnalyzer()即可

 * @see 注1)由于使用的mmseg4j-all-1.8.5-with-dic.jar中已自带了词典,故直接new MMSegAnalyzer()即可

 * @see 注2)若引入的是mmseg4j-all-1.8.5.jar,则应指明词典目录,如new MMSegAnalyzer("D:\\Develop\\mmseg4j-1.8.5\\data")

 * @see     但若非要使用new MMSegAnalyzer(),则要将mmseg4j-1.8.5.zip自带的data目录拷入classpath下即可

 * @see 总结:直接引入mmseg4j-all-1.8.5-with-dic.jar就行了

 * @see -----------------------------------------------------------------------------------------------------------------------

 * @create Aug 2, 2013 5:30:45 PM

 * @author 玄玉<http://blog.csdn.net/jadyer>

 */

public class HelloChineseAnalyzer {

	/**

	 * 查看分词信息

	 * @see TokenStream还有两个属性,分别为FlagsAttribute和PayloadAttribute,都是开发时用的

	 * @see FlagsAttribute----标注位属性

	 * @see PayloadAttribute--做负载的属性,用来检测是否已超过负载,超过则可以决定是否停止搜索等等

	 * @param txt        待分词的字符串

	 * @param analyzer   所使用的分词器

	 * @param displayAll 是否显示所有的分词信息

	 */

	public static void displayTokenInfo(String txt, Analyzer analyzer, boolean displayAll){

		//第一个参数没有任何意义,可以随便传一个值,它只是为了显示分词

		//这里就是使用指定的分词器将'txt'分词,分词后会产生一个TokenStream(可将分词后的每个单词理解为一个Token)

		TokenStream stream = analyzer.tokenStream("此参数无意义", new StringReader(txt));

		//用于查看每一个语汇单元的信息,即分词的每一个元素

		//这里创建的属性会被添加到TokenStream流中,并随着TokenStream而增加(此属性就是用来装载每个Token的,即分词后的每个单词)

		//当调用TokenStream.incrementToken()时,就会指向到这个单词流中的第一个单词,即此属性代表的就是分词后的第一个单词

		//可以形象的理解成一只碗,用来盛放TokenStream中每个单词的碗,每调用一次incrementToken()后,这个碗就会盛放流中的下一个单词

		CharTermAttribute cta = stream.addAttribute(CharTermAttribute.class);

		//用于查看位置增量(指的是语汇单元之间的距离,可理解为元素与元素之间的空格,即间隔的单元数)

		PositionIncrementAttribute pia = stream.addAttribute(PositionIncrementAttribute.class);

		//用于查看每个语汇单元的偏移量

		OffsetAttribute oa = stream.addAttribute(OffsetAttribute.class);

		//用于查看使用的分词器的类型信息

		TypeAttribute ta = stream.addAttribute(TypeAttribute.class);

		try {

			if(displayAll){

				//等价于while(stream.incrementToken())

				for(; stream.incrementToken() ;){

					System.out.println(ta.type() + " " + pia.getPositionIncrement() + " ["+oa.startOffset()+"-"+oa.endOffset()+"] ["+cta+"]");

				}

			}else{

				System.out.println();

				while(stream.incrementToken()){

					System.out.print("[" + cta + "]");

				}

			}

		} catch (IOException e) {

			e.printStackTrace();

		}

	}

	/**

	 * 测试一下中文分词的效果

	 * @author 玄玉<http://blog.csdn.net/jadyer>

	 */

	public static void main(String[] args) {

		String txt = "我来自中国黑龙江省哈尔滨市巴彦县兴隆镇";

		displayTokenInfo(txt, new StandardAnalyzer(Version.LUCENE_36), false);

		displayTokenInfo(txt, new StopAnalyzer(Version.LUCENE_36), false);

		displayTokenInfo(txt, new SimpleAnalyzer(Version.LUCENE_36), false);

		displayTokenInfo(txt, new WhitespaceAnalyzer(Version.LUCENE_36), false);

		displayTokenInfo(txt, new MMSegAnalyzer(), false); //等价于new com.chenlb.mmseg4j.analysis.MaxWordAnalyzer()

		displayTokenInfo(txt, new com.chenlb.mmseg4j.analysis.SimpleAnalyzer(), false);

		displayTokenInfo(txt, new ComplexAnalyzer(), false);

	}

}

【Lucene3.6.2入门系列】第04节_中文分词器的更多相关文章

【Lucene3.6.2入门系列】第05节_自定义停用词分词器和同义词分词器
首先是用于显示分词信息的HelloCustomAnalyzer.java package com.jadyer.lucene; import java.io.IOException; import j ...
【Lucene3.6.2入门系列】第03节_简述Lucene中常见的搜索功能
package com.jadyer.lucene; import java.io.File; import java.io.IOException; import java.text.SimpleD ...
【Lucene3.6.2入门系列】第14节_SolrJ操作索引和搜索文档以及整合中文分词
package com.jadyer.solrj; import java.util.ArrayList; import java.util.List; import org.apache.solr. ...
【Lucene3.6.2入门系列】第15节_SolrJ高亮
package com.jadyer.solrj; import java.util.ArrayList; import java.util.List; import java.util.Map; i ...
【Lucene3.6.2入门系列】第10节_Tika
首先贴出来的是演示了借助Tika创建索引的HelloTikaIndex.java PS:关于Tika的介绍及用法,详见下方的HelloTika.java package com.jadyer.luce ...
Solr7.3.0入门教程，部署Solr到Tomcat，配置Solr中文分词器
solr 基本介绍 Apache Solr (读音: SOLer) 是一个开源的搜索服务器.Solr 使用 Java 语言开发,主要基于 HTTP 和 Apache Lucene 实现.Apache ...
HanLP《自然语言处理入门》笔记--3.二元语法与中文分词
笔记转载于GitHub项目:https://github.com/NLP-LOVE/Introduction-NLP 3. 二元语法与中文分词上一章中我们实现了块儿不准的词典分词,词典分词无法消歧. ...
Spring Boot入门系列（十）如何使用拦截器，一学就会！
前面介绍了Spring Boot 如何整合定时任务已经Spring Boot 如何创建异步任务,不清楚的朋友可以看看之前的文章:https://www.cnblogs.com/zhangweizhon ...
Solr入门之（8）中文分词器配置
Solr中虽然提供了一个中文分词器,但是效果很差,可以使用IKAnalyzer或Mmseg4j 或其他中文分词器. 一.IKAnalyzer分词器配置: 1.下载IKAnalyzer(IKAnalyz ...

随机推荐

多种的android进度条的特效源码
多种的android进度条的特效源码,这个源码是在源码天堂那个网站上转载过来的,我已经修改一部分了,感觉很实用的,大家可以学习一下吧,我就不上传源码了,大家可以直接到那个网站上下载吧. 源码天堂下载地 ...
mysql优化之定位问题
首先先介绍几个关键字 1 show status 表示数据库当前的状态数据 show [session|global] status session是当前连接的统计结果 global 是数据库 ...
mysql主从集群定时备份脚本
#!/bin/bash dpath="/mysql_backup" mydays="7" username="root" mysql_p ...
数据库降级-从sqlserver 2008 降到 2005
前天遇到一个问题,是一个数据库是Sqlserver 2008的,而平台数据库库是2005的,需要把2008的数据库附加进来,试了很多办法,现在觉得最好的办法就是导出导入办法. 第一步新建一个Sqls ...
Arcgis 10.1中空间连接功能
空间链接的作用:将面上的所有点的值加起来取平均值.赋值给面属性.(我们可以定义右击——定义合并规则连接要素的字段映射参数中指定的合并规则仅适用于连接要素中的属性,且仅适用于多个要素与目标要素匹配 ( ...
@properties指针说明
在iOS开发过程中,属性的定义往往与retain, assign, copy有关,我想大家都很熟悉了,在此我也不介绍,网上有很多相关文章. 现在我们看看iOS5中新的关键字strong, weak, ...
c#对字符串的各种操作
1.字符串定义 2.在字符串后面追加字符串 3.获取字符串长度 4.截取字符串的一部分 5.字符串转为比特码 6.查指定位置是否为空字符 7.查字符串是否是标点符号 8.截头去尾(Trim) 9.替换 ...
ExtJS4.2学习(20)动态数据表格之前几章总结篇1（转）
鸣谢:http://www.shuyangyang.com.cn/jishuliangongfang/qianduanjishu/2014-02-18/196.html --------------- ...
no appropriate service handler found The Connection descriptor used by the client was: localhost:1521:myorcl
参考网址:http://www.2cto.com/database/201205/133542.html http://www.cnblogs.com/kerrycode/p/4244493.html ...
[转载]easyui datagrid 时间格化（JS 日期时间本地化显示）
easyui datagrid 日期时间显示不正常,后台java 类型为 DATE 经过JSON工具一转化传到前台来就是这样,不便于是想格式化一下, 格式化代码如下: [javascript] v ...

【Lucene3.6.2入门系列】第04节_中文分词器

【Lucene3.6.2入门系列】第04节_中文分词器的更多相关文章

随机推荐

热门专题