Lucence.net索引技术二

一、 Lucene索引创建和优化 [版本2.9.0以上]

Lucene索引的创建首先需要取得几个必须的对象：

1、分词器//可以采用其他的中文分词器
StandardAnalyzer analyzer = new StandardAnalyzer(Version.LUCENE_CURRENT);//分词器

2、lucene目录
File dir = new File(indexDir);// indexDir为文件路径
//这种目录存在锁机制，在打开目录时，写的权利一次只分给一个用户；有效保证了索引文件不会因为多线程问题，同时写索引导致文件损坏。
Directory idxDir = new SimpleFSDirectory(dir, new SimpleFSLockFactory());

3、写索引对象
// isNewCreate为boolean值
IndexWriter writer = new IndexWriter(idxDir, analyzer, isNewCreate, IndexWriter.MaxFieldLength.LIMITED);

对writer对象可以做一些基本设置，以便优化数据操作。
writer.setMergeFactor(50); // 多少个合并一次【优化缓存】
writer.setMaxMergeDocs(5000); // 一个segment最多有多少个document【优化索引存储的segment文件】

4、document实例化和参数设置
writer可以写入的对象document也需要预先申明。
Document doc = new Document();
这个document是lucene自定义的一种存储节点对象。一个document可以包含N个filed域，N的取值可以在indexWriter定义的时候申明。各种域对应不同的应用场景。

//只存储，不做索引分析，value值就是唯一索引对应该条记录
Field field = new Field(key1, value1, Store.YES, Index.NOT_ANALYZED_NO_NORMS);
//存储，且做索引分析，value值被分析器解析成各种分词，一组索引对应该条记录
field = new Field(key2, value2, Store.YES, Index.ANALYZED);
//只存储，没有索引对应该域
field = new Field(key3, value3, Store.YES, Index.NO);

// 数字范围搜索
NumericField numericField = new NumericField(key4, Store.YES, true);
numericField.setLongValue(value4);

域生成之后通过document的add方法添加到一个document对象中。
//document 域的添加
doc.add(field);
doc.add(numericField);

5、对索引的写操作和优化操作关键步骤如下

writer.addDocument(doc);//向索引文件中写数据
writer.optimize();// 索引优化，一般执行此步骤时，所消耗的内存是写入索引所需内存的2倍，在执行索引生成操作的时候本身就对内存有比较大的消耗，最好在索引创建完成之后，执行此步骤。
writer.commit();//数据提交
writer.rollback();//数据回滚
writer.close();//关闭流索引写入器，此步骤才真正将数据写入到索引文件中。

二、 Lucene索引实现精确查询分词查询范围查询多条件查询等

查询的步骤实现：

1、首先需要设置查询条件参数。
BooleanQuery query = new BooleanQuery();// 多条件查询处理检索条件

Query termQuery = new TermQuery(new Term(key,value)); // 基本／精确查询
query.add(termQuery, Occur.MUST);// 根据索引中的document生成时的设置，可以实现精确记录

/* 范围查询 */
Query numericRangeQuery = NumericRangeQuery.newLongRange(key, minValueLong, maxValueLong, true, true);
query.add(numericRangeQuery, Occur.MUST); // numericRangeQuery是按数值范围匹配

/* 多域组合查询 */
BooleanClause.Occur[] occurs =
new BooleanClause.Occur[] { BooleanClause.Occur.SHOULD, BooleanClause.Occur.SHOULD };
Query multiFieldQuery = MultiFieldQueryParser.parse(keyWord, new String[] { key1, key2 }, occurs, analyzer);
query.add(multiFieldQuery, Occur.MUST);// multiFieldQuery是把关键字keyWord分别在key1和key2中匹配组合查询

2、创建索引搜索器。
//以只读方式，创建索引搜索器
IndexSearcher searcher = new IndexSearcher(idxDir, readOnly);//readOnly 为boolean值

3、设置排序条件。
//设置根据哪个域的key来排序
SortField field = null;
// Long型降序
field = new SortField(key, SortField.LONG, true);
// Long型升序
field = new SortField(key, SortField.LONG, false);
// 搜索引擎权重
field = new SortField(null, SortField.SCORE, true);//不需要指定域的key来排序，lucene中会根据查询结果出现的次数给每个结果设置排序参数，搜索结果会按照这个排序参数的大小来由大到小进行排序。【即为搜索结果热门程度的降序排列】

// Integer型排序
field = new SortField(key, SortField.INT, true);

// 单条件排序
Sort sort = = new Sort(field);

// 多条件排序
SortField[] fields = new SortField[] { field1, field2 };
Sort sort = = new Sort(fields);

4、执行查询操作，并处理获得查询结果

//查询获取结果
// 查询 searcher.maxDoc()为searcher中所包含的最大document下标值 filter为过滤器[没有的话，一般写null]
TopFieldDocs docs = searcher.search(query, filter, searcher.maxDoc(), sort);
ScoreDoc[] scoreDocs = docs.scoreDocs;//权值对象包含document下标信息，能确定searcher中的document的下标。
int docCount = scoreDocs.length;//查询结果统计
// 取出最后一个查出的document对象

Document doc = searcher.doc(scoreDocs[docCount - 1].doc); // 通过document下标值，获取document对象

来源：http://lc0451.iteye.com/blog/616176

来源：http://www.cnblogs.com/lhj588/archive/2013/02/06/2900937.html

Lucence.net索引技术二的更多相关文章

Lucence.net索引技术一
1.建立索引为了对文档进行索引,Lucene 提供了五个基础的类,他们分别是 Document, Field, IndexWriter, Analyzer, Directory.下面我们分别介绍一下 ...
UNIX索引技术访问文件初阶
背景: 软考里面,多次碰到一道题: 过程以前对于这样的题,仅仅知道: 在文件系统中,文件的存储设备通常划分为若干个大小相等的物理块,每块长为512或1024字节.文件的理结构是指文件在存储设备上的存 ...
应用索引技术优化SQL 语句（转）
原文出处一.前言很多数据库系统性能不理想是因为系统没有经过整体优化,存在大量性能低下的SQL 语句.这类SQL语句性能不好的首要原因是缺乏高效的索引.没有索引除了导致语句本身运行速度慢外,更是导致 ...
Atitit 索引技术--位图索引
Atitit 索引技术--位图索引索引在数据结构上可以分为三种B树索引.位图索引和散列索引存储原理编辑位图索引对数据表的列的每一个键值分别存储为一个位图,Oracle对于不同的版本,不同的操作 ...
Indri中的动态文档索引技术
Indri中的动态文档索引技术戴维译摘要: Indri 动态文档索引的实现技术,支持在更新索引的同时处理用户在线查询请求. 文本搜索引擎曾被设计为针对固定的文档集合进行查询,对不少应用来说,这种 ...
Lucene.Net 2.3.1开发介绍 —— 三、索引（二）
原文:Lucene.Net 2.3.1开发介绍 -- 三.索引(二) 2.索引中用到的核心类在Lucene.Net索引开发中,用到的类不多,这些类是索引过程的核心类.其中Analyzer是索引建立的 ...
Oracle索引技术研究
Oracle索引类型 B树索引特定类型索引确定索引列主键和唯一键值列的索引外键索引其他合适的索引列 B树索引 B树索引算法 B树是指B-tree(Balanced Tree),B树的存在是为 ...
SQL Server索引总结二
从CREATE开始通过显式的CREATE INDEX命令在创建约束时作为隐含的对象随约束创建的隐含索引当向表中添加如下两种约束之一时,就会创建隐含索引. 主键约束(聚集索引) 唯一约束(唯一索 ...
MySQL索引（二）B+树在磁盘中的存储
MySQL索引(二)B+树在磁盘中的存储回顾上一篇文章<MySQL索引为什么要用B+树>讲了MySQL为什么选择用B+树来作为底层存储结构,提了两个知识点: B+树索引并不能直接找 ...

随机推荐

Windows Azure 网站：应用程序字符串和连接字符串的工作原理
编辑人员注释:本文章由 Windows Azure 网站团队的首席项目经理 Stefan Schackow 撰写. Windows Azure 网站上有一个方便的功能,即开发人员可将 Azure 中的 ...
[Leetcode][Python]32: Longest Valid Parentheses
# -*- coding: utf8 -*-'''__author__ = 'dabay.wang@gmail.com' 32: Longest Valid Parentheseshttps://oj ...
《Linux命令行与shell脚本编程大全》第十四章学习笔记
第十四章:呈现数据理解输入与输出标准文件描述符文件描述符缩写描述 0 STDIN 标准输入 1 STDOUT 标准输出 2 STDERR 标准错误 1.STDIN 代表标准输入.对于终端界面 ...
libcurl使用示例
远程下载文件,并将http 头信息存放内存中以及文件大小等相关信息: #include <stdio.h> #include <curl/curl.h> #include &l ...
用js获取周、月第一天和最后一天（转载）
var getCurrentWeek = function (day) { var days = ["周日", "周一", "周二", &q ...
关于使用由CA机构(EJBCA)颁发的证书实现SLLSocket双向认证服务端报null cert chain的解决方案
在 SSLSocket实现服务端和客户端双向认证的例子文章中最后提到使用keytool.exe的自签证书实现双向认证可以,但是使用ejbca生成证书实现SLL Socket的双向认证是服务端老是报错 ...
项目适配iOS9遇到的一些问题及解决办法
1.网络请求报错.升级Xcode 7.0发现网络访问失败.输出错误信息 The resource could not be loaded because the App Transport Secur ...
解决 jQuery-datepicker无法弹出日期的问题
1.确保 jquery-ui.css.jquery.min.js和jquery-ui.min.js 三个文件的引用 2.如果是下载网站上的html,需要删除时间<input>的hasDat ...
C++_基础_类和对象
内容: (1)引用 (2)类型转换 (3)C++社区给C程序员的建议 (4)面向对象编程的概念 (5)类和对象 (6)构造函数 (7)初始化列表及其必要性 1.引用1.1 指针和引用的使用说明(1)指 ...
linux杂记（四）热键[Tab],[ctrl]-c,[ctrl]-d，在线求助man page/info page
[Tab]按键他具有[命令补全](接在一串指令的第一个字后面)与[档案补齐](接在第一串指令的第二字以后时)的功能.如 [KANO@kelvin ~]$ ca[tab][tab] cabextrac ...

Lucence.net索引技术 二

Lucence.net索引技术 二的更多相关文章

随机推荐

热门专题

Lucence.net索引技术二

Lucence.net索引技术二的更多相关文章