Lucene学习笔记：基础

Lucence是Apache的一个全文检索引擎工具包。可以将采集的数据存储到索引库中，然后在根据查询条件从索引库中取出结果。索引库可以存在内存中或者存在硬盘上。

本文主要是参考了这篇博客进行学习的，原博客地址https://blog.csdn.net/bskfnvjtlyzmv867/article/details/80914156

主要开发流程是：采集数据，将数据转化成索引文档，然后存储在索引库中，索引库可以保存在内存中，或者保存在硬盘上。在查询的时候通过索引库查询结果，返回数据。

下面的例子主要是将Product表中的数据存储到索引库中，并通过索引库进行查询。项目依赖的jar包可以参考原博客，我用的Lucence版本是4.7。

新建实体类Product，其代码如下：

public class Product {

    private Long id;

    private String title;

    private String sellPoint;

}

将Product实体转化成索引库中Document，并存到索引库中。Product数据可以从数据库中查询，然后通过此方法转化成索引库中的Document，此处省略从数据库查询Product的逻辑。

import java.io.IOException;

import java.nio.file.Path;

import java.nio.file.Paths;

import org.apache.lucene.analysis.Analyzer;

import org.apache.lucene.analysis.standard.StandardAnalyzer;

import org.apache.lucene.document.Document;

import org.apache.lucene.document.Field;

import org.apache.lucene.document.StringField;

import org.apache.lucene.document.TextField;

import org.apache.lucene.index.IndexWriter;

import org.apache.lucene.index.IndexWriterConfig;

import org.apache.lucene.store.Directory;

import org.apache.lucene.store.FSDirectory;

import org.apache.lucene.util.Version;

import entity.Product;

public class ProductRepository {

    public void createIndex(Product product) {

        Field id = new StringField("id", product.getId().toString(), Field.Store.YES);

        Field title = new TextField("title", product.getTitle().toString(), Field.Store.YES);

        Field sellPoint = new TextField("sellPoint", product.getSellPoint().toString(), Field.Store.YES);

        Document document = new Document();

        document.add(id);

        document.add(title);

        document.add(sellPoint);

        Analyzer analyzer = new StandardAnalyzer(Version.LUCENE_47);

        IndexWriterConfig config = new IndexWriterConfig(Version.LUCENE_47, analyzer);

　　　　　

        Path path = Paths.get("D:/develop/workspace/slem_compass/data");

        try {

            Directory directory = FSDirectory.open(path.toFile());

            IndexWriter indexWriter = new IndexWriter(directory, config);

            indexWriter.addDocument(document);

            indexWriter.close();

        } catch (IOException e) {

            e.printStackTrace();

        }

    }

}

其中上面的代码中Path是索引库在硬盘上的位置，我这里是放在D盘上的某个文件夹内。

下面如何从索引库中查询数据呢？我写了一个Servlet，用户提交查询关键字，request获取到后，根据关键字从索引库中查询数据。当然也可以用Main方法或者test测试类。

import java.io.IOException;

import java.nio.file.Path;

import java.nio.file.Paths;

import javax.servlet.ServletException;

import javax.servlet.annotation.WebServlet;

import javax.servlet.http.HttpServlet;

import javax.servlet.http.HttpServletRequest;

import javax.servlet.http.HttpServletResponse;

import org.apache.lucene.analysis.Analyzer;

import org.apache.lucene.analysis.standard.StandardAnalyzer;

import org.apache.lucene.document.Document;

import org.apache.lucene.index.DirectoryReader;

import org.apache.lucene.index.IndexReader;

import org.apache.lucene.queryparser.classic.QueryParser;

import org.apache.lucene.search.IndexSearcher;

import org.apache.lucene.search.Query;

import org.apache.lucene.search.ScoreDoc;

import org.apache.lucene.search.TopDocs;

import org.apache.lucene.store.Directory;

import org.apache.lucene.store.FSDirectory;

import org.apache.lucene.util.Version;

@WebServlet("/search")

public class SearchServlet extends HttpServlet {

    private static final long serialVersionUID = 1L;

    public SearchServlet() {

        super();

    }

    protected void doGet(HttpServletRequest request, HttpServletResponse response)

            throws ServletException, IOException {

        request.setCharacterEncoding("utf-8");

        Analyzer analyzer = new StandardAnalyzer(Version.LUCENE_47);

        QueryParser parser = new QueryParser(Version.LUCENE_47, "title", analyzer);

        String title = request.getParameter("title");

        System.out.println("");

        System.out.println("title: " + title);

        try {

            Query query = parser.parse(title);

            Path path = Paths.get("D:/develop/workspace/slem_compass/data");

            Directory directory = FSDirectory.open(path.toFile());

            IndexReader reader = DirectoryReader.open(directory);

            IndexSearcher indexSearcher = new IndexSearcher(reader);

            TopDocs topDocs = indexSearcher.search(query, 10);

            ScoreDoc[] scoreDocs = topDocs.scoreDocs;

            for (ScoreDoc scoreDoc : scoreDocs) {

                int docID = scoreDoc.doc;

                Document doc = indexSearcher.doc(docID);

                System.out.println(doc.get("id") + " " + doc.get("title") + " " + doc.get("sellPoint"));

            }

            System.out.println("");

            reader.close();

        } catch (Exception e) {

            e.printStackTrace();

        }

        response.setContentType("text/html;charset=utf-8");

        response.getWriter().append("Served at: ").append(request.getContextPath());

    }

    protected void doPost(HttpServletRequest request, HttpServletResponse response)

            throws ServletException, IOException {

        doGet(request, response);

    }

}

查询的时候也是从D盘上的索引库中读取相应的信息，然后根据关键字进行查询。

这样就完成了索引库的存储和查询。索引的查询很复杂，上面的demo只是一个比较简单的例子，说明大致的原理，后面继续补充索引的查询。

Lucene学习笔记：基础的更多相关文章

jQuery学习笔记 - 基础知识扫盲入门篇
jQuery学习笔记 - 基础知识扫盲入门篇 2013-06-16 18:42 by 全新时代, 11 阅读, 0 评论, 收藏, 编辑 1.为什么要使用jQuery? 提供了强大的功能函数解决浏览器 ...
Lucene学习笔记（更新）
1.Lucene学习笔记 http://www.cnblogs.com/hanganglin/articles/3453415.html
Python学习笔记基础篇——总览
Python初识与简介[开篇] Python学习笔记——基础篇[第一周]——变量与赋值.用户交互.条件判断.循环控制.数据类型.文本操作 Python学习笔记——基础篇[第二周]——解释器.字符串.列 ...
数论算法剩余系相关学习笔记 (基础回顾,(ex)CRT,(ex)lucas,(ex)BSGS,原根与指标入门,高次剩余,Miller_Rabin+Pollard_Rho)
注:转载本文须标明出处. 原文链接https://www.cnblogs.com/zhouzhendong/p/Number-theory.html 数论算法剩余系相关学习笔记 (基础回顾,(ex ...
《python基础教程（第二版）》学习笔记基础部分（第1章）
<python基础教程(第二版)>学习笔记基础部分(第1章)python常用的IDE:Windows: IDLE(gui), Eclipse+PyDev; Python(command ...
Java学习笔记——基础篇
Tips1:eclipse中会经常用到System.out.println方法,可以先输入syso,然后eclipse就会自动联想出这个语句了!! 学习笔记: *包.权限控制 1.包(package) ...
Apache Lucene学习笔记
Hadoop概述 Apache lucene: 全球第一个开源的全文检索引擎工具包完整的查询引擎和搜索引擎部分文本分析引擎开发人员在此基础建立完整的全文检索引擎以下为转载:http://www ...
iOS学习笔记——基础控件（上）
本篇简单罗列一下一些常用的UI控件以及它们特有的属性,事件等等.由于是笔记,相比起来不会太详细 UIView 所有UI控件都继承于这个UIView,它所拥有的属性必是所有控件都拥有,这些属性都是控件最 ...
Lucene学习笔记
师兄推荐我学习Lucene这门技术,用了两天时间,大概整理了一下相关知识点. 一.什么是Lucene Lucene即全文检索.全文检索是计算机程序通过扫描文章中的每一个词,对每一个词建立一个索引,指明 ...

随机推荐

hml页面转化成图片
<!DOCTYPE html><html><head><meta charset="utf-8"><meta name=&qu ...
Faiss in python and GPU报错：NotImplementedError: Wrong number or type of arguments for overloaded function 'new_GpuIndexFlatL2'.
最近在玩faiss,运行这段代码的时候报错了: res = faiss.StandardGpuResources()flat_config = 0index = faiss.GpuIndexFlatL ...
SQL SERVER 死锁
sp_lock 查看锁表名称 select request_session_id spid,OBJECT_NAME(resource_associated_entity_id) tableNamefr ...
MySQL中链接查询inner join与left join使用
连接查询其实就是对两个表记录做笛卡尔乘积.如果不指定连接条件的话,则会对每行都做笛卡尔乘积,这样最后返回的结果树就会是两个表记录数的乘积:如果指定则,则仅对符合列条件的行进行笛卡尔乘积,并返回结果.在 ...
HBASE分布式集群搭建(ubuntu 16.04)
1.hbase是依赖Hadoop运行的,因此先确保自己已搭建好Hadoop集群环境没安装的可以参考这里:https://www.cnblogs.com/chaofan-/p/9740408.html ...
mac下新建txt文本快捷方式.md
转:127.0.0.1:47873/help/0-436/ms.help?method=page&id=A38C5670-BA28-44F3-BD5B-FCB46880E904&pro ...
idea中经常用到的快捷键
Ctrl+Alt+L 格式化代码 (但是在jsp或js中不给力,不如eclipse好用) Ctrl+G 搜索行数 Ctrl+F12 搜索方法,变量等... Ctrl+F8 ...
爬虫之pyspider
1.简单的介绍 pyspider是由国人binux编写的强大的网络爬虫系统,其GitHub地址为 https://github.com/binux/pyspider 官方文档地址为 http://do ...
OGRE中Any 类型的实现
[OGRE中Any类型的实现] OGRE中实现了一个class Any,使用Any 可以在上下文中传递任意类型的数据.其本质实现原理就是通过指针. Any 只包含一个成员变量,类型为 placehol ...
web应用程序+HTTP协议
标签(空格分隔): Django web应用程序案例: 如果我们想通过自己电脑访问京东,就是一个网络编程(因为京东的服务部署在京东,通过自己的电脑浏览器传输到京东服务就是网络编程):只要涉及到网络编程 ...

Lucene学习笔记：基础

Lucene学习笔记：基础的更多相关文章

随机推荐

热门专题