From:http://blog.csdn.net/xum2008/article/details/8740063

本文档是对现有的开源的搜索引擎的一个简单介绍


1.    Lucene

Lucene的开发语言是Java, 也是java家族中最为出名的一个开源搜索引擎, 在java世界中已经是标准的全文检索程序, 它提供了完整的查询引擎和索引引擎, 没有中文分词引擎, 需要自己去实现, 因此用Lucene去做一个搜素引擎需要自己去架构.

另外它不支持实时搜索, 但linkedin和twitter有分别对Lucene改进的实时搜素.

其中Lucene有一个C++移植版本叫CLucene, CLucene因为使用C++编写, 所以理论上要比lucene快.

官方主页: http://lucene.apache.org/

CLucene官方主页: http://sourceforge.net/projects/clucene/

2.    Sphinx --> 貌似很好吃的样子,可以探索一下

Sphinx是一个用C++语言写的开源搜索引擎,也是现在比较主流的搜索引擎之一, 在建立索引的事件方面比Lucene快50%,

但是索引文件比Lucene要大一倍, 因此Sphinx在索引的建立方面是空间换取事件的策略,

在检索速度上, 和lucene相差不大,

但检索精准度方面Lucene要优于Sphinx,

另外在加入中文分词引擎难度方面, Lucene要优于Sphinx.其中Sphinx支持实时搜索, 使用起来比较简单方便.

官方主页: http://sphinxsearch.com/about/sphinx/

3.    Xapian

Xapian是一个用C++编写的全文检索程序,它的api和检索原理和lucene在很多方面都很相似, 算是填补了lucene在C++中的一个空缺.

官方主页: http://xapian.org/

4.    Nutch

Nutch是一个用java实现的开源的web搜索引擎, 包括爬虫crawler, 索引引擎,查询引擎.

其中Nutch是基于Lucene的, Lucene为Nutch提供了文本索引和搜索的API.

对于应该使用Lucene还是使用Nutch,应该是如果你不需要抓取数据的话, 应该使用Lucene, 最常见的应用是:

你有数据源, 需要为这些数据提供一个搜索页面, 在这种情况下, 最好的方式是直接从数据库中取出数据, 并用Lucene API建立索引.

官方主页: http://nutch.apache.org/

5.    DataparkSearch

DataparkSearch是一个用C语言实现的开源的搜索引擎. 其中网页排序是采用神经网络模型.

其中支持HTTP, HTTPS, FTP,NNTP等下载网页.包括索引引擎, 检索引擎和中文分词引擎(这个也是唯一的一个开源的搜索引擎里有中文分词引擎).

能个性化定制搜索结果, 拥有完整的日志记录.

官方主页: http://www.dataparksearch.org/

6.    Zettair

Zettair是根据Justin Zobel的研究成果为基础的全文检索实验系统.它是用C语言实现的. 其中Justin Zobel在全文检索领域很有名气, 是业界第一个系统提出 倒排序索引差分压缩算法 的人,

倒排列表的压缩大大提高了检索和加载的性能, 同时空间膨胀率也缩小到相当优秀的水平.

由于Zettair是源于学术界, 代码是由RMIT University的搜索引擎组织写的, 因此它的代码简洁精炼, 算法高效, 是学习倒排索引经典算法的非常好的实例.

其中支持Linux, windows, mac os等系统.

官方主页: http://www.seg.rmit.edu.au/zettair/about.html

7.    Indri

Indri是一个用C语言和C++语言写的全文检索引擎系统, 是由University of Massachusetts和Carnegie Mellon University合作推出的一个开源项目.

特点是跨平台, API接口支持Java, PHP, C++.

官方主页: http://www.lemurproject.org/indri/

8.    Terrier

Terrier是由School of Computing Science, Universityof Glasgow用java开发的一个全文检索系统.

官方主页: http://terrier.org/

9.    Galago

Galago是一个用java语言写的关于文本搜索的工具集. 其中包括索引引擎和查询引擎, 还包括一个叫TupleFlow的分布式计算框架(和google的MapReduce很像).这个检索系统支持很多Indri查询语言.

官方主页: http://www.galagosearch.org/

10.  Zebra

Zebra是一个用C语言实现的检索程序, 特点是对大数据的支持, 支持EMAIL, XML, MARC等格式的数据.

官方主页: https://www.indexdata.com/zebra

11.  Solr

Solr是一个用java开发的独立的企业级搜索应用服务器, 它提供了类似于Web-service的API接口, 它是基于Lucene的全文检索服务器, 也算是Lucene的一个变种, 很多一线互联网公司都在使用Solr, 也算是一种成熟的解决方案.

官方主页: http://lucene.apache.org/solr/

12.  Elasticsearch

Elasticsearch是一个采用java语言开发的, 基于Lucene构造的开源, 分布式的搜索引擎. 设计用于云计算中, 能够达到实时搜索,稳定可靠. Elasticsearch的数据模型是JSON.

官方主页: http://www.elasticsearch.org/

13.  Whoosh

Whoosh是一个用纯Python写的开源搜索引擎.

官方主页: https://bitbucket.org/mchaput/whoosh/wiki/Home

[IR] Open Source Search Engines的更多相关文章

  1. coursera课程Text Retrieval and Search Engines之Week 1 Overview

    Week 1 OverviewHelp Center Week 1 On this page: Instructional Activities Time Goals and Objectives K ...

  2. [IR] XPath for Search Query

    XPath 1.0 XPath Containment Distributed Query Evaluation RE and DFA XPath 1.0 -- 在XML中的使用 XPath 语法: ...

  3. coursera课程Text Retrieval and Search Engines之Week 4 Overview

    Week 4 OverviewHelp Center Week 4 On this page: Instructional Activities Time Goals and Objectives K ...

  4. coursera课程Text Retrieval and Search Engines之Week 2 Overview

    Week 2 OverviewHelp Center Week 2 On this page: Instructional Activities Time Goals and Objectives K ...

  5. coursera课程Text Retrieval and Search Engines之Week 3 Overview

    Week 3 OverviewHelp Center Week 3 On this page: Instructional Activities Time Goals and Objectives K ...

  6. 本人AI知识体系导航 - AI menu

    Relevant Readable Links Name Interesting topic Comment Edwin Chen 非参贝叶斯   徐亦达老板 Dirichlet Process 学习 ...

  7. The Best Open Source Game Engine: In Search Of Perfection

    https://www.greatsoftline.com/the-best-open-source-game-engine-in-search-of-perfection/ The game eng ...

  8. Odoo ir actions 分析

    源代码位置:openerp/addons/base/ir/ir_actions.py 根类型:ir.actions.actions class actions(osv.osv): _name = 'i ...

  9. Web 检测代码 web analysis 开源 open source

    1. Grape Web Statistics Grape Web Statistics is a fairly simple piece of analytics software. Grape i ...

随机推荐

  1. cocos2d-x入门学习--准备篇

    1.Cocos2D最早是一款用Python语言开发的游戏引擎.Cocos2D是一个开源框架,用于构建二维游戏,演示程序和其他图形界面交互应用等. 2.x的包含两个意思:一方面是C++的文件扩展为CXX ...

  2. .Net机试题——编写一个BS架构的多层表结构的信息管理模块

      要求: 编写一个BS架构的多层表结构的信息管理模块,用户体验需要注意.包含错误处理,需要最终能完整的跑起来.页面可以不美化,但是整洁还是必须的.在不能完成详细功能需求的情况下优先保证基本功能. 1 ...

  3. 在Win7 64位旗舰版下,利用Vs2008编译64位的Qt 4.8.2

    1.下载qt-everywhere-opensource-src-4.8.2.zip. 2.VS2008需要安装x64编译器. 3.将qt-everywhere-opensource-src-4.8. ...

  4. Mongoose多数据库连接及实用样例

    使用环境: MongoDB 3.6 插件版本: "mongodb": "^3.1.10","mongoose": "^5.4.2& ...

  5. spring和springMVC的面试问题总结

    1.Spring中AOP的应用场景.Aop原理.好处? 答:AOP--Aspect Oriented Programming面向切面编程:用来封装横切关注点,具体可以在下面的场景中使用: Authen ...

  6. su 与 su - 比较

    原文地址:http://blog.chinaunix.net/uid-25557346-id-2889329.html   今天有一同事说在切换用户的时候,找不到该用户下用户命令,后来仔细检查了一下过 ...

  7. Linux 操作 oracle 数据库

    1.Oracle监听启动命令:lsnrctl start 2.   sqlplus 登录数据库 3.OS版本及Oracle版本 select banner from v$version; 4.查询该数 ...

  8. SSE图像算法优化系列一:一段BGR2Y的SIMD代码解析。

    一个同事在github上淘到一个基于SIMD的RGB转Y(彩色转灰度或者转明度)的代码,我抽了点时间看了下,顺便学习了一些SIMD指令,这里把学习过程中的一些理解和认识共享给大家. github上相关 ...

  9. MDX Step by Step 读书笔记(七) - Performing Aggregation 聚合函数之 Max, Min, Count , DistinctCount 以及其它 TopCount, Generate

    MDX 中最大值和最小值 MDX 中最大值和最小值函数的语法和之前看到的 Sum 以及 Aggregate 等聚合函数基本上是一样的: Max( {Set} [, Expression]) Min( ...

  10. framework中编译anroid工程并在模拟器上运行

    1.在eclipse下创建android工程Hello并拷贝到“源码目录/packages/experimental”下面   2.在Hello工程目录下面创建Android.mk文件,内容如下: L ...