开源搜索引擎的比较

为解决全站搜索问题。对开源搜索引擎的一个比较。在我的项目中，是ssh+jsp结构。选择solr是最佳的。

1. Lucene及其变种

Luncene

Lucene的开发语言是Java，也是Java家族中最为出名的一个开源搜索引擎，在Java世界中已经是标准的全文检索程序，它提供了完整的查询引擎和索引引擎，没有中文分词引擎，需要自己去实现，因此用Lucene去做一个搜素引擎需要自己去架构.另外它不支持实时搜索，但linkedin和twitter有分别对Lucene改进的实时搜素. 其中Lucene有一个C++移植版本叫CLucene，CLucene因为使用C++编写，所以理论上要比lucene快.

官方主页：http://lucene.apache.org/

CLucene官方主页：http://sourceforge.net/projects/clucene/

Solr

Solr是一个用java开发的独立的企业级搜索应用服务器，它提供了类似于Web-service的API接口，它是基于Lucene的全文检索服务器，也算是Lucene的一个变种，很多一线互联网公司都在使用Solr，也算是一种成熟的解决方案.

官方主页：http://lucene.apache.org/solr/

Elasticsearch

Elasticsearch是一个采用java语言开发的，基于Lucene构造的开源，分布式的搜索引擎. 设计用于云计算中，能够达到实时搜索，稳定可靠. Elasticsearch的数据模型是JSON.

官方主页：http://www.elasticsearch.org/

2.Xapian（C++）

用C++编写的全文检索引擎，和Java界的lucene类似。Xapian原生支持C/C++，并且也能够支持php、python等语言的动态绑定。

Xapian是一个用C++编写的全文检索程序，它的api和检索原理和lucene在很多方面都很相似，算是填补了lucene在C++中的一个空缺.

官方主页：http://xapian.org/

3.Sphinx

是一个基于SQL的全文检索引擎。特别为一些脚本语言（PHP,Python，Perl，Ruby）设计搜索API接口。

Sphinx是一个用C++语言写的开源搜索引擎，也是现在比较主流的搜索引擎之一，在建立索引的事件方面比Lucene快50%，但是索引文件比Lucene要大一倍，因此Sphinx在索引的建立方面是空间换取事件的策略，在检索速度上，和lucene相差不大，但检索精准度方面Lucene要优于Sphinx，另外在加入中文分词引擎难度方面，Lucene要优于Sphinx.其中Sphinx支持实时搜索，使用起来比较简单方便.

官方主页：http://sphinxsearch.com/about/sphinx/

4.Nutch

开源Java实现的搜索引擎。包括了全文搜索和web爬虫。不会扭曲搜索结果（付费前排）。

Nutch是基于Luncene的，Luncene为Nutch提供了文本索引和搜索的API。如果不需要抓取数据的话，应该使用Luncene。

你有数据源，需要为这些数据提供一个搜索页面。在这种情况下，最好的方式是直接从数据库中取出数据并用Lucene API 建立索引。

在你没有本地数据源，或者数据源非常分散的情况下，应该使用Nutch。

Nutch是一个用java实现的开源的web搜索引擎，包括爬虫crawler，索引引擎，查询引擎. 其中Nutch是基于Lucene的，Lucene为Nutch提供了文本索引和搜索的API.

对于应该使用Lucene还是使用Nutch，应该是如果你不需要抓取数据的话，应该使用Lucene，最常见的应用是：你有数据源，需要为这些数据提供一个搜索页面，在这种情况下，最好的方式是直接从数据库中取出数据，并用Lucene API建立索引.

官方主页：http://nutch.apache.org/

nutch入门教程：http://wenku.baidu.com/link?url=fcVfcY3B3EC11zJ5pLKgbgmsmF0P166YBT-M32C-imP2e1TPYkufC6HiMNkS_hFaL3koCH0WsczXElBc36wPTTr0BfIkp56ECga14-iPweC

5.Whoosh（python）

唯一的python写的全文搜索引擎，性能不比sphinx、xapian等，不过他很小，安装后才2.61M，容易集成，小站可用。

Whoosh是一个用纯python写的开源搜索引擎.

官方主页：https://bitbucket.org/mchaput/whoosh/wiki/Home

6.Datapark search

Web-based search。主要用于站内搜索，内部搜索或本地系统的搜索。C语言实现。

DataparkSearch是一个用C语言实现的开源的搜索引擎. 其中网页排序是采用神经网络模型. 其中支持HTTP，HTTPS，FTP，NNTP等下载网页.包括索引引擎，检索引擎和中文分词引擎(这个也是唯一的一个开源的搜索引擎里有中文分词引擎).能个性化定制搜索结果，拥有完整的日志记录.

官方主页：http://www.dataparksearch.org/

7.Zettair

基于倒排序索引结构的全文搜索开源引擎。基于C语言。

Zettair是根据Justin Zobel的研究成果为基础的全文检索实验系统.它是用C语言实现的. 其中Justin Zobel在全文检索领域很有名气，是业界第一个系统提出倒排序索引差分压缩算法的人，倒排列表的压缩大大提高了检索和加载的性能，同时空间膨胀率也缩小到相当优秀的水平. 由于Zettair是源于学术界，代码是由RMIT University的搜索引擎组织写的，因此它的代码简洁精炼，算法高效，是学习倒排索引经典算法的非常好的实例. 其中支持linux，windows，mac os等系统.

官方主页：http://www.seg.rmit.edu.au/zettair/about.html

参考文章：zettair介绍

http://blog.csdn.net/yijiyong100/article/details/11928453

8.Indri

支持文档索引。

http://blog.csdn.net/sharpdew/article/details/438250

Indri是一个用C语言和C++语言写的全文检索引擎系统，是由University of Massachusetts和Carnegie Mellon University合作推出的一个开源项目. 特点是跨平台，API接口支持Java，PHP，C++.

官方主页：http://www.lemurproject.org/indri/

9.Terrier

桌面搜索引擎

http://www.ibm.com/developerworks/cn/opensource/os-desktopsearch/index.html

Terrier是由School of Computing Science，Universityof Glasgow用java开发的一个全文检索系统.

官方主页：http://terrier.org/

10.Galago

Galago是一个用java语言写的关于文本搜索的工具集. 其中包括索引引擎和查询引擎，还包括一个叫TupleFlow的分布式计算框架(和google的MapReduce很像).这个检索系统支持很多Indri查询语言.

官方主页：http://www.galagosearch.org/

11.Zebra

Zebra是一个用C语言实现的检索程序，特点是对大数据的支持，支持EMAIL，XML，MARC等格式的数据.

官方主页：https://www.indexdata.com/zebra

开源搜索引擎的比较，可能资料比较陈旧了。

http://wenku.baidu.com/link?url=rUUWV6MW_mYejx3qGEoa62m6GihYYp9-8wqPgpM0xzPhImsTH9S316BRYQS6M7uunA86I6--1bCIDYM5X76Q7Saxo3ZMkwFFcDroK089D6u

下面这个13年的资料

http://www.open-open.com/news/view/e36182

posted @ 2014-09-28 22:51 花田里的猪猪阅读(3652) 评论(0) 收藏举报

刷新页面返回顶部

花田里的猪猪