Apache Solr

Apache solr开源的搜索服务器,通过类似REST的http API,确保能配合几乎任何编程语言来使用。
Solr作为外部搜索引擎的核心价值:为数据库“减负”,并提供更专业的全文搜索能力,本身可看成NoSQl类型的数据,但它比DB搜索更快,所以项目中一般把搜索部分交给solr。
1、Solr利用zookeeper进行分布式管理(ES自身带有分布式协调管理功能)
2、数据库本身不能分词效果,而只能使用模糊查询,但模糊查询非常低效,会给数据库带来很大压力,所以转移负载到一个外部搜索服务器上,防止由于沉重的数据库加载而拖垮应用的性能
3、Solr对中文的分词效果支持很差,所以结合IK Analyzer中文分词工具使用
4、Solr不止处理文本,更能理解“多模态”数据,可以索引图片和PDF(通过集成Apache Tika,Solr可以直接从PDF、Word、Excel甚至图片中提取文字并进行索引),OCR支持(结合Tesseract OCR引擎,Solr能够识别图片中的文字,实现“以图搜文”)
5、Solr支持更多格式的数据,如json、xml、csv等格式,而es仅支持Json格式
6、支持向量搜索:支持标量和二进制量化向量,可以通过GPU加速来更快地处理AI相关的搜索任务。这使得Solr能胜任语义搜索、推荐系统等现代AI应用场景。
7、Solr是传统搜索应用的有力解决方案,在对历史数据的搜索应用中表现要好于es,但在处理实时搜索应用时效率明显低于ES(当实时建立索引时,solr会产生Io阻塞,查询性能较差)。
image

posted @ 2026-06-08 14:38  愿鲁且愚  阅读(10)  评论(0)    收藏  举报