Loading

【WebWiki】13 · ElasticSearch 入门(实操)

1. ElasticSearch概述

ElasticSearch简称es,是一个开源的高扩展的分布式全文检索引擎。它基于 Apache Lucene 构建,对外提供 RESTful API,能够在近乎实时(near real-time,通常 1 秒左右延迟)内完成海量数据的存储、搜索与分析。

一句话理解:Lucene 是一个高性能的全文检索底层库,但它只是库;Elasticsearch 把 Lucene 包装成了一个分布式的、可水平扩展的、带 REST 接口的搜索引擎服务。

为什么需要 ES,而不是用数据库的 LIKE?

  • 当数据量达到千万、上亿级别时,LIKE '%关键词%' 无法走索引,只能全表扫描,性能急剧下降;
  • 关系型数据库对中文分词、相关度打分、高亮、聚合统计(如分类统计、平均值、直方图)支持很弱;
  • ES 基于倒排索引,查询复杂度与命中文档数相关,而非与总数据量相关,因此大数据量下依然很快;
  • ES 天生的分布式能力:一份数据可以拆成多个分片(shard),分散在多台机器上,既能扩容也能容错。

典型使用场景

  • 站内搜索(电商商品、博客文章、文档检索);
  • 日志检索与分析(ELK 中的 E 就是 Elasticsearch,配合 Logstash、Kibana);
  • 应用性能监控(APM)、安全分析(SIEM);
  • 海量数据的聚合统计、大屏可视化。

版本说明(踩坑点)

  • 7.x 之后,一个索引只允许一个类型(固定为 _doc),types(如 user、order)的概念被废弃,8.x 彻底移除类型;
  • 7.x 默认不需要在 URL 里写类型,推荐统一用 /索引名/_doc/文档id;
  • 8.x 默认开启安全认证(用户名/密码 + TLS),而 7.x 默认关闭。新手本地练习若用 8.x,记得在 elasticsearch.yml 里把 xpack.security.enabled: false 关掉,否则连 curl 都会被拦;
  • 客户端版本尽量与服务器大版本保持一致(如服务端 7.6,Java 客户端也用 7.x),跨大版本可能不兼容。

2. ELK安装

很简单,指的就是 Elastic Stack。

“ELK”是三个开源项目的首字母缩写,这三个项目分别是:Elasticsearch、Logstash 和 Kibana。

  • Elasticsearch 是一个搜索和分析引擎。

  • Logstash 是服务器端数据处理管道,能够同时从多个来源采集数据,转换数据,然后将数据发送到诸如 Elasticsearch 等“存储库”中。

  • Kibana 则可以让用户在 Elasticsearch 中使用图形和图表对数据进行可视化。

ElasticSearch :https://mirrors.huaweicloud.com/elasticsearch/?C=N&O=D

logstash :https://www.elastic.co/cn/downloads/logstash

kibana : https://mirrors.huaweicloud.com/kibana/?C=N&O=D

版本匹配原则:Elasticsearch、Logstash、Kibana 三者的大版本号必须一致(例如都是 7.6.2),否则 Kibana 启动后连不上 ES,报版本不兼容错误。

2.1、ElasticSearch运行

1、解压Es之后,进入bin目录

可以双击运行软件截屏2021-04-27 下午3.28.26

访问127.0.0.1:9200可以看到:

截屏2021-04-27 下午3.29.21

看到返回的 JSON(包含 cluster_name、cluster_uuid、version 等字段),说明 ES 启动成功。如果页面打不开,先排查:

  • 是否以 非 root 用户 启动(ES 出于安全考虑禁止 root 直接运行,否则报 can not run elasticsearch as root);
  • 服务器内存是否足够(默认 JVM 堆 1G,机器内存小于 2G 会启动失败);
  • elasticsearch.yml 里是否绑定了正确 IP(network.host: 0.0.0.0 才能外网访问,但生产环境需配合安全配置);
  • 单台机器上 vm.max_map_count 是否足够(Linux 上常报 max virtual memory areas vm.max_map_count [65530] is too low,需执行 sysctl -w vm.max_map_count=262144)。

2.2.、kibana运行

像之前es的一样直接双击kibana即可

image-20210427161241449

访问127.0.0.1:5601

image-20210427174143929

Kibana 启动后,我们后面所有的 DSL 查询都推荐在 Kibana 的 Dev Tools(开发工具) 里执行,地址是 http://127.0.0.1:5601/app/dev_tools。它的 Console 提供自动补全和格式化,比在命令行敲 curl 方便得多。

2.3、Logstash 安装

要测试 Logstash 安装,请运行最基本的 Logstash 管道。 例如:

cd logstash-7.6.2
bin/logstash -e 'input { stdin { } } output { stdout {} }'

等 Logstash 完成启动后,我们在 stdin 里输入一下文字,我们可以看到如下的输出:

image-20210427191009383

当我们打入一行字符然后回车,那么我们马上可以在 stdout 上看到输出的信息。

如果我们能看到这个输出,说明我们的 Logstash 的安装是成功的。

另外一种运行 Logstash 的方式,也是一种最为常见的运行方式。我们首先需要创建一个配置文件,比如:heartbeat.conf

input {
  heartbeat {
    interval => 10
    type => "heartbeat"
  }
}
 
output {
  stdout {
    codec => rubydebug
  }
}

使用如下命令执行,发现每隔10s进行一次output

bin/logstash -f heartbeat.conf

image-20210427191406402

详细的请看:https://elasticstack.blog.csdn.net/article/details/105979677

实际生产中,Logstash 常用来从 MySQL、Kafka、文件(beats)采集数据并写入 ES。它的三段式结构 input { } filter { } output { } 是核心心智模型:filter 里可以做 grok 解析、字段转换、删除等多步加工。

3、可视化界面elasticsearch-head

下载:https://github.com/mobz/elasticsearch-head

3.1、安装依赖

cnpm install 

3.2、启动

npm run start

3.3、访问127.0.0.1:9100

image-20210427154649275

发现连接不上,跨域问题(跨端口,跨网站等)

3.4、修改配置,设置跨域

image-20210427154315555

添加两行:

http.cors.enabled: true
http.cors.allow-origin: "*"

注意:http.cors.allow-origin: "*" 仅适合本地练习。生产环境请写成具体的前端域名,否则存在跨站风险。

3.5、重新启动es

再次访问127.0.0.1:9100

image-20210427154632917

可以发现可以访问了

除了 head,官方更推荐用 Kibana 的 Stack Management / Dev Tools 来管理索引,head 更适合直观看分片分布与健康状态。

4. ES核心概念

集群,节点,索引,类型,文档,分片,映射是什么?

elasticsearch是面向文档,关系型数据库和elasticsearch客观的对比!一切都是json

Relational DB Elasticsearch
数据库(database) 索引(indices)
表(tables) 类型(types,7.x 后固定为 _doc)
行(rows) documents
字段(columns) fields

物理设计:

  • elasticsearch在后台把每个索引划分成多个分片。每个分片可以在集群中的不同服务器间迁移

逻辑设计:

  • 一个索引类型中,包含多个文档,当我们索引一篇文档时,可以通过这样的一个顺序找到它:索引->类型->文档id,通过这个组合我们就能索引到某个具体的文档。注意:ID不必是整数,实际上它是一个字符串。

关于“类型(type)”的重要变更:早期 ES 允许一个索引下有多个 type(像一张库里多张表),但官方发现这会带来Lucene底层实现复杂和性能问题,因此在 6.x 限制为一索引一类型,7.x 固定为 _doc,8.x 彻底移除。因此新项目请始终使用 _doc,不要自定义类型名。

4.1、文档

就是我们的一条条的记录,elasticsearch是面向文档的,那么就意味着索弓和搜索数据的最小单位是文档, elasticsearch中,文档有几个重要属性:

  • 自我包含, 一篇文档同时包含字段和对应的值,也就是同时包含key:value !

  • 可以是层次型的,一个文档中包含自文档,复杂的逻辑实体就是这么来的!

  • 灵活的结构,文档不依赖预先定义的模式,我们知道关系型数据库中,要提前定义字段才能使用,在elasticsearch中,对于字段是非常灵活的,有时候,我们可以忽略该字段,或者动态的添加一个新的字段。

尽管我们可以随意的新增或者忽略某个字段,但是,每个字段的类型非常重要,比如一个年龄字段类型,可以是字符串也可以是整形。因为elasticsearch会保存字段和类型之间的映射及其他的设置。这种映射具体到每个映射的每种类型,这也是为什么在elasticsearch中,类型有时候也称为映射类型。

文档的元数据:每个文档除了业务字段,还自带 _index、_type、_id、_source、_version 等元数据。_source 是原始 JSON 的原文,查询时默认返回的就是它;_version 是版本号,每次写入/更新自增,是乐观锁与并发控制的基础。

4.2、类型

  • 类型是文档的逻辑容器,就像关系型数据库一样,表格是行的容器。类型中对于字段的定义称为映射,比如name映射为字符串类型。
  • 文档是无模式的 ,它们不需要拥有映射中所定义的所有字段,比如新增一个字段,那么elasticsearch是怎么做的呢?
  • elasticsearch会自动的将新字段加入映射,但是这个字段的不确定它是什么类型, elasticsearch就开始猜,如果这个值是18 ,那么elasticsearch会认为它是整形。
  • 但是elasticsearch也可能猜不对 ,所以最安全的方式就是提前定义好所需要的映射,这点跟关系型数据库殊途同归了,先定义好字段,然后再使用。

这种“自动猜类型”的机制叫 Dynamic Mapping(动态映射)。比如 "2021-04-27" 会被猜成 date,"hello" 被猜成 text 并附带一个 keyword 子字段。但自动映射经常猜错(例如把手机号、身份证号猜成 long 导致写入失败),所以生产环境务必显式定义 mapping。

4.3、索引

就是数据库。索引是映射类型的容器,。elasticsearch中的索引是一个非常大的文档集合。索引存储了映射类型的字段和其他设置。然后它们被存储到了各个分片上。

物理设计:节点和分片如何工作

一个集群至少有一 个节点,而一个节点就是一个elasricsearch进程,节点可以有多个索引默认的,如果你创建索引,那么索引将会有个5个分片( primary shard,又称主分片)构成的,每一个主分片会有一个副本( replica shard ,又称复制分片)

上图是一个有3个节点的集群,可以看到主分片和对应的复制分片都不会在同一个节点内,这样有利于某个节点挂掉了,数据也不至于丢失。

实际上, 一个分片是一个Lucene索引,一个包含倒排索引的文件目录,倒排索引的结构使得elasticsearch在不扫描全部文档的情况下,就能告诉你哪些文档包含特定的关键字。

节点角色补充:一个节点可以是 master(负责集群元数据)、data(存数据)、ingest(预处理)、coordinating(协调节点)等角色。小集群里一个节点身兼数职;大集群会专门指定 node.master / node.data 来分离角色。分片分配(shard allocation)策略会尽量让主分片与副本分片落在不同节点,保证高可用。

4.4、倒排索引

elasticsearch使用的是一种称为倒排索引的结构,采用Lucene倒排索作为底层。

这种结构适用于快速的全文搜索,一个索引由文档中所有不重复的列表构成,对于每一个词,都有一个包含它的文档列表。

1、举例

例如,现在有两个文档,每个文档包含如下内容:

Study every day, good good up to forever  # 文档1包含的内容
To forever, study every day,good good up  # 文档2包含的内容

为创建倒排索引,我们首先要将每个文档拆分成独立的词(或称为词条或者tokens) ,然后创建一一个包含所有不重 复的词条的排序列表,然后列出每个词条出现在哪个文档:

term doc_1 doc_2
Study √ x
To x x
every √ √
forever √ √
day √ √
study x √
good √ √
every √ √
to √ x
up √ √
现在,我们试图搜索 to forever,只需要查看包含每个词条的文档
term doc_1 doc_2
to √ x
forever √ √
total 2 1
两个文档都匹配,但是第一个文档比第二个匹配程度更高。如果没有别的条件,现在,这两个包含关键字的文档都将返回。

相关度打分(relevance score):ES 默认用 BM25 算法计算 _score。它综合了「词频 TF」「逆文档频率 IDF」「字段长度归一化」等因素。上表中 doc_1 命中 2 个词、doc_2 命中 1 个,所以 doc_1 分数更高、排在前面。我们可以用 explain: true 查看打分细节,用于调优搜索结果。

再来看一个示例,比如我们通过博客标签来搜索博客文章。那么倒排索引列表就是这样的一个结构:

博客文章(原始数据) 博客文章(原始数据) 索引列表(倒排索引) 索引列表(倒排索引)
博客文章ID 标签 标签 博客文章ID
1 python python 1,2,3
2 python linux 3,4
3 linux,python
4 linux
如果要搜索含有python标签的文章,那相对于查找所有原始数据而言,查找倒排索引后的数据将会快的多。只需要查看标签这一栏,然后获取相关的文章ID即可。完全过滤掉无关的所有数据,提高效率!

4.5、ik分词器

1、下载

1、https://github.com/medcl/elasticsearch-analysis-ik
2、解压放到plugins

安装方式有两种:

  • 方式 A(推荐):用 ES 自带的插件命令,自动下载到对应版本目录:
    # 进入 es 安装目录
    bin/elasticsearch-plugin install https://github.com/medcl/elasticsearch-analysis-ik/releases/download/v7.6.2/elasticsearch-analysis-ik-7.6.2.zip
    
  • 方式 B(Docker):在 docker run 时挂载自定义插件目录,或基于官方镜像写 Dockerfile:
    FROM docker.elastic.co/elasticsearch/elasticsearch:7.6.2
    RUN elasticsearch-plugin install --batch https://github.com/medcl/elasticsearch-analysis-ik/releases/download/v7.6.2/elasticsearch-analysis-ik-7.6.2.zip
    

注意 版本必须和 ES 完全一致,否则启动报 Plugin [analysis-ik] was built for Elasticsearch ... but version ... is required。

2、测试

IK提供了两个分词算法: ik_ smart和ik_ max_ word ,其中ik_ smart为最少切分, ik_ max_ _word为最细粒度划分!一会我们测试!

3、什么是IK分词器:

把一句话分词
如果使用中文:推荐IK分词器
两个分词算法:ik_smart(最少切分),ik_max_word(最细粒度划分)

二者的区别:

  • ik_smart:粗粒度,尽量少切。如“中华人民共和国” → “中华人民共和国”。适合搜索时(query 侧)用,结果更聚焦。
  • ik_max_word:细粒度,穷尽词典组合。如“中华人民共和国” → “中华人民共和国 / 中华人民 / 中华 / 华人 / 人民共和国 / 人民 / 共和国 / 共和 / 国”。适合索引时(index 侧)用,召回更全。
    常见最佳实践:索引时用 ik_max_word,搜索时用 ik_smart。

4、ik_smart测试:

image-20210427212220035

输出:

image-20210427212227299

5、ik_max_word测试:

image-20210427212330617

输出

image-20210427212339563

6、自定义词典(扩展词 / 停用词)

默认词典覆盖常用词,但业务词(品牌名、行业术语、人名)往往切不出来。我们需要扩展词典:

  1. 进入 plugins/elasticsearch-analysis-ik-7.6.2/config/ 目录;
  2. 编辑 IKAnalyzer.cfg.xml:
<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE properties SYSTEM "http://java.sun.com/dtd/properties.dtd">
<properties>
    <comment>IK Analyzer 扩展配置</comment>
    <!-- 用户可在此添加自己的扩展字典 -->
    <entry key="ext_dict">extra_my.dic</entry>
    <!-- 用户可在此添加自己的扩展停止词字典 -->
    <entry key="ext_stopwords">extra_stopword.dic</entry>
    <!-- 远程扩展词典(热更新,无需重启 ES),内容为每行一个词 -->
    <entry key="remote_ext_dict">http://127.0.0.1:8080/dict/ik/getDict</entry>
    <entry key="remote_ext_stopwords">http://127.0.0.1:8080/dict/ik/getStop</entry>
</properties>
  1. 在同目录新建 extra_my.dic,写入自定义词(如“螺狮粉”“狂神说”),注意文件必须保存为 UTF-8 无 BOM;
  2. 重启 ES 生效。

热更新技巧:使用 remote_ext_dict 指向一个 HTTP 接口,ES 会定时(默认 60s)拉取,接口返回 Last-Modified 或 ETag 头,内容有变化才重新加载。这样业务新增词不用重启集群。返回格式非常简单,每行一个词即可:

@GetMapping("/dict/ik/getDict")
public ResponseEntity<String> getDict() {
    String words = "螺狮粉\n狂神说\n分布式事务";   // 从数据库动态读
    HttpHeaders headers = new HttpHeaders();
    headers.setContentType(MediaType.TEXT_PLAIN);
    return new ResponseEntity<>(words, headers, HttpStatus.OK);
}

5、命令模式的使用

5.1、Rest风格说明

一种软件架构风格,而不是标准。更易于实现缓存等机制

method url地址 描述
PUT localhost:9200/索引名称/类型名称/文档id 创建文档(指定文档id)
POST localhost:9200/索引名称/类型名称 创建文档(随机文档id)
POST localhost:9200/索引名称/类型名称/文档id/_update 修改文档
DELETE localhost:9200/索引名称/类型名称/文档id 删除文档
GET localhost:9200/索引名称/类型名称/文档id 通过文档id查询文档
POST localhost:9200/索引名称/类型名称/_search 查询所有的数据

7.x 之后建议把“类型名称”写成 _doc,即 PUT /索引名/_doc/文档id。POST /索引名/_doc 不指定 id 时 ES 自动生成。

5.2、创建一个索引

PUT /索引名/类型名/文档id

image-20210427223312977

可以看到插入成功。

image-20210427223339156

5.2.1、查看属性

image-20210427224111596

5.2.2、指定字段的类型properties

获得这个规则!可以通过GET请求获得具体的信息

image-20210427224617555

强烈建议在创建索引时显式指定 mapping,而不是依赖动态映射。下面给出一个完整的「建索引 + 指定字段类型」示例,也是真实项目中常见的商品索引设计:

PUT /products
{
  "settings": {
    "number_of_shards": 3,           // 主分片数,一旦设定不可修改(只能 reindex 重建)
    "number_of_replicas": 1,         // 每个主分片的副本数,可随时调整
    "analysis": {
      "analyzer": {
        "ik_pinyin": {               // 自定义分析器(示例:ik + 拼音,可按需删减)
          "type": "custom",
          "tokenizer": "ik_max_word"
        }
      }
    }
  },
  "mappings": {
    "properties": {
      "id":       { "type": "long" },
      "title":    { "type": "text", "analyzer": "ik_max_word", "search_analyzer": "ik_smart" },
      "category": { "type": "keyword" },   // 不分词,用于聚合/精确匹配
      "price":    { "type": "scaled_float", "scaling_factor": 100 }, // 避免浮点误差
      "stock":    { "type": "integer" },
      "onSale":   { "type": "boolean" },
      "tags":     { "type": "keyword" },   // 数组类型,keyword 便于 terms 聚合
      "createTime": { "type": "date", "format": "yyyy-MM-dd HH:mm:ss" },
      "location": { "type": "geo_point" } // 地理坐标,可做距离排序
    }
  }
}

字段类型速查(常用):

  • text:会分词,用于全文检索(标题、正文)。不能直接用于聚合/排序,需配合 keyword 子字段;
  • keyword:不分词,原样存储,用于精确匹配、过滤、聚合、排序(状态、分类、标签);
  • integer / long / short:整数;float / double / scaled_float:浮点;
  • date:日期,需指定 format;
  • boolean:布尔;
  • nested:对象数组,避免对象扁平化导致跨字段匹配错误(如 [{color:红,size:大},{color:蓝,size:小}] 用 nested 才能正确查询“红且大”);
  • geo_point / geo_shape:地理位置。

5.2.3、如果自己不设置文档字段类型,那么es会自动给默认类型

image-20210427224310325

动态映射默认对字符串字段会建 text 类型并附带 .keyword 子字段(如 name 和 name.keyword),所以 name 能全文搜、name.keyword 能聚合。但数字字符串(如 "13012345678")可能被误判成 long 而写入失败,这就是为什么一定要显式 mapping。

5.3、cat命令

查看健康值

image-20210427230824501

查看所有信息

image-20210427230928608

常用 _cat 命令(运维必备):

# 集群健康:green / yellow / red
GET /_cat/health?v

# 节点列表与资源占用
GET /_cat/nodes?v

# 所有索引及文档数、存储大小
GET /_cat/indices?v

# 分片分布(排查未分配分片很有用)
GET /_cat/shards?v

# 查看某个索引的 mapping
GET /products/_mapping

# 查看某个索引的设置
GET /products/_settings

健康状态含义:green 主副分片都正常;yellow 主分片正常但副本未分配(通常单机集群会 yellow,不影响使用);red 有主分片丢失,部分数据不可用时,需紧急处理。

5.4、修改索引

1.修改我们可以还是用原来的PUT的命令,根据id来修改

image-20210427231229779

可以看到version为2证明已经是修改过的了

但是如果没有填写的字段 会重置为空了 ,相当于java接口传对象修改,如果只是传id的某些字段,那其他没传的值都为空了。

2.还有一种update方法 这种不设置某些值 数据不会丢失

image-20210427231645181

推荐用 _update + 部分字段,而不是整体 PUT。整体 PUT 会覆盖整个文档(先删后建),未传字段变空;_update 是真正的局部更新(merge)。还可以用脚本更新:

POST /products/_update/1001
{
  "script": {
    "source": "ctx._source.stock += params.inc",
    "lang": "painless",
    "params": { "inc": 5 }
  }
}

5.5、删除索引

通过DELETE命令实现删除,根据你的请求来判断是删除索引还是删除文档记录。

image-20210427231917245

# 删整个索引(危险!不可恢复,除非有快照)
DELETE /products

# 只删某条文档
DELETE /products/_doc/1001

生产环境建议给删除操作加防护:在 elasticsearch.yml 设置 action.destructive_requires_name: true,禁止 DELETE /* 这种通配符误删全部索引。

5.6、关于文档的基本操作

最简单的搜索是GET

搜索功能search

Get /test/_doc/_search?q=name:yes

image-20210427232728830

这边name是text 所以做了分词的查询 如果是keyword就不会分词搜索了

这里的 q=name:yes 是 URI Search(简单查询串),适合临时查。真正的复杂查询用 Request Body Search(下面 5.7),把查询条件写在 JSON 请求体里。

5.7、复杂操作搜索select(排序,分页,高亮,模糊查询,精准查询)

Get /test/_doc/_search?q=name:yes

GET /test/_doc/_search
{
  "query": {
    "match": {
      "name": "yes"
    }
  },
  "_source":["name"]
}

结果过滤,就是只展示列表中某些字段

image-20210427233730753

不包含

image-20210427233941280

排序

image-20210427234108784

分页

image-20210427234229482

5.7.1、DSL 查询完整示例(核心,必会)

下面把日常最常用的查询集中演示一遍。假设索引 products 已按上面的 mapping 建好。

(1) match 全文检索(会分词)

GET /products/_search
{
  "query": {
    "match": {
      "title": "华为手机"      // ik_smart 分词后检索,相关度排序
    }
  }
}

(2) term 精确匹配(不分词,用于 keyword / 数值 / 布尔)

GET /products/_search
{
  "query": {
    "term": { "category": "手机" }   // category 是 keyword,必须精确相等
  }
}

常见坑:term 对 text 字段查不到,因为 text 被分词成多个 term;要对 text 做精确匹配请用 .keyword 子字段,或改用 match。

(3) terms 多值匹配(IN 查询)

GET /products/_search
{
  "query": { "terms": { "category": ["手机", "电脑", "平板"] } }
}

(4) match_phrase 短语匹配(词序一致)

GET /products/_search
{
  "query": { "match_phrase": { "title": "华为手机" } }  // 必须连续出现“华为 手机”
}

(5) range 范围查询

GET /products/_search
{
  "query": {
    "range": {
      "price": { "gte": 1000, "lte": 5000 },
      "createTime": { "gte": "2024-01-01 00:00:00" }
    }
  }
}

(6) bool 组合查询(must / should / must_not / filter)

GET /products/_search
{
  "query": {
    "bool": {
      "must": [                       // 必须满足,参与打分
        { "match": { "title": "华为" } }
      ],
      "filter": [                     // 过滤,不参与打分,可缓存,性能好
        { "term": { "onSale": true } },
        { "range": { "price": { "gte": 1000, "lte": 5000 } } }
      ],
      "must_not": [                   // 必须不满足
        { "term": { "category": "配件" } }
      ],
      "should": [                     // 应该满足(or,打分加权)
        { "match": { "title": "Pro" } }
      ]
    }
  }
}

filter vs must:二者都能过滤数据,但 filter 不计算相关度分数、结果可被缓存,因此能用 filter 就用 filter,性能更好。

(7) 排序 + 分页 + 结果字段过滤

GET /products/_search
{
  "query": { "match_all": {} },
  "_source": ["title", "price", "category"],
  "from": 0,                          // 从第几条开始(页码-1)* size
  "size": 20,                         // 每页条数
  "sort": [
    { "price": { "order": "desc" } },
    { "_score": { "order": "desc" } }
  ]
}

深度分页陷阱:ES 默认 from + size 不能超过 index.max_result_window(10000)。翻到第 10001 条会报错。海量翻页要用 search_after(基于上一页最后一条的排序值游标)或 scroll(快照式遍历)。

(8) 聚合查询(aggs):分类统计 + 平均价

GET /products/_search
{
  "size": 0,                          // 不返回具体文档,只看聚合结果
  "aggs": {
    "group_by_category": {
      "terms": { "field": "category", "size": 10 }   // 按分类分组计数
    },
    "avg_price": {
      "avg": { "field": "price" }                       // 全局平均价
    }
  }
}

(9) 高亮

还能自定义高亮的样式

GET /products/_search
{
  "query": { "match": { "title": "华为" } },
  "highlight": {
    "pre_tags": ["<span style='color:red'>"],
    "post_tags": ["</span>"],
    "fields": { "title": {} }
  }
}

(10) 模糊与通配

GET /products/_search
{
  "query": { "fuzzy": { "title": { "value": "华维", "fuzziness": 1 } } }  // 允许 1 个字符差异
}
GET /products/_search
{
  "query": { "wildcard": { "category": "手*" } }   // 通配符
}

多条件查询

布尔值查询
must(and),所有的条件都要符合

should(or)或者的 跟数据库一样

must_not(not)

条件区间

  • gt大于

  • gte大于等于

  • lte小于

  • lte小于等于

匹配多个条件(数组)

5.7.2、批量操作与索引别名(实用)

# 1. 批量写入(bulk),一行 action 一行 data
POST /products/_bulk
{ "index": { "_id": 1 } }
{ "title": "华为 Mate 60", "category": "手机", "price": 6999, "onSale": true }
{ "index": { "_id": 2 } }
{ "title": "小米 14 Pro", "category": "手机", "price": 4999, "onSale": true }

# 2. 索引别名:对外暴露稳定名称,重建索引时无缝切换
POST /_aliases
{
  "actions": [
    { "remove": { "index": "products_v1", "alias": "products" } },
    { "add":    { "index": "products_v2", "alias": "products" } }
  ]
}

别名(alias)是线上零停机改 mapping 的关键手段:先在 products_v2 上建好新结构并 reindex 数据,再把别名从 v1 切到 v2,应用无感知。

# reindex:把旧索引数据搬到新索引(改 mapping 的标配)
POST /_reindex
{
  "source": { "index": "products_v1" },
  "dest":   { "index": "products_v2" }
}

6、springboot集成

1、添加依赖

<dependency>
  <groupId>org.springframework.boot</groupId>
  <artifactId>spring-boot-starter-data-elasticsearch</artifactId>
  <version>2.3.7.RELEASE</version>
</dependency>

版本提示:spring-boot-starter-data-elasticsearch 在 Spring Boot 2.3 中封装的是 RestHighLevelClient(7.x 客户端)。该客户端在 ES 8.x 已被标记为废弃,官方推荐使用新的 Java API Client(co.elastic.clients:elasticsearch-java)。如果是 7.x 服务端,下面代码可直接用;若用 8.x,请改用新客户端,API 写法不同但思路一致。

2、自定义配置

package com.xiaofan.config;

import org.apache.http.HttpHost;
import org.elasticsearch.client.RestClient;
import org.elasticsearch.client.RestHighLevelClient;
import org.springframework.context.annotation.Bean;
import org.springframework.context.annotation.Configuration;

@Configuration
public class ElasticSearchClientConfig {
  @Bean
  public RestHighLevelClient restHighLevelClient() {
    RestHighLevelClient client = new RestHighLevelClient(
      RestClient.builder(
        new HttpHost("127.0.0.1", 9200, "http")
      )
    );

    return client;
  }
}

3、测试

package com.example.demo;

import org.elasticsearch.action.admin.indices.delete.DeleteIndexRequest;
import org.elasticsearch.action.support.master.AcknowledgedResponse;
import org.elasticsearch.client.RequestOptions;
import org.elasticsearch.client.RestHighLevelClient;
import org.elasticsearch.client.indices.CreateIndexRequest;
import org.elasticsearch.client.indices.CreateIndexResponse;
import org.elasticsearch.client.indices.GetIndexRequest;
import org.junit.jupiter.api.Test;
import org.springframework.beans.factory.annotation.Autowired;
import org.springframework.beans.factory.annotation.Qualifier;
import org.springframework.boot.test.context.SpringBootTest;

import java.io.IOException;

@SpringBootTest
class DemoApplicationTests {


    @Autowired
    @Qualifier(value = "restHighLevelClient")
    private RestHighLevelClient client;


    @Test
    void testCreateIndex() throws IOException {
        //1.创建索引的请求
        CreateIndexRequest request = new CreateIndexRequest("lisen_index");
        //2客户端执行请求,请求后获得响应
        CreateIndexResponse response = client.indices().create(request, RequestOptions.DEFAULT);
        System.out.println(response);
    }

    //测试索引是否存在
    @Test
    void testExistIndex() throws IOException {
        //1.创建索引的请求
        GetIndexRequest request = new GetIndexRequest("lisen_index");
        //2客户端执行请求,请求后获得响应
        boolean exist = client.indices().exists(request, RequestOptions.DEFAULT);
        System.out.println("测试索引是否存在-----" + exist);
    }

    //删除索引
    @Test
    void testDeleteIndex() throws IOException {
        DeleteIndexRequest request = new DeleteIndexRequest("lisen_index");
        AcknowledgedResponse delete = client.indices().delete(request, RequestOptions.DEFAULT);
        System.out.println("删除索引--------" + delete.isAcknowledged());
    }
}

6.1、使用 Spring Data Elasticsearch 的实体与 Repository(推荐)

除了底层 RestHighLevelClient,Spring Data ES 还提供声明式 Repository,开发更省心。

(1) 文档实体

import org.springframework.data.annotation.Id;
import org.springframework.data.elasticsearch.annotations.Document;
import org.springframework.data.elasticsearch.annotations.Field;
import org.springframework.data.elasticsearch.annotations.FieldType;

@Document(indexName = "products")   // 对应索引名
public class Product {

    @Id
    private Long id;

    @Field(type = FieldType.Text, analyzer = "ik_max_word", searchAnalyzer = "ik_smart")
    private String title;            // 中文分词

    @Field(type = FieldType.Keyword)
    private String category;         // 不分词

    @Field(type = FieldType.Double)
    private Double price;

    @Field(type = FieldType.Boolean)
    private Boolean onSale;

    // getter/setter 省略
}

(2) Repository 接口

import org.springframework.data.elasticsearch.repository.ElasticsearchRepository;

public interface ProductRepository extends ElasticsearchRepository<Product, Long> {
    // 方法名自动推导查询:按分类精确查
    List<Product> findByCategory(String category);
    // 按标题全文检索
    List<Product> findByTitle(String keyword);
}

(3) 业务层调用

@Service
public class ProductService {

    @Autowired
    private ProductRepository productRepository;

    public void save(Product p) {
        productRepository.save(p);                  // 单条写入
    }

    public void batchSave(List<Product> list) {
        productRepository.saveAll(list);             // 批量写入
    }

    public List<Product> search(String keyword) {
        return productRepository.findByTitle(keyword);
    }
}

踩坑提示:

  • @Document(indexName = "products") 如果索引不存在,默认不会自动创建带 ik 分词的 mapping,而是用动态映射,导致中文搜索失效。要么提前用 PUT 建好 mapping,要么配置 indexName 并在配置里开启自动创建(并用 ElasticsearchOperations 手动 putMapping);
  • 实体字段类型和 ES mapping 要对得上,否则写入报 mapper_parsing_exception。

7实战:模拟全文搜索-京东搜索

github链接:https://github.com/fanjianhai/CODE/tree/main/SpringBoot/springboot-11-elasticsearch-jd

7.1、搭建springboot项目,添加依赖

<dependencies>
  <!--springboot的elasticsearch服务-->
  <dependency>
    <groupId>org.springframework.boot</groupId>
    <artifactId>spring-boot-starter-data-elasticsearch</artifactId>
    <version>2.3.7.RELEASE</version>
  </dependency>
  <dependency>
    <groupId>org.springframework.boot</groupId>
    <artifactId>spring-boot-starter-thymeleaf</artifactId>
    <version>2.4.5</version>
  </dependency>
  <dependency>
    <groupId>org.springframework.boot</groupId>
    <artifactId>spring-boot-starter-test</artifactId>
    <scope>test</scope>
    <exclusions>
      <exclusion>
        <groupId>org.junit.vintage</groupId>
        <artifactId>junit-vintage-engine</artifactId>
      </exclusion>
    </exclusions>
  </dependency>
  <dependency>
    <groupId>org.springframework.boot</groupId>
    <artifactId>spring-boot-starter-web</artifactId>
  </dependency>
  <!-- 解析网页用 -->
  <dependency>
    <groupId>org.jsoup</groupId>
    <artifactId>jsoup</artifactId>
    <version>1.13.1</version>
  </dependency>
</dependencies>

7.2、配置esconfig

@Configuration
public class ElasticSearchClientConfig {
    @Bean
    public RestHighLevelClient restHighLevelClient(){
        RestHighLevelClient client = new RestHighLevelClient(
                RestClient.builder(new HttpHost("127.0.0.1",9200,"http"))
        );
        return client;
    }
}

7.3、定义content

public class Content implements Serializable {
    private String title;
    private String imgUrl;
    private String price;

    public Content() {
    }

    public Content(String title, String imgUrl, String price) {
        this.title = title;
        this.imgUrl = imgUrl;
        this.price = price;
    }

    public String getTitle() {
        return title;
    }

    public void setTitle(String title) {
        this.title = title;
    }

    public String getImgUrl() {
        return imgUrl;
    }

    public void setImgUrl(String imgUrl) {
        this.imgUrl = imgUrl;
    }

    public String getPrice() {
        return price;
    }

    public void setPrice(String price) {
        this.price = price;
    }

    @Override
    public String toString() {
        return "Content{" +
                "title='" + title + '\'' +
                ", imgUrl='" + imgUrl + '\'' +
                ", price='" + price + '\'' +
                '}';
    }
}

7.4、爬虫

@Component
public class HtmlParseUtl {
    public List<Content> parseJD(String keywords) throws IOException {
        String url = "https://search.jd.com/Search?keyword=" + keywords;
        Document document = Jsoup.parse(new URL(url), 30000);
        Element divElement = document.getElementById("J_goodsList");
        Elements lis = divElement.getElementsByTag("li");

        List<Content> contents = new ArrayList<>();

        for (Element li : lis) {
            String title = li.getElementsByClass("p-name").eq(0).text();
            // 注意:懒加载的图片
            String imgUrl = li.getElementsByTag("img").eq(0).attr("data-lazy-img");
            String price = li.getElementsByClass("p-price").eq(0).text();
            contents.add(new Content(title, imgUrl, price));
        }
        return contents;
    }
}

实战踩坑:京东商品图是懒加载,src 为空,真实地址在 data-lazy-img(或新版 data-lazy-img / src2)。另外京东有反爬,真实项目建议用其开放 API 或自己后端数据库,不要直接爬线上。

7.5、设置index.html

<!DOCTYPE html>
<html xmlns:th="http://www.thymeleaf.org">

<head>
    <meta charset="utf-8"/>
    <title>狂神说Java-ES仿京东实战</title>
    <link rel="stylesheet" th:href="@{/css/style.css}"/>
</head>

<body class="pg">
<div class="page" id="app">
    <div id="mallPage" class=" mallist tmall- page-not-market ">

        <!-- 头部搜索 -->
        <div id="header" class=" header-list-app">
            <div class="headerLayout">
                <div class="headerCon ">
                    <!-- Logo-->
                    <h1 id="mallLogo">
                        <img th:src="@{/images/jdlogo.png}" alt="">
                    </h1>

                    <div class="header-extra">

                        <!--搜索-->
                        <div id="mallSearch" class="mall-search">
                            <form name="searchTop" class="mallSearch-form clearfix">
                                <fieldset>
                                    <legend>天猫搜索</legend>
                                    <div class="mallSearch-input clearfix">
                                        <div class="s-combobox" id="s-combobox-685">
                                            <div class="s-combobox-input-wrap">
                                                <input v-model="keyword" type="text" autocomplete="off" value="dd" id="mq"
                                                       class="s-combobox-input" aria-haspopup="true">
                                            </div>
                                        </div>
                                        <button type="submit" @click.prevent="searchKey" id="searchbtn">搜索</button>
                                    </div>
                                </fieldset>
                            </form>
                            <ul class="relKeyTop">
                                <li><a>狂神说Java</a></li>
                                <li><a>狂神说前端</a></li>
                                <li><a>狂神说Linux</a></li>
                                <li><a>狂神说大数据</a></li>
                                <li><a>狂神聊理财</a></li>
                            </ul>
                        </div>
                    </div>
                </div>
            </div>
        </div>

        <!-- 商品详情页面 -->
        <div id="content">
            <div class="main">
                <!-- 品牌分类 -->
                <form class="navAttrsForm">
                    <div class="attrs j_NavAttrs" style="display:block">
                        <div class="brandAttr j_nav_brand">
                            <div class="j_Brand attr">
                                <div class="attrKey">
                                    品牌
                                </div>
                                <div class="attrValues">
                                    <ul class="av-collapse row-2">
                                        <li><a href="#"> 狂神说 </a></li>
                                        <li><a href="#"> Java </a></li>
                                    </ul>
                                </div>
                            </div>
                        </div>
                    </div>
                </form>

                <!-- 排序规则 -->
                <div class="filter clearfix">
                    <a class="fSort fSort-cur">综合<i class="f-ico-arrow-d"></i></a>
                    <a class="fSort">人气<i class="f-ico-arrow-d"></i></a>
                    <a class="fSort">新品<i class="f-ico-arrow-d"></i></a>
                    <a class="fSort">销量<i class="f-ico-arrow-d"></i></a>
                    <a class="fSort">价格<i class="f-ico-triangle-mt"></i><i class="f-ico-triangle-mb"></i></a>
                </div>

                <!-- 商品详情 -->
                <div class="view grid-nosku">

                    <div class="product" v-for="result in results">
                        <div class="product-iWrap">
                            <!--商品封面-->
                            <div class="productImg-wrap">
                                <a class="productImg">
                                    <img :src="result.imgUrl">
                                </a>
                            </div>
                            <!--价格-->
                            <p class="productPrice">
                                <em>{{result.price}}</em>
                            </p>
                            <!--标题-->
                            <p class="productTitle">
                                <a v-html="result.title"> </a>
                            </p>
                            <!-- 店铺名 -->
                            <div class="productShop">
                                <span>店铺: 狂神说Java </span>
                            </div>
                            <!-- 成交信息 -->
                            <p class="productStatus">
                                <span>月成交<em>999笔</em></span>
                                <span>评价 <a>3</a></span>
                            </p>
                        </div>
                    </div>
                </div>
            </div>
        </div>
    </div>
</div>
<script th:src="@{/js/axios.min.js}"></script>
<script th:src="@{/js/vue.min.js}"></script>
<script>
    new Vue({
        el: '#app',
        data:{
            keyword: '',
            results:[]
        },
        methods:{
            searchKey(){
                let keyword=this.keyword;
                console.log(keyword);
                ///search/{keyword}/{pageNum}/{pageSize}
                axios.get('search/'+keyword+"/1/20").then(response=>{
                    console.log(response);
                    this.results=response.data;
                });
            }
        }

    })
</script>

</body>
</html>

7.6、设置路由

@Controller
public class IndexController {

    @RequestMapping("/")
    public String index() {
        return "index.html";
    }
}
@RestController
public class ContentController {

    @Autowired
    private ContentService contentService;

    @GetMapping("/parse/{keyword}")
    public Boolean parse(@PathVariable("keyword") String keyword) throws IOException {
        return contentService.parseContent(keyword);
    }

    @GetMapping("/search/{keywords}/{pageNo}/{pageSize}")
    public List<Map<String, Object>> search(@PathVariable("keywords") String keywords, @PathVariable("pageNo") int pageNo, @PathVariable("pageSize") int pageSize) throws IOException {
        return contentService.searchPageForHighlight(keywords, pageNo, pageSize);
    }
}

7.7、设置常量

public class CommonConstant {
    public static final String INDEX = "test_jd_goods";
}

7.8、业务

/**
 * 业务编写
 */
@Service
public class ContentService {

    @Autowired
    private RestHighLevelClient restHighLevelClient;

    // 1. 解析数据放入到es索引当中
    public Boolean parseContent(String keywords) throws IOException {
        List<Content> contents = new HtmlParseUtl().parseJD(keywords);
        BulkRequest bulkRequest = new BulkRequest();
        bulkRequest.timeout("2m");

        for (int i = 0; i < contents.size(); i++) {
            bulkRequest.add(
                    new IndexRequest(CommonConstant.INDEX)
                            .source(JSON.toJSONString(contents.get(i)), XContentType.JSON));
        }

        BulkResponse bulk = restHighLevelClient.bulk(bulkRequest, RequestOptions.DEFAULT);
        return !bulk.hasFailures();
    }

    // 2. 查询这些数据实现搜索功能
    public List<Map<String, Object>> searchPage(String keywords, int pageNo, int pageSize) throws IOException {
        if (pageNo <= 1) {
            pageNo = 1;
        }
        // 条件搜索
        SearchRequest searchRequest = new SearchRequest(CommonConstant.INDEX);
        SearchSourceBuilder sourceBuilder = new SearchSourceBuilder();
        // 分页
        sourceBuilder.from(pageNo);
        sourceBuilder.size(pageSize);
        // 精准匹配
        TermQueryBuilder termQueryBuilder = QueryBuilders.termQuery("title", keywords);
        sourceBuilder.query(termQueryBuilder);
        sourceBuilder.timeout(new TimeValue(60, TimeUnit.SECONDS));
        // 执行搜索
        searchRequest.source(sourceBuilder);
        SearchResponse searchResponse = restHighLevelClient.search(searchRequest, RequestOptions.DEFAULT);
        // 解析结果
        List<Map<String, Object>> list = new ArrayList<>();
        for (SearchHit documentField : searchResponse.getHits().getHits()) {
            list.add(documentField.getSourceAsMap());
        }
        return list;
    }

    // 2. 查询这些数据实现搜索功能
    public List<Map<String, Object>> searchPageForHighlight(String keywords, int pageNo, int pageSize) throws IOException {
        if (pageNo <= 1) {
            pageNo = 1;
        }
        // 条件搜索
        SearchRequest searchRequest = new SearchRequest(CommonConstant.INDEX);
        SearchSourceBuilder sourceBuilder = new SearchSourceBuilder();
        // 分页
        sourceBuilder.from(pageNo);
        sourceBuilder.size(pageSize);
        // 精准匹配
        TermQueryBuilder termQueryBuilder = QueryBuilders.termQuery("title", keywords);
        sourceBuilder.query(termQueryBuilder);
        sourceBuilder.timeout(new TimeValue(60, TimeUnit.SECONDS));
        // 高亮
        HighlightBuilder highlightBuilder = new HighlightBuilder();
        highlightBuilder.field("title");
        highlightBuilder.requireFieldMatch(false);   // 多个高亮显示!
        highlightBuilder.preTags("<span style='color:red'>");
        highlightBuilder.postTags("</span>");
        sourceBuilder.highlighter(highlightBuilder);

        // 执行搜索
        searchRequest.source(sourceBuilder);
        SearchResponse searchResponse = restHighLevelClient.search(searchRequest, RequestOptions.DEFAULT);
        // 解析结果
        List<Map<String, Object>> list = new ArrayList<>();
        for (SearchHit documentField : searchResponse.getHits().getHits()) {
            Map<String, HighlightField> highlightFields = documentField.getHighlightFields();
            HighlightField title = highlightFields.get("title");
            Map<String, Object> sourceAsMap = documentField.getSourceAsMap();   // 原来的结果
            // 解析高亮的字段, 将原来的字段换为我们高亮的字段即可!
            if (title != null) {
                Text[] fragments = title.fragments();
                String n_title = "";
                for (Text text : fragments) {
                    n_title += text;
                }
                sourceAsMap.put("title", n_title);
            }
            list.add(sourceAsMap);
        }
        return list;
    }
}

实战提示:这里用的是 TermQueryBuilder(精确匹配),而京东标题是 text 且中文需要分词,建议改成 QueryBuilders.matchQuery("title", keywords) 才能真正搜到。这正是 5.7 中强调的 term/match 区别。

7.9、爬数据

访问:

127.0.0.1:9090/parse/java

7.10、查看es

image-20210430005003737

7.11、访问首页

成功搜索

image-20210430010056509

8、小结与进阶

  • ES 的本质是「分布式 + 倒排索引 + 近实时」,理解倒排索引与 mapping 是入门一半;
  • 中文场景一定上 ik 分词器,索引用 ik_max_word、搜索用 ik_smart;
  • 查询优先用 bool.filter + term/range,全文检索才用 match,分页避免深翻(用 search_after);
  • 改 mapping 的标准姿势:reindex + 别名切换,实现零停机;
  • Java 整合:7.x 用 RestHighLevelClient / Spring Data Repository,8.x 迁移到新的 Java API Client;
  • 生产务必关注:集群健康(yellow/red)、分片大小(单分片建议 10–50GB)、堆内存(不超过物理内存 50% 且 < 32GB)、避免用 * 误删索引。

下一步可深入:聚合分析(date_histogram、bucket 嵌套)、拼音/简繁体搜索、ELK 日志管道、冷热架构与索引生命周期管理(ILM)。

posted @ 2021-04-29 01:01  Stellan7  阅读(276)  评论(0)    收藏  举报