ElasticSearch 的基础概念与入门使用
ElasticSearch 的基础概念与入门使用
如果想要更好的阅读体验请移步 [CSDN](ElasticSearch 的基础概念与入门使用-CSDN博客)
前言
elasticsearch 是一款非常强大的开源搜索引擎,具备非常多强大的功能,可以帮助我们从海量的数据中快速找到需要的内容。
例如:
- 在 Github 中搜索代码
- 在电商网站搜索商品
- 在 Google 搜索答案
- ……
elasticsearch结合kibana、Logstash、Beats,也就是elastic stack(ELK)。被广泛应用在日志数据分析、实时监控等领域,而elasticsearch是elastic stack的核心,负责存储、搜索、分析数据。
elasticsearch底层是基于lucene来实现的。
Lucene是一个Java语言的搜索引擎类库,是Apache公司的顶级项目,由DougCutting于1999年研发。官网地址:https://lucene.apache.org/ 。
基础概念
文档
elasticsearch 是面向 文档 存储的,可以是数据库中的一条商品数据,一个订单信息。文档数据会被序列化成 json 格式后存储在 elasticsearch 中,而 json 文档中往往包含很多的字段(Field),类似于数据库中的列。
分词器
作用:
- 创建倒排索引时对文档分词
- 用户搜索时,对输入的内容分词
索引与映射
索引(Index) ,就是相同类型的文档的集合。
例如:
- 所有用户文档,就可以组织在一起,称为用户的索引;
- 所用商品的文档,可以组织在一起,称为商品的索引;
- 所有订单的文档,可以组织在一起,称为订单的索引;
因此,我们可以把索引当作是数据库中的表。
数据库的表会有约束信息,用来定义表的结构、字段的名称、类型等信息。因此,索引库中就有映射(mapping),是索引中文档的字段约束信息,类似表的结构约束。
mysql 与 elasticsearch 一些概念的对比
| MySQL | Elasticsearch | 说明 |
| --------- | ----------------- | ------------------------------------------------------------ |
| Table | Index | 索引(index),就是文档的集合,类似数据库的表(table) |
| Row | Document | 文档(Document),就是一条条的数据,类似数据库中的行(Row),文档都是JSON格式 |
| Column | Field | 字段(Field),就是JSON文档中的字段,类似数据库中的列(Column) |
| Schema | Mapping | Mapping(映射)是索引中文档的约束,例如字段类型约束。类似数据库的表结构(Schema) |
| SQL | DSL | DSL是elasticsearch提供的JSON风格的请求语句,用来操作elasticsearch,实现CRUD |
是不是说,我们学习了elasticsearch就不再需要mysql了呢?
并不是如此,两者各自有自己的擅长支出:
- Mysql:擅长事务类型操作,可以确保数据的安全和一致性
- Elasticsearch:擅长海量数据的搜索、分析、计算
因此在企业中,往往是两者结合使用:
- 对安全性要求较高的写操作,使用mysql实现
- 对查询性能要求较高的搜索需求,使用elasticsearch实现
- 两者再基于某种方式,实现数据的同步,保证一致性
安装
关于安装的话,这里提供 Windows 版本,一个是elasticsearch、一个是 kibana (一个工具)。
安装中文分词器
elasticsearch 对中文的分词不是很友好,一般的分词不管你选择的是标准分词器,还是中文分词器,结果都是只能分成一个一个的字,非常不友好。所以我们选择一个开源的分词器。下载地址](https://github.com/medcl/elasticsearch-analysis-ik)) 你只需要把内容下载好,把这个目录解压放到安装 elasticsearch 的文件夹中的 plugins 目录中。例如:
放好以后,直接重启 elasticsearch 就好。
如果出现报错说分词器版本不兼容 elasticsearch 只要进入下载好的分词器目录下面的 plugin-descriptor.properties 文件中八版本改成和你的 elasticsearch 版本一致就好了。
使用
了解了上面的一些信息以后,我们接下来就开始使用 elasticsearch 吧。
索引的增删改查
索引库就类似数据库表,mapping映射就类似表的结构。
我们要向es中存储数据,必须先创建“库”和“表”。
mapping 映射属性
mapping是对索引库中文档的约束,常见的mapping属性包括:
- type:字段数据类型,常见的简单类型有:
- 字符串:text(可分词的文本)、keyword(精确值,例如:品牌、国家、ip地址)
- 数值:long、integer、short、byte、double、float、
- 布尔:boolean
- 日期:date
- 对象:object
- index:是否创建索引,默认为true
- analyzer:使用哪种分词器
- properties:该字段的子字段
例如:
对应的每个字段映射(mapping):
- age:类型为 integer;参与搜索,因此需要index为true;无需分词器
- weight:类型为float;参与搜索,因此需要index为true;无需分词器
- isMarried:类型为boolean;参与搜索,因此需要index为true;无需分词器
- info:类型为字符串,需要分词,因此是text;参与搜索,因此需要index为true;分词器可以用ik_smart
- email:类型为字符串,但是不需要分词,因此是keyword;不参与搜索,因此需要index为false;无需分词器
- score:虽然是数组,但是我们只看元素的类型,类型为float;参与搜索,因此需要index为true;无需分词器
- name:类型为object,需要定义多个子属性
- name.firstName;类型为字符串,但是不需要分词,因此是keyword;参与搜索,因此需要index为true;无需分词器
- name.lastName;类型为字符串,但是不需要分词,因此是keyword;参与搜索,因此需要index为true;无需分词器
创建索引库和映射
基本语法:
- 请求方式: PUT
- 请求路径:/{索引库名}, 可以自定义
- 请求参数:mapping 映射
格式:
示例(以上面的数据为例,我们所有的操作都在 Kibana 的中 dev tools 中完成)
结果展示:
查询索引库
基本语法:
- 请求方式:GET
- 请求路径:/索引库名
- 请求参数:无
格式:
示例(上面创建的索引库):
结果展示:
修改索引库
倒排索引结构虽然不复杂,但是一旦数据结构改变(比如改变了分词器),就需要重新创建倒排索引,这简直是灾难。因此索引库一旦创建,无法修改mapping。
虽然无法修改mapping中已有的字段,但是却允许添加新的字段到mapping中,因为不会对倒排索引产生影响。
基本语法:
- 请求方法:PUT
- 请求方法:PUT库名/_mapping
- 请求参数:properties (看下面的例子)
格式:
示例:
为上面创建的索引添加一个 major 字段(Field)
添加结果:
![在在这里插入图片描述
我们重新查看索引看是否有添加字段:
从结果来看我们是成功了的。
删除索引库
基本语法:
- 请求方式:DELETE
- 请求路径:/索引库名
- 请求参数: 无
格式:
例子:
我们删除我们上面传创建的索引库,然后再去查询,看是否能够查询的到
结果:
很明显我们查询不到了。
#档的增删改查
新增文档
基本语法:
- 请求方式:POST
请求路径:/索引库名/_doc/文档id 注意这里的文档 id,如果不填,elasticsearch系统会自动帮你添加一个随机的 id 值 - 请求参数:一条以 json 为格式的数据采用键值对方式
格式:
例子:
我们再把上面删除的索引重新创建一下,把最开始的那条数据插入试试
这里可能会有一个疑问:就什么我明明定义 score 的时候只是一个 float 类型,为什么在插入文档的时候就能插入一个数组呢?这是由 elasticsearch 决定的,因为elasticsearch 没有数组这个数据类型,所以就允许接受一个字段的多个值。
结果:
查询文档
基本语法:
- 请求方式:GET
- 请求路径:/索引库名/_doc/文档id
- -请求参数:无
格式:
示例:
结果:
删除文档
基本语法:
- 请求方式:DELETE
- 请求路径:/索引库名/_doc/文档id
- 请求参数:无
格式:
示例
结果参考
修改文档
修改有两种方式:
- 全量修改:直接覆盖原来的文档
- 增量修改:修改文档中的部分字段
全量修改
全量修改是覆盖原来的文档,其本质是:
- 根据指定的id删除文档
- 新增一个相同id的文档
注意:如果根据id删除时,id不存在,第二步的新增也会执行,也就从修改变成了新增操作了。
基本语法:
- 请求方式:PUT
- 请求路径:/索引库名/_doc/文档id
- 请求参数:把所有文档信息要修改的进行修改,并且没有修改的也需要
格式:
示例:
我们改变一下上面文档的邮箱
结果:
增量修改
增量修改是只修改指定id匹配的文档中的部分字段。
基本语法:
- 请求方式:POST
- 请求路径:/索引库名/_update/文档id
- 请求参数:doc 内容是要修改的字段,以及新的值
基本格式:
示例(我们再把邮箱改回来):
其中的 version 表示修改次数,创建一次,上面一次全量修改一次,增量修改一次,所以是三次。
利用 RestAPI 在 Java 中使用 ElasticSearch
这里暂不介绍如何使用,具体使用其实看一下官方文档,或者直接按照代码提示就可以做了,我们现在只要知道ElasticSearch原生的用法,再去用 Client 就很容易上手、理解。我们这里只稍微带一下在 Java 项目中如何引入。
三步:
- 引入依赖
```xml
<dependency>
<groupId>org.elasticsearch.client</groupId>
<artifactId>elasticsearch-rest-high-level-client</artifactId>
</dependency>
```
- 因为 springboot 可能管理了 elasticsearch的版本,所以我们需要把这个版本依赖覆盖掉,并且改成我们自己 elasticsearch的版本
```xml
<properties>
<java.version>1.8</java.version>
<elasticsearch.version>7.12.1</elasticsearch.version>
</properties>
```
- 初始化 RestHighLevelClient
```java
RestHighLevelClient client = new RestHighLevelClient(RestClient.builder(
HttpHost.create("http://192.168.150.101:9200")
));
```
TIPS
Elasticsearch 中特殊的数据类型ES中支持两种地理坐标数据类型:
- geo_point: 由纬度(latitude)和经度(longitude)确定的一个点。例如:"32.8752345,120.2981576"
- ge0_shape :有多个ge0_point组成的复杂几何图形。例如一条直线,"LINESTRING(-77.0365338.897676,-77.00905138.889939)"
字段拷贝可以使用copy to属性将当前字段拷贝到指定字段。示例:
GET /indexName/_search
{
"query": {
"查询类型": {
"查询条件": "条件值"
}
}
}
GET /hotel/_search
{
"query": {
"match_all": {
}
}
}
GET /索引库名/_search
{
"query": {
"match": {
"FIELD": "TEXT"
}
}
}
GET /indexName/_search
{
"query": {
"multi_match": {
"query": "TEXT",
"fields": ["FIELD1", " FIELD12"]
}
}
}
GET /hotel/_search
{
"query": {
"match": {
"all": "希尔顿"
}
}
}
GET /hotel/_search
{
"query": {
"multi_match": {
"query": "如家",
"fields": ["brand","name"]
}
}
}
// term查询
GET /indexName/_search
{
"query": {
"term": {
"FIELD": {
"value": "VALUE"
}
}
}
}
GET /hotel/_search
{
"query": {
"term": {
"city": {
"value": "上海"
}
}
}
}
// range查询
GET /indexName/_search
{
"query": {
"range": {
"FIELD": {
"gte": 10, // 这里的gte代表大于等于,gt则代表大于
"lte": 20 // lte代表小于等于,lt则代表小于
}
}
}
}
GET /hotel/_search
{
"query": {
"range": {
"score": {
"gte": 40,
"lte": 3000
}
}
}
}
// geo_bounding_box查询
GET /indexName/_search
{
"query": {
"geo_bounding_box": {
"FIELD": {
"top_left": { // 左上点
"lat": 31.1,
"lon": 121.5
},
"bottom_right": { // 右下点
"lat": 30.9,
"lon": 121.7
}
}
}
}
}
// geo_distance 查询
GET /indexName/_search
{
"query": {
"geo_distance": {
"distance": "15km", // 半径
"FIELD": "31.21,121.5" // 圆心
}
}
}
GET /hotel/_search
{
"query": {
"geo_distance": {
"distance" : "15km",
"location" : "31.21,121.5"
}
}
}
[
{
"_score" : 17.850193,
"_source" : {
"name" : "虹桥如家酒店真不错",
}
},
{
"_score" : 12.259849,
"_source" : {
"name" : "外滩如家酒店真不错",
}
},
{
"_score" : 11.91091,
"_source" : {
"name" : "迪士尼如家酒店真不错",
}
}
]
GET /hotel/_search
{
"query": {
"function_score": {
"query": {
"match": {
"all": "外滩"
}
},
"functions": [
{
"filter": {
"term": {
"brand": "如家"
}
},
"weight": 100
}
],
"boost_mode": "sum"
}
}
}
GET /hotel/_search
{
"query": {
"bool": {
"must": [
{"term": {"city": "上海" }}
],
"should": [
{"term": {"brand": "皇冠假日" }},
{"term": {"brand": "华美达" }}
],
"must_not": [
{ "range": { "price": { "lte": 500 } }}
],
"filter": [
{ "range": {"score": { "gte": 45 } }}
]
}
}
}
GET /indexName/_search
{
"query": {
"match_all": {}
},
"sort": [
{
"_geo_distance" : {
"FIELD" : "纬度,经度", // 文档中geo_point类型的字段名、目标坐标点
"order" : "asc", // 排序方式
"unit" : "km" // 排序的距离单位
}
}
]
}
GET /hotel/_search
{
"query": {
"match_all": {}
},
"from": 0, // 分页开始的位置,默认为0
"size": 10, // 期望获取的文档总数
"sort": [
{"price": "asc"}
]
}
GET /hotel/_search
{
"query": {
"match_all": {}
},
"from": 990, // 分页开始的位置,默认为0
"size": 10, // 期望获取的文档总数
"sort": [
{"price": "asc"}
]
}
GET /hotel/_search
{
"query": {
"match": {
"FIELD": "TEXT" // 查询条件,高亮一定要使用全文检索查询
}
},
"highlight": {
"fields": { // 指定要高亮的字段
"FIELD": {
"pre_tags": "<em>", // 用来标记高亮字段的前置标签
"post_tags": "</em>" // 用来标记高亮字段的后置标签
}
}
}
}
```
**注意:**
- 高亮是对关键字高亮,因此**搜索条件必须带有关键字**,而不能是范围这样的查询。
- 默认情况下,**高亮的字段,必须与搜索指定的字段一致**,否则无法高亮
- 如果要对非搜索字段高亮,则需要添加一个属性:required_field_match=false
