Elasticsearch系列---常见搜索方式与聚合分析
概要
本篇主要介绍常见的6种搜索方式、聚合分析语法,基本是上机实战,可以和关系型数据库作对比,如果之前了解关系型数据库,那本篇只需要了解搜索和聚合的语法规则就可以了。
搜索响应报文
以上篇建立的music索引为例,我们先看看搜索结果的属性都有哪些
{
"took": 1,
"timed_out": false,
"_shards": {
"total": 5,
"successful": 5,
"skipped": 0,
"failed": 0
},
"hits": {
"total": 1,
"max_score": 1,
"hits": [
{
"_index": "music",
"_type": "children",
"_id": "1",
"_score": 1,
"_source": {
"name": "gymbo",
"content": "I hava a friend who loves smile, gymbo is his name",
"length": "75"
}
}
]
}
}
主要的参数说明如下:
- took:耗费时间,单位是毫秒。
- timed_out:是否超时,true有超时,false没超时。
- _shards:数据拆成了5个分片,所以对于搜索请求,会到所有的primary shard查询,或是它的某个replica shard。
- hits.total:符合查询条件的数量,1个document。
- hits.max_score:score是符合条件的document评分的最大值。
- hits.hits.score: 这个层级的score表示当前document对search条件的相关度的匹配分数,越相关,就越匹配,分数也高。
- hits.hits:包含了匹配搜索条件的document的详细数据。
搜索方式
query string search
搜索所有数据
GET /music/children/_search
带条件搜索
GET /music/children/_search?q=name:gymbo&sort=length:asc
此搜索语法的特点是所有的条件、排序全部用http请求的query string来附带的。这种语法一般是演示或curl命令行简单查询时使用,不适用构建复杂的查询条件,生产已经很少用了。
Query DSL
DSL:Domain Specified Language特定领域语言
http request body:请求体格式,body用json构建语法,可以构建各种复杂的语法。
查询所有数据
GET /music/children/_search
{
"query":{
"match_all": {}
}
}
带条件+排序:
GET /music/children/_search
{
"query":{
"match": {
"name": "gymbo"
}
},
"sort":[{"length":"desc"}]
}
分页查询,size从0开始,下面的命令取第10条到第19条数据
GET /music/children/_search
{
"query": {
"match_all":{}
},
"from": 10,
"size": 10
}
指定要查询出来的属性
GET /music/children/_search
{
"query": {
"match_all" : {}
},
"_source": ["name","content"]
}
query filter
带多个条件过滤:歌曲名称是gymbo,并且时长在65到80秒之间的
GET /music/children/_search
{
"query":{
"bool":{
"must": [
{"match": {
"name": "gymbo"
}}
],
"filter": {"range": {
"length": {
"gte": 65,
"lte": 80
}
}}
}
}
}
全文检索
GET /music/children/_search
{
"query":{
"match": {
"content":"friend smile"
}
}
}
搜索的结果是按相关度分数来排序的,搜索条件中的content field,在新增document时已经建立倒排索引,然后按匹配度最高的来排序,全文索引的原理。
短语检索
GET /music/children/_search
{
"query":{
"match_phrase": {
"content":"friend smile"
}
}
}
全文检索match会拆词,大小写不敏感,然后去倒排索引里去匹配,phrase search不分词,大小写敏感,要求搜索串完全一样才匹配。
高亮检索
GET /music/children/_search
{
"query":{
"match_phrase":{
"content":"friend smile"
}
},
"highlight": {
"fields": {
"content":{}
}
}
}
匹配的关键词会高亮显示,高亮的内容用标签达到标记效果。
聚合分析
聚合分析类似于关系型数据的分组统计,并且用的语法名称很多都与mysql类似,在这里,能看到很多熟悉的方法。
单field分组统计
需求:统计每种语言下的歌曲数量。
size为0表示不显示符合条件的document记录,只显示统计信息,不写的话默认值是10
GET /music/children/_search
{
"size": 0,
"aggs": {
"group_by_lang": {
"terms": {
"field": "language"
}
}
}
}
响应结果:
{
"took": 3,
"timed_out": false,
"_shards": {
"total": 5,
"successful": 5,
"skipped": 0,
"failed": 0
},
"hits": {
"total": 1,
"max_score": 0,
"hits": []
},
"aggregations": {
"group_by_lang": {
"doc_count_error_upper_bound": 0,
"sum_other_doc_count": 0,
"buckets": [
{
"key": "english",
"doc_count": 1
}
]
}
}
}
如果聚合查询时出现如下错误提示:
"root_cause": [
{
"type": "illegal_argument_exception",
"reason": "Fielddata is disabled on text fields by default. Set fielddata=true on [language] in order to load fielddata in memory by uninverting the inverted index. Note that this can however use significant memory. Alternatively use a keyword field instead."
}
]
需要将用于分组的字段的fielddata属性设置为true
PUT /music/_mapping/children
{
"properties": {
"language": {
"type": "text",
"fielddata": true
}
}
}
带查询条件的分组统计
需求:对歌词中出现"friend"的歌曲,计算每个语种下的歌曲数量
GET /music/children/_search
{
"size": 0,
"query": {
"match": {
"content": "friend"
}
},
"aggs": {
"all_languages": {
"terms": {
"field": "language"
}
}
}
}
求平均值
需求:计算每个语种下的歌曲,平均时长是多少
GET /music/children/_search
{
"size": 0,
"aggs": {
"group_by_languages": {
"terms": {
"field": "language"
},
"aggs": {
"avg_length": {
"avg": {
"field": "length"
}
}
}
}
}
}
分组后排序
需求:计算每个语种下的歌曲,平均时长是多少,并按平均时长降序排序
GET /music/children/_search
{
"size": 0,
"aggs": {
"group_by_languages": {
"terms": {
"field": "language",
"order": {
"avg_length": "desc"
}
},
"aggs": {
"avg_length": {
"avg": {
"field": "length"
}
}
}
}
}
}
嵌套查询,区间分组+分组统计+平均值
需求:按照指定的时长范围区间进行分组,然后在每组内再按照语种进行分组,最后再计算时长的平均值
GET /music/children/_search
{
"size": 0,
"aggs": {
"group_by_price": {
"range": {
"field": "length",
"ranges": [
{
"from": 0,
"to": 60
},
{
"from": 60,
"to": 120
},
{
"from": 120,
"to": 180
}
]
},
"aggs": {
"group_by_languages": {
"terms": {
"field": "language"
},
"aggs": {
"average_length": {
"avg": {
"field": "length"
}
}
}
}
}
}
}
}
批量查询
上面的示例请求,都是单个单个发的,Elasticsearch还有一种语法,可以合并多个请求进行批量查询,这样可以减少每个请求单独的网络开销,最基础的语法示例如下:
GET /_mget
{
"docs": [
{
"_index" : "music",
"_type" : "children",
"_id" : 1
},
{
"_index" : "music",
"_type" : "children",
"_id" : 2
}
]
}
mget下面的docs参数是一个数组,数组里面每个元素都可以定义一个文档的_index、_type和_id元数据,_index可相同也可不相同,也可以定义_source元数据指定想要的field。
响应的示例:
{
"docs": [
{
"_index": "music",
"_type": "children",
"_id": "1",
"_version": 4,
"found": true,
"_source": {
"name": "gymbo",
"content": "I hava a friend who loves smile, gymbo is his name",
"language": "english",
"length": "75",
"likes": 0
}
},
{
"_index": "music",
"_type": "children",
"_id": "2",
"_version": 13,
"found": true,
"_source": {
"name": "wake me, shark me",
"content": "don't let me sleep too late, gonna get up brightly early in the morning",
"language": "english",
"length": "55",
"likes": 9
}
}
]
}
响应同样是一个docs数组,数组长度与请求时保持一致,如果有文档不存在、未搜索到或者别的原因导致报错,不影响整体的结果,mget的http响应码仍然是200,每个文档的搜索都是独立的。
如果批量查询的文档是在同一个index下面,可以将_index元数据(_type元数据我也顺便移走)移到请求行中:
GET /music/children/_mget
{
"docs": [
{
"_id" : 1
},
{
"_id" : 2
}
]
}
或者是直接使用更简单的ids数组:
GET /music/children/_mget
{
"ids":[1,2]
}
查询结果是一样的。
mget的重要性
mget是非常重要的,在进行查询的时候,如果一次性要查询多条数据,那么一定要用batch批量操作的api,尽可能减少网络开销次数,可能可以将性能提升数倍,甚至数十倍。
小结
本篇介绍了最常用的搜索、批量查询和聚合场景的写法,包含分组统计,平均值,排序,区间分组。这是最基本的套路,基本包含了我们常见的需求,熟悉mysql的话,掌握起来非常快,熟悉一下Restful的语法,基本就OK了。
专注Java高并发、分布式架构,更多技术干货分享与心得,请关注公众号:Java架构社区
Elasticsearch系列---常见搜索方式与聚合分析的更多相关文章
- ES系列十四、ES聚合分析(聚合分析简介、指标聚合、桶聚合)
一.聚合分析简介 1. ES聚合分析是什么? 聚合分析是数据库中重要的功能特性,完成对一个查询的数据集中数据的聚合计算,如:找出某字段(或计算表达式的结果)的最大值.最小值,计算和.平均值等.ES作为 ...
- Elasticsearch学习笔记(三)聚合分析Agg
一.设置fielddata PUT /index/_mapping/type { "properties":{ "fieldName" ...
- Elasticsearch系列---初识搜索
概要 本篇主要介绍搜索的报文结构含义.搜索超时时间的处理过程,提及了一下多索引搜索和轻量搜索,最后将精确搜索与全文搜索做了简单的对比. 空搜索 搜索API最简单的形式是不指定索引和类型的空搜索,它将返 ...
- Elasticsearch系列---实战搜索语法
概要 本篇介绍Query DSL的语法案例,查询语句的调试,以及排序的相关内容. 基本语法 空查询 最简单的搜索命令,不指定索引和类型的空搜索,它将返回集群下所有索引的所有文档(默认显示10条): G ...
- ElasticSearch 简单的 搜索 聚合 分析
一. 搜索1.DSL搜索 全部数据没有任何条件 GET /shop/goods/_search { "query": { "match_all": {} } } ...
- elasticsearch系列六:聚合分析(聚合分析简介、指标聚合、桶聚合)
一.聚合分析简介 1. ES聚合分析是什么? 聚合分析是数据库中重要的功能特性,完成对一个查询的数据集中数据的聚合计算,如:找出某字段(或计算表达式的结果)的最大值.最小值,计算和.平均值等.ES作为 ...
- Elasticsearch 之聚合分析入门
本文主要介绍 Elasticsearch 的聚合功能,介绍什么是 Bucket 和 Metric 聚合,以及如何实现嵌套的聚合. 首先来看下聚合(Aggregation): 什么是 Aggregati ...
- elasticsearch系列四:搜索详解(搜索API、Query DSL)
一.搜索API 1. 搜索API 端点地址 从索引tweet里面搜索字段user为kimchy的记录 GET /twitter/_search?q=user:kimchy 从索引tweet,user里 ...
- Elasticsearch 6.x版本全文检索学习之聚合分析入门
1.什么是聚合分析? 答:聚合分析,英文为Aggregation,是es除搜索功能外提供的针对es数据做统计分析的功能.特点如下所示: a.功能丰富,提供Bucket.Metric.Pipeline等 ...
随机推荐
- Spring整合Mybatis(IDEA版)
本文适用于初学者: 该文主要教大家如何整合spring和mybatis,整合完成效果,可以从数据库中查询出学生信息: 完整的工程目录如下: 整合思路: 需要spring来管理数据源信息. 需要spri ...
- Vulnhub靶场渗透练习(三) bulldog
拿到靶场后先对ip进行扫描 获取ip 和端口 针对项目路径爆破 获取两个有用文件 http://192.168.18.144/dev/ dev,admin 更具dev 发现他们用到框架和语言 找到一 ...
- unittest-A接口的返回结果作为B接口的入参(设置全局变量)
在A接口用例中设置全局变量: globals()["a"] = "用例A的返回结果" 在B接口用例中使用全局变量: b = globals()["a& ...
- 【笔记】关于N-Way K-Shot 分类问题的理解
Time: 2019年10月27日 Author:Veagau 在看讲Repitle的论文[On First-Order Meta-Learning Algorithm]时,实验环节对N-Way K- ...
- 零基础教程!一文教你使用Rancher 2.3和Terraform运行Windows容器
本文来自Rancher Labs 介 绍 在Kubernetes 1.14版本中已经GA了对Windows的支持.这一结果凝结了一群优秀的工程师的努力,他们来自微软.Pivotal.VMware.红帽 ...
- 关于M23内核简介 - 待续
1.定位 M23是基于最新的ARMv8-M构架的主要关注低功耗应用的微控制器,未来会是M0.M0+的替代品. M33是基于最新的ARMv8-M构架的主要关注高能效应用的微控制器,未来会替换M3.M4. ...
- C# WPF基础巩固
时间如流水,只能流去不流回. 学历代表你的过去,能力代表你的现在,学习能力代表你的将来. 学无止境,精益求精. 一.写作目的 做C# WPF开发,无论是工作中即将使用,还是只应付跳槽面试,开发基础是非 ...
- iOS开发高级分享 - Unread的下拉式选单
解构革命的演变 背景 2013年中期,RSS世界遭受了沉重打击.谷歌宣布,他们(*的*)RSS订阅服务,[谷歌阅读器],是被关闭了.有了它,数以百万计的声音突然惊恐地大叫,并突然保持沉默. 使用量下降 ...
- JAVA nio 简单使用
nio 模拟客户端和服务器互相通讯--传输一个int值,并且不断的+1: 服务器,单线程 public class Server { public static void main(String[] ...
- vue与element ui的el-checkbox的坑
一,场景 通过使用checkbox,实现如图的场景, 点击某个tag,实现选中和非选中状态. 二, 官网的例子 通过切换checked值为true或者false来实现,一个checkbox的状态切换 ...