Elasticsearch在db_ranking 的排名又（双叒叕）上升了一位,如图1-1所示;由此可见es在存储领域已经蔚然成风且占有非常重要的地位。

随着Elasticsearch越来越受欢迎，企业花费在ES建设上的成本自然也不少。那如何减少ES的成本呢？今天我们就特地来聊聊ES降本增效的常见方法：

弹性伸缩
分级存储
其他：（1）数据压缩（2）off heap

图 1-1 Elasticsearch db_ranking

1 弹性伸缩

所谓弹性伸缩翻译成大白话就是随时快速瘦身与增肥，并且是头痛医头，按需动态调整资源。当计算能力不足的时候我们可以快速扩充出计算资源，业届比较有代表性的两个ES相关产品阿里云Indexing Service 和滴滴的ES-Fastloader；

当存储资源不足时，能够快速扩容磁盘，业届比较代表性es产品:阿里云的ES日志增强版。

1-1 计算存储分离

ES使用计算存储分离架构之后，解决了资源预留而造成资源浪费的问题。在早期大家认为的计算存储分离的实现方式为：使用云盘代替本地盘，这种实现方式可以提高数据的可靠性、可以快速弹扩磁盘资源和计算资源，但是es自身弹性需求是无法解决，即秒级shard搬迁和replica扩容。

那么如何解决es自身的弹性呢？本文该部分将给出答案。

共享存储版ES

本文该部分将介绍我们京东云-中间件搜索团队，研发的共享存储版本ES；计算存储分离架构如图1-2所示

图 1-2 计算存储分离架构(共享)

如图1-2所示，我们只存储一份数据，primary shard负责读写，replica只负责读；当我们需要扩容replica的时候无需进行数据搬迁,直接跳过原生es的peer recover两阶段，秒级完成replica的弹扩。

当主分片发生relocating时,可以直接跳过原生es的peer recover第一阶段(该阶段最为耗时)，同时也不需要原生es的第二阶段发送translog。

共享版本的计算存储分离ES，相对于原生的ES和普通版本的计算存储分离，具有如下突出的优势：

数据只保存一份，存储成本倍数级降低
存储容量按需自动拓展，几乎无空间浪费
按实际用量计费，无需容量规划

性能测试

数据集为esrally提供的http_logs
共享版ES7.10.2: 3个data节点(16C64GB)
原生ES7.10.2: 3个data节点(16C64GB)

表 1-1 副本性能测试对比

我们的初步性能测试结果如表1-1所示；副本数越多，共享版本的es越具有优势;

从表1-1所示我们可以看出性能似乎提升的不是特别理想，目前我们正从两个方面进行优化提升：

底层依赖的云海存储，目前正在有计划地进行着性能提升
源码侧，我们也在正在优化ing

在研发es计算存储分离的过程中，我们攻克了很多的问题,后续将输出更加详细的文章进行介绍，比如：主写副只读的具体实现，replica的访问近实时问题，ES的主分片切换脏写问题等等。目前共享版本的ES正在内部进行公测，欢迎在云搜平台进行试用。

1-2 外部构建Segment

对于有大量写入的场景，通常不会持续的高流量写入，而只有1-2个小时写入流量洪峰；在写入过程中最耗费时间的过程并不是写磁盘而是构建segment,既然构建segment如此耗时，那么我们是否可以将该部分功能单独出来，形成一个可快速扩展的资源（避免去直接改动es源码而引入其他问题）。

目前业界已经有比较好的案例如阿里云的Indexing Service 和滴滴开源的 ES-Fastloader 外部构建Segment，相对于共享存储版的es实现起来更简单；它的核心解决方案使用了spark或者map reduce这种批处理引擎进行批量计算处理，然后将构建好的segment搬运到对应的索引shard即可。它的详细实现,我这里就不做搬运工了，大家感兴趣可以参考滴滴发布的文章《滴滴离线索引快速构建FastIndex架构实践》

外部构建segment的功能也在我们的规划中。

2 分级存储

ES实现降本增效的另外一个方向：分级存储，该解决方案主要是针对数据量大查询少且对查询耗时不太敏感的业务。分级存储，比较成熟的解决方案有es冷热架构和可搜索快照。

2-1 冷热架构

冷热架构适用场景：时序型数据或者同一集群中同时存在这两个索引（一个热数据，另外一个冷数据）

es冷热架构架构，该功能已经在京东云上线有一段时间了，欢迎大家根据自己的业务形态进行试用，冷数据节点开启如图2-1所示

图 2-1 冷数据节点开启

建议如果索引表是按天/小时，这种周期存储的数据，且数据查询具有冷热性，建议开启冷节点；开启冷节点后你可能会获得如下的收益：

开启冷节点后可以降低你的存储成本，因为存放冷节点的索引我们可以选择减少副本数、冷节点的存储介质更便宜
集群可以存放更多的数据
冷数据forcemerge,提升冷数据的查询性能
冷数据从热节点迁移走之后，减少热节点的资源占用，从而使热查询更快

冷热架构的核心技术为

shard-allocation-filtering;

冷热架构实现原理：

es的hot节点增加如下配置

node.attr.box_type: hot

es的warm节点增加如下配置

node.attr.box_type: warm

热数据索引setting增加如下配置，即可限制shard分配在hot节点

"index.routing.allocation.require.box_type": "hot"

当数据查询减弱，我们通过如下配置，即可使数据由hot节点迁移到warm节点

"index.routing.allocation.require.box_type": "warm"

2-2 可搜索快照

可搜索快照是在冷热架构的基础上更进一步的分级存储，在之前我们将数据快照之后是无法对快照的数据进行搜索，如果要对快照的数据进行搜索，则需将快照数据先restore（restore的过程可能会比较长）之后才能被搜索。

在引入可搜索快照之后，我们可以直接搜索快照中的数据，大大降低了没必要的资源使用.

3 其他

3-1 数据压缩

除了从资源的角度进行降低存储成本之外，基于数据自身的特性，使用优秀的压缩算法也是一种必不可少的搜索；针对时序数据facebook开源了一个非常优秀的压缩算法zstd，

目前已经在业界被大量使用，国内的两大云友商已经在es进行了实现，腾讯云针对zstd的测试结果如表3-1所示;阿里云在TimeStream功能中使用了zstd。

表 3-1 三种压缩算法的对比测试结果

目前在lucene的代码库中也有开源爱好者提交了custom codec providing Zstandard compression/decompression （zstd pr）

3-2 off heap

es单个节点存储数据量受到jvm堆内存的限制，为了使单个节点能够存储更多的数据，因此我们需要减少堆内存中的数据。

ES 堆中常驻内存中占据比重最大是 FST，即 tip(terms index) 文件占据的空间，1TB 索引大约占用2GB 或者更多的内存，因此为了节点稳定运行，业界通常认为一个节点 open 的索引不超过5TB。现在，从 ES 7.3版本开始，将 tip 文件修改为通过mmap的方式加载，这使 FST占据的内存从堆内转移到了堆外(即off Heap技术 )由操作系统的 pagecache 管理[6]。

使用esrally官方数据集geonames写入索引1TB,使用 _cat/segments API 查看 segments.memory内存占用量，对比 offheap 后的内存占用效果,如表3-2所示;JVM 内存占用量降低了78%左右

表 3-2 segments.memory内存占用量

4 参考

[1] Indexing Service

[2] ES-Fastloader

[3] 大规模测试新的 Elasticsearch 冷层可搜索快照

[4] Introducing Elasticsearch searchable snapshots

[5] 7.7 版本中的新改进：显著降低 Elasticsearch 堆内存使用量

[6] Elasticsearch 7.3 的 offheap 原理

作者：杨松柏

京东云开发者｜ElasticSearch降本增效常见的方法的更多相关文章

京东云开发者｜京东云RDS数据迁移常见场景攻略
云时代已经来临,云上很多场景下都需要数据的迁移.备份和流转,各大云厂商也大都提供了自己的迁移工具.本文主要介绍京东云数据库为解决用户数据迁移的常见场景所提供的解决方案. 场景一:数据迁移上云数据迁移 ...
京东云开发者｜经典同态加密算法Paillier解读 - 原理、实现和应用
摘要随着云计算和人工智能的兴起,如何安全有效地利用数据,对持有大量数字资产的企业来说至关重要.同态加密,是解决云计算和分布式机器学习中数据安全问题的关键技术,也是隐私计算中,横跨多方安全计算,联邦学 ...
京东云开发者｜关于“React 和 Vue 该用哪个”我真的栓Q
一.前言:我全都要面对当今前端界两座大山一样的主流框架,React和Vue,相信很多小伙伴都或多或少都产生过这样疑问,而这样的问题也往往很让人头疼和犹豫不决: 业务场景中是不是团队用什么我就用什么? ...
京东云开发者｜软件架构可视化及C4模型：架构设计不仅仅是UML
软件系统架构设计的目标不在于设计本身,而在于架构设计意图的传达.图形化有助于在团队间进行高效的信息同步,但不同的图形化方式需要语义一致性和效率间实现平衡.C4模型通过不同的抽象层级来表达系统的静态结构 ...
京东云开发者| Redis数据结构(二)-List、Hash、Set及Sorted Set的结构实现
1 引言之前介绍了Redis的数据存储及String类型的实现,接下来再来看下List.Hash.Set及Sorted Set的数据结构的实现. 2 List List类型通常被用作异步消息队列.文 ...
京东云开发者｜IoT运维 - 如何部署一套高可用K8S集群
环境准备工作配置ansible(deploy 主机执行) # ssh-keygen # for i in 192.168.3.{21..28}; do ssh-copy-id -i ~/.ssh/ ...
京东云开发者｜mysql基于binlake同步ES积压解决方案
1 背景与目标 1.1 背景国际财务泰国每月月初账单任务生成,或者重算账单数据,数据同步方案为mysql通过binlake同步ES数据,在同步过程中发现计费事件表,计费结果表均有延迟,ES数据与My ...
ElasticSearch集成SpringBoot与常见使用方法
目录一.导包二.核对导入的ES版本修改导入版本三.写配置类四.开始测试索引操作 1.创建索引 2.查看索引是否存在 3.删除索引文档操作 1.添加文档 2.查看文档是否存在 3.修改文档 ...
干货 | SSMS客户端连接京东云RDS SQL Server配置方法
干货 | SSMS客户端连接京东云RDS SQL Server配置方法原创: 于振江京东云开发者社区微软SQL Server, Oracle数据库以及MySQL系列占据了关系型数据库市场的绝对 ...

随机推荐

nmtui 字符界面图形模式配置
一.通过nmtui配置网络参数 Linux系统配置网络参数的方式有很多种,其中最简单最直接的方式就是直接修改网卡配置文件,但这种方式也很容易出错,比如说IPADDR.NETMASK.GATEWAY等参 ...
记录Java类型推断关键字var的一种特殊用法
关于Java的var类型推断,有一种特殊用法,如下: 没有var类型之前声明一个匿名类对象,并调用它的方法. Object obj = new Object() { public void test( ...
PI控制器的由来
20世纪20年代初,一位名叫尼古拉斯·米诺斯基(Nicolas Minorsky)的俄裔美国工程师通过观察舵手在不同条件下如何驾驶船只,为美国海军设计了自动转向系统. 根据Wikipedia.org, ...
【java】学习路径21-基本类型的包装类
int i =100; //Integer i2 = new Integer(100); //我们发现已被弃用,现在我们一般的方法是使用valueOf Integer i2 = null; i2 = ...
【java】学习路线9-非静态内部类、外部类
//内部类只能在其外部类当中使用//局部内部类:定义在方法里面//如果内部类和外部类有重名,就近原则在内部类中优先访问内部类.//如果想访问宿主类的同名成员,使用OuterClass.this.xxx ...
痞子衡嵌入式：在i.MXRT启动头FDCB里使能串行NOR Flash的QPI/OPI模式
大家好,我是痞子衡,是正经搞技术的痞子.今天痞子衡给大家介绍的是在FDCB里使能串行NOR Flash的QPI/OPI模式. 我们知道 Flash 读时序里有五大子序列 CMD + ADDR + MO ...
第九十二篇：Vue 自定义指令
好家伙, 1.什么是自定义指令? vue官方提供了v-text,v-for,v-model,v-if等常用的指令.除此之外vue还允许开发者自定义指令. 2.自定义指令的分类 vue中的自定义指令分为 ...
第九十篇：Vue 具名插槽
好家伙 1.什么是具名插槽? 来简单理解一下, 具有自己名字的插槽,就是具名插槽我们来尝试使用一下具名插槽: 在Article.vue组件中: <template> <div cl ...
第三十五篇:vue3,(组合式api的初步理解)
好家伙, 来一波核心概念:数据劫持是响应式的核心 1.由set up开始 (1)vue3中的一个新的配置项,值为一个函数. (2)组件中所用的到的:数据,方法,计算属性均要配置在set up中. (3 ...
Linux做bond4
一.编辑bond网络配置 vim /etc/sysconfig/network-scripts/ifcfg-bond4 DEVICE=bond4 NAME=bond4 TYPE=Bond ONBOOT ...

京东云开发者｜ElasticSearch降本增效常见的方法