1 概念

LSM = Log Structured Merge Trees

来源于google的bigtable论文。

2 解决问题

传统的数据库如MySql采用B+树存放数据，B+树是一个随机读写的数据结构。我们知道，顺序读写要比随机读写快无数倍，所以需要把数据结构改成顺序读写。

3 应用场景

LSM是当前被用在许多产品的文件结构策略：HBase, Cassandra, LevelDB, SQLite,甚至在mangodb3.0中也带了一个可选的LSM引擎（Wired Tiger 实现的）。

LSM-Tree比较适合的应用场景是：insert数据量大，读数据量和update数据量不高且读一般针对最新数据。

4 实现原理

4.1 基本原理

1、数据按时间和大小分文件存放(sstable文件)。

2、新的修改用Copy-On-Write Tree方式按key缓存在内存(memtable)中，内存中保序。

3、内存达到时间或大小条件后，保存在一个新的文件里(顺序写，速度很快)。

4、对已经保存的文件，不再修改。

5、查询的时候，先查内存，然后依次查各个保存的文件。

6、因为每个文件里的数据都是顺序存放的，所以查询速度较快(二分查找)。

4.2 提升读性能的方案

1、定时触发文件合并操作，删除冗余记录，并减少文件个数，提升查询效率（由于sstable里的记录是顺序存放的，所以合并非常高效(归并算法、顺序读写)）。

2、采用页缓存，减少二分查找的消耗。LevelDB 和 BigTable 是将 block-index 保存在文件尾部，这样查找就只要一次IO操作，如果block-index在内存中。

3、采用布隆过滤器，减少不存在数据的判定逻辑。

4、并行合并。

打个比方，合并操作就是JVM里的GC，在合并的时候，势必会影响其他操作。所以我们用G1的思想，把文件分区域，各个区域分别合并，这样，就可以减少停顿(加锁)的时间，同时也减少了合并文件额外需要的空间。

想想这个结构，类似于一颗新的树，这个树的每个节点是一个文件，每个文件的内容是sstable。

5 优点

1、写性能高。

2、只需要对内存部分加锁，文件不会修改，无需加锁

6 缺点

1、对于频繁大规模改动的场景不好。

7 最佳实践

1、 memtable丢失的问题：需要记录redo日志和恢复时间点，用于重建memtable。

2、

8 参考

LSM存储模型

https://www.cnblogs.com/chenny7/p/4568829.html

LSM 算法的原理是什么？

https://www.zhihu.com/question/19887265

Log Structured Merge Trees (LSM)的更多相关文章

Log Structured Merge Trees(LSM) 算法
十年前,谷歌发表了 “BigTable” 的论文,论文中很多很酷的方面之一就是它所使用的文件组织方式,这个方法更一般的名字叫 Log Structured-Merge Tree. LSM是当前被用在许 ...
Log Structured Merge Trees(LSM) 原理
http://www.open-open.com/lib/view/open1424916275249.html
LSM(Log Structured Merge Trees ) 笔记
目录一.大幅度制约存储介质吞吐量的原因二.传统数据库的实现机制三.LSM Tree的历史由来四.提高写吞吐量的思路 4.1 一种方式是数据来后,直接顺序落盘 4.2 另一种方式,是保证落盘的数 ...
The storage wars: Shadow Paging, Log Structured Merge and Write Ahead Logging
The storage wars: Shadow Paging, Log Structured Merge and Write Ahead Logging previous: Seek, and yo ...
SSTable and Log Structured Storage: LevelDB
If Protocol Buffers is the lingua franca of individual data record at Google, then the Sorted String ...
InfluxDB存储引擎Time Structured Merge Tree——本质上和LSM无异，只是结合了列存储压缩，其中引入fb的float压缩，字串字典压缩等
The New InfluxDB Storage Engine: Time Structured Merge Tree by Paul Dix | Oct 7, 2015 | InfluxDB | 0 ...
Log-Structured Merge Tree (LSM Tree)
一种树,适合于写多读少的场景.主要是利用了延迟更新.批量写.顺序写磁盘(磁盘sequence access比random access快). 背景回顾数据存储的两个“极端”发展方向加快读:加索引( ...
Pull后产生多余的log（Merge branch 'master' of ...）
第一步: git reset --hard 73d0d18425ae55195068d39b3304303ac43b521a 第二步: git push -f origin feature/PAC_1 ...
[转][译] 存储引擎原理：LSM
原译文地址:http://www.tuicool.com/articles/qqQV7za http://www.zhihu.com/question/19887265 http://blog.csd ...

随机推荐

ubuntu18---安装python3.6下的virtualenv15.1.0
动态语言Python有着自己的虚拟环境,虚拟环境是程序执行时的独立执行环境,在同一台服务器中可以创建不同的虚拟环境供不同的系统使用,项目之间的运行环境保持独立性而相互不受影响.例如项目A可以在基于Py ...
volatile特性
volatile保证可见性一旦一个共享变量(类的成员变量.类的静态成员变量)被volatile修饰之后,那么就具备了两层语义: 1)保证了不同线程对这个变量进行操作的可见性,即一个线程修改了某个变量 ...
win10 uwp unix timestamp 时间戳转 DateTime
有时候需要把网络的 unix timestamp 转为 C# 的 DateTime ,在 UWP 可以如何转换? 转换函数可以使用下面的代码 private static DateTime UnixT ...
linux的文件基本属性
Linux系统是一种典型的多用户系统,不同的用户处于不同的地位,拥有不同的权限.为了保护系统的安全性,Linux系统对不同的用户访问同一文件(包括目录文件)的权限做了不同的规定 1.在Linux中我们 ...
IDEA 的 properties 文件的属性字段如何链接到调用的文件
想要达到的效果: ctrl + 鼠标点击:弹出如下所有使用的文件问题: 有些 IDEA 使用 ctrl + 鼠标点击不能看到使用的文件. 解决办法: ctrl + 鼠标点击,然后选择设置按钮然后 ...
使用JavaScript动态更改CSS样式
在很多情况下,都需要对网页上元素的样式进行动态的修改.在JavaScript中提供几种方式动态的修改样式,下面将介绍方法的使用.效果.以及缺陷. 1.使用obj.className来修改样式表的类名. ...
css-使不同大小的图片在固定大小的容器中居中
HTML示例如下: <ul> <li class="imgbox"><img src="img1.jpg"></li& ...
How to work with the snap environment
How to work with the snap environment SummaryThe snap environment manages snap agents and snap toler ...
x86项目中读取注册表Register数据项的方法
x86项目中使用Registry读取key/value的时候,会出现重定向的问题,解决方法如下: public static string GetMachineGuid() { string guid ...
Activity被回收导致fragment的getActivity为空
在编写含有Fragment代码的时候,经常会遇到这种情况,假如app长时间在后台运行,再点击进入会crash,而且fragment页面有重叠的现象. 如果系统内存不足.或者切换横竖屏.或者app长时间 ...

Log Structured Merge Trees (LSM)