本章以山寨版Twitter为例介绍HBase Schema设计模式。广义的HBase Schema设计不仅仅包含创建表时指定项，还应该综合考虑Column families/Column qualifier/Cell value/Versions/Rowkey等相关内容。

灵活的Schema&简单的存储视图

Schema设计和数据存储及訪问模式关系密切，先回想下HBase数据模型。有几个要点：

被索引的部分包含Row Key+Col Fam+Col Qual+Time Stamp
因为HBase的Schema-Less和列式存储特性，列无需在表创建时定义好，能够动态加入。

并且列名也存储在HFile中。用它来保存数据和用Cell value没有什么不同。

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvaWRvbnR3YW50b2Jl/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/Center" alt="">

循序渐进实战

Schema设计的首要切入点是为待解决的问题建模。下文从逐步完好Twitter用户关系表的过程中总结相关设计原则。

用户关系表follows要回答的问题包含：

A用户关注哪些用户？
A用户是否关注B用户？
谁关注了A用户？

最初版设计例如以下，以用户为rowkey。follows列族中包括多个列，每一个列名为序号。存储的值为关注用户。

最明显的问题有两个：

当用户新增关注时，还须要进行查找当前已关注人。递增序号等逻辑。
查找某个特定关注人效率一般。

改进例如以下，将关注人直接作为列名：

宽表VS窄表

之前的设计为宽表模式，一行记录包括了用户全部关注人。假设使用窄表，Schema例如以下：

窄表设计最大的长处是能通过rowkey查找高效回答之前的问题2：A用户是否关注用户B。而问题1：A用户关注哪些用户，则变成了扫描操作，但从HBase底层列式存储看。I/O读取数据量是一样的（get操作内部实现为针对单行的scan操作）。代码片段例如以下：

Scan s = new Scan();s.addFamily(Bytes.toBytes("f"));

s.setStartRow(Bytes.toBytes("A"));

s.setStopRow(Bytes.toBytes("A"+ 1));

ResultScanner results = followsTable.getScanner(s);

窄表带来的最大问题是。HBase仅仅有单行操作才是原子性的。

如果用户新关注了多个用户，在宽表中能通过一次Put原子操作完毕。而在窄表操作中则须要多次操作。

注：回答问题3。谁关注了A用户，能够再建一张被关注用户表。rowkey为followed+follower。由应用端维护两张表数据一致性。

Rowkey设计

使用Hash rowkey有助于数据在regionserver之间均匀分布，一般能够使用MD5获取定长key。

比較棘手的一个场景是在时间序列数据中，使用时间戳作为rowkey。那么你始终在表底部插入数据，因为rowkey的有序性存储，表的最后一个region成为热点。而应用又须要依据时间范围进行扫描查询，所以不能简单将时间戳Hash，这时能够考虑“Salting”方法：

int salt = new Integer(new Long(timestamp).hashCode()).shortValue()% <number of region servers>

byte[] rowkey = Bytes.add(Bytes.toBytes(salt)\ + Bytes.toBytes("|") + Bytes.toBytes(timestamp));

生成的Rowkey例如以下。查询处理变得略微复杂些，须要在应用端合并处理。

0|timestamp1

0|timestamp5

0|timestamp6

1|timestamp2

1|timestamp9

2|timestamp4

2|timestamp8

反规范化

上节中，Rowkey包括了被关注人ID。CQ中存储被关注人名称。而不用再join用户表查询。已经是某种程度的反规范化。

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvaWRvbnR3YW50b2Jl/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/Center" alt="">

因为HBase列的动态性，能够用单个HBase表使用嵌套列来表达数据库中一对多关系（类似于MongoDB文档模型）。

继续以twitter为例，如果已经有follows和twits表，那么用户登录后，通过follows读取关注人信息，然后从twits表中依据第一步读取的用户ID读取关注人的twits，最后合并取最新结果展如今用户首页。能够考虑添加一张冗余表用来存储用户首页上展示的twits，Rowkey为登录用户+倒序时间戳。存储所关注人的最新twits。

该表提供了更好的读取性能。还能解决一个常见问题：某大V帐号被海量用户关注。如果不使用冗余表。他的twits数据所在的regionserver将成为热点，可能导致性能瓶颈。

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvaWRvbnR3YW50b2Jl/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/Center" alt="">

该表的数据生成能够通过coprocessor实现（下章介绍，类似于数据库的触发器），数据保留由TTL实现（Time To Live，下节介绍）

Column family配置

HBase提供了一些配置參数。在创建表时能够按需定制。

1. HFile block size：和HDFS block size不同。默认大小是64KB。Block索引存储了每一个block的起始key。所以block size大小会影响索引大小。假设你的应用偏重于随机查找，能够选择小一点的block size；假设側重于顺序扫描。那么能够使用较大的block size。

hbase(main):002:0> create'mytable', {NAME => 'colfam1', BLOCKSIZE => '65536'}

2. Block cache：顺序扫描场景下block cache不是那么重要，能够禁用cache。将内存空间留给其它表或者列族。

hbase(main):002:0> create'mytable', {NAME => 'colfam1', BLOCKCACHE => 'false’}

3. Aggressive caching：为某些列族设置更高的block cache优先级，HBase会更积极地将其保留在LRU cache中。

hbase(main):002:0> create'mytable', {NAME => 'colfam1', IN_MEMORY => 'true'}

4. Bloom filters：block索引中仅仅存储了block的起始key，默认block size为64KB，假设表中每行数据都偏小，那么一个block中记录行数过多，可能会出现辛苦查找半天，发现所查找数据不存在的情况。通过Bloom filter引入negative test能高速推断数据是否存在

hbase(main):007:0>create 'mytable',

{NAME=> 'colfam1', BLOOMFILTER => 'ROWCOL'}

5. TTL：用于自己主动清理过期数据

hbase(main):002:0>create 'mytable', {NAME => 'colfam1', TTL => '18000'}

6. Compression：Google公布的Snappy格式是个好选择。

hbase(main):002:0>create 'mytable', {NAME => 'colfam1', COMPRESSION => 'SNAPPY'}<span style="font-family: Arial, Helvetica, sans-serif;"> </span>

7. Cell versioning：默觉得3.

base(main):002:0>create 'mytable', {NAME => 'colfam1', VERSIONS => 1}

Filter过滤器

Filter作用在RegionServer上，数据依旧会从磁盘载入到RegionServer。所以Filter一般降低的是网络I/O，而不是硬盘I/O（有一些Filter能降低硬盘数据读取，比方ColumnPrefixFilter）。

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvaWRvbnR3YW50b2Jl/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/Center" alt="">

HBase提供了Filter接口。用户实现接口能够自己定义过滤功能。当中的过滤方法回调顺序例如以下：

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvaWRvbnR3YW50b2Jl/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/Center" alt="">

HBase还预置了一些filter。典型的如RowFilter

public RowFilter(CompareOprowCompareOp, WritableByteArrayComparable rowComparator)

当中CompareOp代表比較操作符枚举类，比方相等、大于和小于等。Comparator代表详细比較逻辑。常见的有字符串比較、正则匹配和二进制比較等。

读书笔记-HBase in Action-第二部分Advanced concepts-(1)HBase table design的更多相关文章

unix 环境高级编程-读书笔记与习题解答-第二篇
第四节输入与输出上次的笔记中写到的 open, read, write, lseek 以及close ,都是不带缓存的IO函数,这些函数都使用文件描述符进行工作. 上一篇笔记用到的 read(ST ...
[读书笔记]算法(Sedgewick著)·第二章.初级排序算法
本章开始学习排序算法 1.初级排序算法先从选择排序和插入排序这两个简单的算法开始学习排序算法.选择排序就是依次找到当前数组中最小的元素,将其和第一个元素交换位置,直到整个数组有序. public s ...
《Linux内核》课本读书笔记第一章、第二章
Python基础教程读书笔记（2）第二章列表和元组
2.1序列概览列表和元组的主要区别在于,列表可以修改,元组则不能.也就是说如果要根据要求来添加元素,那么列表可能会更好用;而出于某些原因,序列不能修改的时候,使用元组则更为合适.使用后者的理由通常是 ...
读书笔记--iBATIS in Action 目录
1.iBATIS的理念 2.iBATIS是什么 3.安装和配置iBATIS 4.使用以映射语句 5.执行非查询语句 6.使用高级查询技术 7.事务 8.使用动态SQL 9.使用高速缓存提高性能 10. ...
读书笔记--Hibernate in Action 目录
1.理解对象/关系持久化 2.启动项目 3.领域模型和元数据 4.映射持久化类 5.继承和定制类型 6.映射集合和实体关联 7.高级实体关联映射 8.遗留数据库和定制SQL 9.使用对象 10.事务和 ...
读书笔记--Spring in Action 目录
1.Spring之旅 1.1 简化java 开发 1.1.1 激发pojo 的潜能 1.1.2 依赖注入1.1.3 应用切面1.1.4 使用模板消除样板式代码1.2 容纳你的bean1.2.1 与应用 ...
读书笔记 - javascript 高级程序设计 - 第二章在Html中使用JavaScript
1 <script>的6个属性 async 立即下载当前script标签的外部脚本但不能影响别的 charset 没用了 defer 文档显示之后再执行脚本,只对外部脚本有效 lan ...
读书笔记 | Kubernetes in Action
1 Kubernetes介绍 Kubernetes(以下简称K8s) 是一个部署和管理容器化应用的软件系统.它将底层基础设施抽象,简化了应用的开发.部署,以及对开发和运维团队的管理. K8s由一个主节 ...
图解TCP/IP读书笔记（二）
图解TCP/IP读书笔记(二) 第二章.TCP/IP基础知识一.TCP/IP出现的背景及其历史年份事件 20世纪60年代后半叶应DoD(美国国防部)要求,美国开始进行通信技术相关的研发 196 ...

随机推荐

Listview 加载更多
JQM Listview 加载更多 demo - Warren的个人主页 JQM Listview 加载更多 Demo 测试数据1 测试数据2 测试数据3 测试数据4 显示更多 Page Footer ...
如何在django的filter中传递字符串变量作为查询条件（动态改变查询条件）
一般来说在需要查询数据的时候都是以下形式 ret=Articles.objects.filter(id=1) 然而如果要动态的改变查询的条件怎么办呢? 如下代码 def getModelResult( ...
C# net部署图片分布式存储服务器的小案例
如果web服务用户多了,访问多了,用户上传的图片,文件等内容放在一块,想必服务器是承受不住的,这个时候,我们就需要考虑分布式存储的方法了. 如图所示:一个web服务器拖2个图片服务器如何做到用户上传 ...
Clang 与 LLVM
我们在iOS调试中经常会看到Clang这个,那么Clang到底是什么呢?我们来简单了解一下. Clang是一个C.C++.OC语言的轻量级编译器.源代码发布于BSD协议下.Clang是由C++编写,基 ...
Python中类的运算符重载
这篇文章仅仅是总结性质的,待以后有时间的时候会针对比较难理解的部分补充一些例子. 构造和析构 __init__ __del__ 函数调用 __call__ 打印操作 __str__ __repr__ ...
数据结构练习 02-线性结构2. Reversing Linked List (25)
Given a constant K and a singly linked list L, you are supposed to reverse the links of every K elem ...
SVN版本控制与Visual Studio 2012的完美结合
今天电脑重装了,所以vs,sqlserver,svn都得重装,因为我的公司目前使用的版本控制工具是svn.vs和sqlserver的安装均正常没有出现问题,但是在装svn的时候出了一点小插曲!svn下 ...
OneAlert 入门（四）——事件分派和通知必达
OneAlert 是国内首个 SaaS 模式的云告警平台,集成国内外主流监控/支撑系统,实现一个平台上集中处理所有 IT 事件,提升 IT 可靠性.有了 OneAlert,你可以更快更合理地为事件划分 ...
用js判断操作系统和浏览器类型
判断操作系统和浏览器的js代码 navigator.userAgent:userAgent 属性是一个只读的字符串,声明了浏览器用于 HTTP 请求的用户代理头的值. navigator.pla ...
Codevs_2102_石子归并2_(环状动态规划)
描述 http://codevs.cn/problem/2102/ 2102 石子归并 2 时间限制: 10 s 空间限制: 256000 KB 题目等级 : 黄金 Gold 题目 ...

读书笔记-HBase in Action-第二部分Advanced concepts-(1)HBase table design

灵活的Schema&简单的存储视图

循序渐进实战

宽表VS窄表

Rowkey设计

反规范化

Column family配置

Filter过滤器

读书笔记-HBase in Action-第二部分Advanced concepts-(1)HBase table design的更多相关文章

随机推荐

热门专题