本来本篇是想介绍前端组件化开发用户界面,发现框架还未实现文件存储,原本计划是后续设计开发的,索性把计划提前,所以本篇将介绍基于Raft实现分布式的文件存储引擎。

一. 实现思路

  既然是分布式存储,就需要解决以下几个关键问题:

  • 如何将文件以多副本的形式存储在集群的节点上,且保证副本间的一致性?这个问题可基于Raft协议实现相应的状态机来解决;
  • 如何将大量的文件分组,即如何划分多个Raft组?这个问题可通过在目录元数据内保存多个Raft组信息,每个组存储限制在64M(暂定)来解决;
  • 如何存储与管理目录及文件的元数据?这个问题可通过实现元数据状态机来管理,利用已实现的KV存储引擎来存储元数据;
  • 如何保证元数据与文件数据的一致性?这个问题开始时想用已实现的EntityStore的事务引擎来解决,虽能保证强一致性但逻辑复杂,性能损失大。因此放弃了强一致性改为保证最终一致性,元数据状态机及文件状态机内都有定时器来检查不一致的状态。

1. 元数据存储-BlobMetaStateMachine

  开始时想设计为一个集群对应一个BlobMetaRaftGroup,后来考虑到单个RaftGroup可能会压力较大,所以改为每个Application对应一个BlobMetaRaftGroup。每个元数据状态机主要存储以下各项信息:

  • 目录元数据:包括目录名称及标识,该目录下分配了多少个Chunk,每个Chunk占用了多少空间,隶属于哪个RaftGroup等;
  • 文件元数据:包括文件名称及标识,该文件隶属的目录标识及隶属的ChunkRaftGroup标识等;
  • Chunk元数据: 包括Chunk的RaftGroup内的各个RaftNode分配在集群的哪个节点上;
  • 写锁数据:用于并发写时加锁。

  确认了需要存储哪些信息后,就需要确认如何将这些数据映射至底层的KV存储,既要保证高效又要方便Api检索这些元数据,经过一些尝试后最终定为以下方案。

目录元数据 Key

TypeFlag AppId 目录名称UTF8编码
8bit 8bit n bit
  • TypeFlag = 0
  • 注意:最后一个'/' 0x2F被替换为0x00,以方便扫描某一目录下所有子目录

目录元数据 Value

目录Id Chunk RaftGroup数量 Chunk RaftGroupIds
128bit 16bit n * 64bit

文件元数据 Key

TypeFlag AppId 目录Guid 分隔占位 名称UTF8编码
8bit 8bit 128bit 8bit n bit
  • TypeFlag = 1
  • 分隔占位始终 = 0

文件元数据 Value

文件Id 文件大小 Chunk RaftGroupId
128bit 32bit 64bit

2. 文件存储-BlobChunkStateMachine

  根据上述设计,每个目录下的文件分成了多个存储组(BlobChunkRaftGroup),本来想用MemoryMapFile来实现底层Chunk存储,但考虑到有更重要的功能要实现所以暂偷懒直接利用Linux文件系统来存储文件,状态机Apply文件写命令时,将文件直接写入节点运行时blob/ChunkRaftGroupId/目录下。

3. 读写流程

  • 读流程较简单: 发送读元数据命令至BlobMetaRaftGroup获取文件元数据(缓存),然后再分小块发读命令至目标ChunkRaftGroup获取文件小块数据;
  • 写流程要考虑元数据与文件数据的一致性,还要考虑在目录下无可用ChunkRaftGroup时创建新的组,具体参考以下设计草图:

二. 实现效果

  根据以上设计在经历了1个月的编码后已初步实现(其中约一半时间在更改架构,抛弃了Mono依赖,改为Hosting CoreCLR,性能提升1倍),在框架IDE内每个Application内有个"BlobStore"节点,如下图所示可测试上传文件,然后通过浏览器访问上传至/pub目录内的文件(http://{地址:端口}/blob/{app名称}/{文件路径} eg: http://xx.xx.xx.xx:5000/blob/sys/imgs/aa.jpg

  作者简单测试了一下通过框架WebHost下载文件的性能(测试时尚未实现缓存元数据, 虚拟机I74C8G),如下图所示:

三. 本篇小结

  本实现适用于存储大量小文件,如业务单证的附件,或者用于OA系统作为文档库。目前只是实现了基本的上传下载功能,删除、重命名、Chunk合并等功能尚未实现,另待将来框架实现反向索引后再实现全文搜索功能。

  框架已更新,如何安装测试请参考AppBoxFuture(一): Hello Future!。如果您有问题或Bug报告,请留言或在Github提交Issue。

AppBoxFuture(五): 分布式文件存储-Store Everything的更多相关文章

  1. 分布式文件存储:FastDFS简单使用与原理分析

    引言 FastDFS 属于分布式存储范畴,分布式文件系统 FastDFS 非常适合中小型项目,在我接手维护公司图片服务的时候开始接触到它,本篇文章目的是总结一下 FastDFS 的知识点. 用了 2 ...

  2. .Net平台下,分布式文件存储的实现

    遇到的问题 对于Web程序,使用一台服务器的时候,客户端上传的文件一般也都是存储在这台服务器上.但在集群环境中就行不通了,如果每个服务器都存储自己接受到的文件,就乱套了,数据库中明明有这个附件的记录, ...

  3. 【网络爬虫入门05】分布式文件存储数据库MongoDB的基本操作与爬虫应用

    [网络爬虫入门05]分布式文件存储数据库MongoDB的基本操作与爬虫应用 广东职业技术学院  欧浩源 1.引言 网络爬虫往往需要将大量的数据存储到数据库中,常用的有MySQL.MongoDB和Red ...

  4. 分布式文件存储数据库 MongoDB

    MongoDB 简介 Mongo 并非芒果(Mango)的意思,而是源于 Humongous(巨大的:庞大的)一词. MongoDB 是一个基于分布式文件存储的 NoSQL 数据库.由 C++ 语言编 ...

  5. mogilefs分布式文件存储

    MogileFS是一个开源的分布式文件存储系统,由LiveJournal旗下的Danga Interactive公司开发.Danga团队开发了包括 Memcached.MogileFS.Perlbal ...

  6. (转) 分布式文件存储FastDFS(一)初识FastDFS

    http://blog.csdn.net/xingjiarong/article/details/50559849 一.FastDFS简介 FastDFS是一款开源的.分布式文件系统(Distribu ...

  7. 分布式文件存储FastDFS(一)初识FastDFS

    一.FastDFS简单介绍 FastDFS是一款开源的.分布式文件系统(Distributed File System),由淘宝开发平台部资深架构师余庆开发.作为一个分布式文件系统,它对文件进行管理. ...

  8. 分布式文件存储FastDFS(七)FastDFS配置文件具体解释

    配置FastDFS时.改动配置文件是非常重要的一个步骤,理解配置文件里每一项的意义更加重要,所以我參考了大神的帖子,整理了配置文件的解释.原帖例如以下:http://bbs.chinaunix.net ...

  9. (转) 分布式文件存储FastDFS(七)FastDFS配置文件详解

    http://blog.csdn.net/xingjiarong/article/details/50752586 配置FastDFS时,修改配置文件是很重要的一个步骤,理解配置文件中每一项的意义更加 ...

随机推荐

  1. BZOJ_1257_ [CQOI2007]余数之和sum_数学

    BZOJ_1257_ [CQOI2007]余数之和sum_数学 题意:给出正整数n和k,计算j(n, k)=k mod 1 + k mod 2 + k mod 3 + … + k mod n的值. 分 ...

  2. Linux 系统目录结构说明

    在刚开始接触Linux系统时,对其目录结构迷茫的很,尤其是很少使用或者刚开始接触Linux系统的同学:我也是最近项目需要开始上手,所以查看了些资料,特整理出来供大家互相学习: 1.目录结构总揽 以下是 ...

  3. Spring:(二)DI依赖注入方式

    DI 依赖注入 DI(Dependency Injection)依赖注入,说简单一点就将类里面的属性在创建类的过程中给属性赋值,即将对象依赖属性(简单值,集合,对象)通过配置设值给该对象. 属性注入的 ...

  4. 【效率神奇】Github丧心病狂的9个狠招

    Github,一个被业内朋友成为「全球最大的同性交友社区」的平台. 小时候遇到不会的字可以查新华字典.后来写作文我们可以通过作文书.或者文摘去找合适的素材.同样,写代码可以去Github上找适合自己的 ...

  5. B哥竟然也被裁了,聊一聊我的看法

    B哥的故事 B哥是在17年底朋友聚会上认识的一个哥们,因为都是程序员,也聊得来.就加了微信.今年是他北漂的第三个年头了. B哥是从小南方长大的一个男孩,高中学习还凑凑活活,勉强过了二本,上了大学没人管 ...

  6. Thymeleaf【快速入门】

    前言:突然发现自己给自己埋了一个大坑,毕设好难..每一个小点拎出来都能当一个小题目(手动摆手..),没办法自己选的含着泪也要把坑填完..先一点一点把需要补充的知识学完吧.. Thymeleaf介绍 稍 ...

  7. 基于springboot搭建的web系统架构

    从接触springboot开始,便深深的被它的简洁性深深的折服了,精简的配置,方便的集成,使我再也不想用传统的ssm框架来搭建项目,一大堆的配置文件,维护起来很不方便,集成的时候也要费力不少.从第一次 ...

  8. 【Java】广州三本秋招经历

    前言 只有光头才能变强 离上次发文章已经快两个月时间了,最近一直忙着秋招的事.今天是2018年10月22日,对于互联网行业来说,秋招就基本结束了.我这边的流程也走完了(不再笔试/面试了),所以来写写我 ...

  9. 阿里云重磅发布DMS数据库实验室 免费体验数据库引擎

    2月27日,阿里云数据管理DMS发布年度巨献——数据库实验室,用户可在该实验室环境下免费体验数据库引擎.以及DMS各项产品功能.数据库实验室是DMS所提供的体验空间,免费赠送数据库引擎资源. 用户只需 ...

  10. api接口参数问题

    对于取数据,我们使用最多的应该就是get请求了吧.下面通过几个示例看看我们的get请求参数传递. 回到顶部 1.基础类型参数 [HttpGet] public string GetAllChargin ...