sphinx索引分析——文件格式和字典是double array trie 检索树，索引存储 – 多路归并排序，文档id压缩

1 概述

这是基于开源的sphinx全文检索引擎的架构代码分析，本篇主要描述index索引服务的分析。当前分析的版本 sphinx-2.0.4

2 index 功能

3 文件表

4 索引文件结构

4.1 spa 文件

存储文档属性，在extern文档信息存储模式下使用。

spa文件格式 => 属性值存储
item	item	item	item	item
docid	attr0	attr1	attr mva(spm file position)	…

spa文件格式 => 在文件的末尾存储每个属性的最大最小值
item	item	item	item	item	item	item
attr0 min	attr1 min	…	attr0 max	attr1 max	attr mva max	…

4.2 spi 文件

存储词列表，词id和指向spd文件的指针。

wordid 采用crc32编码
每64个word插入一个检查点，重新开始存储wordid和spd文件偏移的差值
保存doc的计数值，hit的计数值

spi文件格式 => 倒排索引存储
item	item	item	item
wordid(crc32)或vlb	spd文件偏移的差值	doc的计数值	hit的计数值

spi文件格式 => 文件的末尾存储文件内的检查点信息
item	item	item
checkpoint1 sWord len	sWord	在文件内的 offset

4.3 spd 文件

存储每个词id可匹配的文档id列表。

文件格式 => 只有一次命中的时候
item	item	item	item
docid vlb	hit count	hit field	hit position

文件格式 => 多次命中的时候
item	item	item	item
docid vlb	hit count	field mask	hit file(spp) position 差值

4.4 sph 文件

存储索引头信息。

格式0
item0	item1	item2	item3	item4
version	bits	docinfo mode	schema	min doc

格式1
item5	item6	item7	item8	item 9
ckpoint pos	ckpoint count	total doc	total bytes	index setting

格式2
item10	item 11	item12	item13
tokenizer	dictionary	kill list	min max index

4.5 spk 文件

存储kill-lists信息。

4.6 spm 文件

存储mva数据

分块存储
多路归并排序，创建spm文件

spm文件格式
item	item	item
docid	A a0,a1,a2 …	B b0,b1,b2 …

4.7 sps 文件

存储字符串属性

4.8 spp 文件

4.8.1 第一次扫描创建的命中文件(临时存储命中信息)

存储每个词的命中数。

文件内分块存储
块内同类递增排序，优先级为 wordid > docid > hitpos
在wordid,docid相等的条件下，hitpos差分存储
在wordid相等的条件下docid差分存储
wordid差分存储

hit block 的存储结构列表如下
item	item	item	item	item
wordid0	docid0	pos0, pos1, pos2 …	hitcount	field mask
	docid1	pos0, pos1, pos2 …	hitcount	field mask
	docid2	pos0, pos1, pos2 …	hitcount	field mask
wordid1	docid0	pos0, pos1, pos2 …	hitcount	field mask
	docid1	pos0, pos1, pos2 …	hitcount	field mask
…	…	…	…	…

4.8.2 最终创建的spp文件格式

当doc切换后存储的第一个是hit position, 后面存储的是差值。

spp文件存储格式
item
hit position 差值

4.9 sps 文件

存储字符串属性数据。

sphinx索引分析——文件格式和字典是double array trie 检索树，索引存储 – 多路归并排序，文档id压缩 – Variable Byte Coding的更多相关文章

双数组字典树(Double Array Trie)
参考文献 1.双数组字典树(DATrie)详解及实现 2.小白详解Trie树 3.论文<基于双数组Trie树算法的字典改进和实现> DAT的基本内容介绍这里就不展开说了,从Trie过来的同 ...
sphinx 源码阅读之分词，压缩索引，倒排——单词对应的文档ID列表本质和lucene无异也是外部排序再压缩解压的时候需要全部扫描doc_ids列表偏移量相加获得最终的文档ID
转自:http://github.tiankonguse.com/blog/2014/12/03/sphinx-token-inverted-sort.html 外部排序现在我们的背景是有16个已经 ...
double array trie 插入结点总结
双数组Trie树索引的可操作性研究.pdf 提示:任一状态点的移动,会影响其Trie树中父节点的base值的选择以及兄弟结点位置的变动,而兄弟结点的移动又须变更相应的子节点的check值. 设待插入的 ...
Double Array Trie 的Python实现
不多介绍,可自行Google,或者其它关键词: "datrie" 放代码链接: double_array_trie.py 因为也是一段学习代码,参考的文章都记在里面了,主要参考gi ...
Elasticsearch压缩索引——lucene倒排索引本质是列存储+使用嵌套文档可以大幅度提高压缩率
注意:由于是重复数据,词法不具有通用性!文章价值不大! 摘自:https://segmentfault.com/a/1190000002695169 Doc Values 会压缩存储重复的内容. 给定 ...
ES里设置索引中倒排列表仅仅存文档ID——采用docs存储后可以降低pos文件和cfs文件大小
index_options The index_options parameter controls what information is added to the inverted index, ...
Poseidon 系统是一个日志搜索平台——认证看链接ppt，本质是索引的倒排列表和原始日志数据都存在HDFS，而文档和倒排的元数据都在NOSQL里，同时针对单个filed都使用了独立索引，使用MR来索引和搜索
Poseidon 系统是一个日志搜索平台,可以在百万亿条.100PB 大小的日志数据中快速分析和检索.360 公司是一个安全公司,在追踪 APT(高级持续威胁)事件,经常需要在海量的历史日志数据中检索 ...
sphinx索引分析续
4.10 同义词文件/Synonym 同义词文件格式 from => to AT &T => AT&T AT & T => AT & T standa ...
Elasticsearch的索引模块（正排索引、倒排索引、索引分析模块Analyzer、索引和搜索、停用词、中文分词器）
正向索引的结构如下: “文档1”的ID > 单词1:出现次数,出现位置列表:单词2:出现次数,出现位置列表:…………. “文档2”的ID > 此文档出现的关键词列表. 一般是通过key,去 ...

随机推荐

.net 验证码
using System; using System.Collections.Generic; using System.Linq; using System.Web; using System.We ...
转载：一幅图弄清DFT与DTFT,DFS的关系
转载:http://www.cnblogs.com/BitArt/archive/2012/11/24/2786390.html 很多同学学习了数字信号处理之后,被里面的几个名词搞的晕头转向,比如DF ...
EF INNER JOIN,LEFT JOIN,GROUP JOIN
IQueryable<TOuter>的扩展方法中提供了 INNER JOIN,GROUP JOIN但是没有提供LEFT JOIN GROUP JOIN适用于一对多的场景,如果关联的GROU ...
三元运算与lambda表达式
#三元运算,就是对if else的简写 if 1 == 1: print("jasper") else: print("sb") 三元运算写法 name=&qu ...
Windows普通窗口程序
2015-10-09 12:55:38 KWindow.h #pragma once #include <windows.h> class KWindow { virtual void O ...
日常积累oracle 有关信息
对于VARCHAR2类型,我们在内存使用和效率上需要做出一个权衡.对于VARCHAR2(长度>=2000)变量,PL/SQL动态分配内存来存放实际值,但对于VARCHAR2(长度<2000 ...
Linux网络配置基础
linux网络配置常见有两种:桥接模式(Bridge)与NAT模式,还有一种Host-Only模式由于其局限性通常被舍弃就不加以说明了,下面我们介绍下桥接模式(Bridge)和NAT模式. 桥接模式( ...
Linux删除多个java进程的其中一个
一.背景: Linux后台运行了多个Java程序,进程名都是java. 执行pkill java会一次性杀掉所有的java进程. 二.解决思路: 先通过一定的检索条件,定位出指定的java进程然后解 ...
OpenCV2+入门系列（二）：图像的打开、创建与显示（命令行）
前置知识:数字图像的简略知识这里只是最基础的知识,上课如果稍微听了课的同学可以直接略过不不看. 彩色图像: 对于一副数字图像,对于一副RGB色彩空间的彩色数字图像,它一共有宽X高个像素格子,每个格子 ...
[转] - Configuring Android Studio: IDE & VM Options, JDK, etc
Configuring Android Studio: IDE & VM Options, JDK, etc You should not edit any files in the IDE ...

sphinx索引分析——文件格式和字典是double array trie 检索树，索引存储 – 多路归并排序，文档id压缩 – Variable Byte Coding