pack、unpack自制二进制“数据库”
引言
pack、unpack函数,如果没有接触过socket,这个可能会比较陌生,这两个函数在socket交互的作用是组包,将数据装进一个二进制字符串,和对二进制字符串中的数据进行解包,这个里面有好多种格式,具体的格式可以去查查官方的手册(或者等看完本篇文章之后,去调用接口查看),我这里主要用了pack(“N”,int),pack(“a”,str)以及他们两个对应的解包函数,N在手册中的解释是下面这个,占4个字节,大端方式(其实就是低位在前还是在后的问题)。a是对字符串进行打包,不够指定的数值的时候用NULL(\0,或者说assic码0对应的字符)填充。
N - unsigned long (always 32 bit, big endian byte order)
a - NUL-padded string
我将用这个打包解包函数做一个函数手册查询小工具,或者可以说是一个自制小型二进制数据库。
设计数据格式
在做这个二进制文件数据库的时候我会创建两个文件,一个是索引文件,一个是要查询的数据的文件,分别看看他们的结构:
说明中括号内的数字为所占字节(bytes)数,"~"波浪线表示所占字节数不确定
数据文件,第一个php是一个正式的字符串"php",占4个字节,后面跟着版本说明,长度不确定(这个长度可以从后面的index文件中获取),接下来后面是存储信息的主体了。首先是一个函数名长度lenName占4个字节,接下来是函数名称,长度不确定,有前面的lenName对应的值确定,接下来是lenVal占4个字节,后面跟的是具体的函数说明内容,长度有前面的lenVal对应的值确定。
- 内容存储格式定义
- ++++++++++++++++++++++++++++++++++++++
- |php() |版本说明(~) |
- ++++++++++++++++++++++++++++++++++++++
- |lenName() |函数名称(~) |
- ++++++++++++++++++++++++++++++++++++++
- |lenVal() |函数内容(~) |
- ++++++++++++++++++++++++++++++++++++++
- ......
索引文件,索引文件就比较简单了,其中全部存储了上面的存储文件中每个函数开始的指针位置,每个位置占用4个字节。
- 索引格式定义
- ++++++++++++++++++++++++++++++++++++++
- |position() |
- ++++++++++++++++++++++++++++++++++++++
- ......
查询的实现
由于存储文件中的内容是按照函数名顺序排序存储的,索引也是按照函数存储的顺序存储的,所以获取起来很方便,直接使用二分法就可以很轻松的获取到想要的函数
在查询的时候主要使用了下面几个方法:
第一、从制定位置获取一条索引的值(也就是对应的函数存储文件的指针位置)
- /**
- * 从索引文件中获取一条记录的位置
- * @param 索引文件中的开始位置,从开始位置获取四个字节为一个函数说明的开始位置
- * @return 返回该索引位置所对应的存储位置指针偏移量
- */
- private function _getOneIndex($pos)
- {
- fseek($this->_indexHandle, $pos);
- $len = unpack("Nlen", fread($this->_indexHandle, 4));
- return $len['len'];
- }
第二、从指定的指针偏移位置获取一条len(4)+val(~)格式的内容
- /**
- * 从制定的指针偏移量获取一个len+val型的内容
- * @param $pos 文件的指针偏移量
- * @return 返回数组,包括长度和值
- */
- private function _getStoreLenValFormat($pos){
- fseek($this->_storeHandle, $pos);
- $len = unpack("Nlen", fread($this->_storeHandle, 4));
- $len = $len['len'];
- $val = fread($this->_storeHandle, $len);
- return array
- (
- 'len' => $len,
- 'value' => $val,
- );
- }
第三、获取制定函数的说明,这个也是最主要的一部分,使用二分法从数据文件中获取一条记录
- /**
- * 获取函数内容
- * @param 要查找的函数名称
- * @return 返回函数说明的json字符串
- */
- public function get($func)
- {
- if(!$this->isInit())
- return;
- $begin = 0;
- $end = filesize($this->_indexFile)/4;
- $ret = '[]';
- while($begin < $end){
- $mid = floor(($begin + $end)/2);
- $pos = $mid*4; //$mid只是指针变量的位置,还需要乘上指针的长度4
- $pos = $this->_getOneIndex($pos);
- $name = $this->_getStoreLenValFormat($pos);
- $flag = strcmp($func, $name['value']);
- if($flag == 0){
- $val = $this->_getStoreLenValFormat($pos+4+$name['len']);
- $ret = $val['value'];
- break;
- }elseif($flag < 0){
- $end = $end == $mid ? $mid-1 : $mid;
- }else{
- $begin = $begin == $mid ? $mid+1 : $mid;
- }
- }
- return $ret;
- }
使用很简单,只需包含类库文件和存储文件数据库,然后调用几句代码就可以
- <?php
- include_once("./manual/phpManual.php");
- $t = new phpManual();
- $t->init('zh');
- echo $t->get("unpack");
输出的是json字符串,转化后如下所示,其中有详细的说明,以及简洁的例子
- {
- "name": "unpack",
- "desc": "Unpack data from binary string.",
- "long_desc": "Unpacks from a binary string into an array according to the given `format`.\\n\\nThe unpacked data is stored in an associative array. To accomplish this you have to name the different format codes and separate them by a slash /. If a repeater argument is present, then each of the array keys will have a sequence number behind the given name.",
- "ver": "PHP 4, PHP 5",
- "ret_desc": "Returns an associative array containing unpacked elements of binary string.",
- "seealso": [
- "pack"
- ],
- "url": "function.unpack",
- "class": null,
- "params": [
- {
- "list": [
- {
- "type": "string",
- "var": "$format",
- "beh": 0,
- "desc": "See pack() for an explanation of the format codes."
- },
- {
- "type": "string",
- "var": "$data",
- "beh": 0,
- "desc": "The packed data."
- }
- ],
- "ret_type": "array"
- }
- ],
- "examples": [
- {
- "title": "unpack() example",
- "source": "$binarydata = \"\\x04\\x00\\xa0\\x00\";\n$array = unpack(\"cchars/nint\", $binarydata);",
- "output": null
- },
- {
- "title": "unpack() example with a repeater",
- "source": "$binarydata = \"\\x04\\x00\\xa0\\x00\";\n$array = unpack(\"c2chars/nint\", $binarydata);",
- "output": null
- },
- {
- "title": "unpack() example with unnamed keys",
- "source": "$binarydata = \"\\x32\\x42\\x00\\xa0\";\n$array = unpack(\"c2/n\", $binarydata);\nvar_dump($array);",
- "output": null
- }
- ]
- }
最后再附上目录结构:
- +phpManual
- +manual
- +phpManual
- +zh
- |_manualIndex
- |_manualStore
- |_phpManual.php
- |_test.php
这个是程序的完整地址:
参考
https://github.com/aizuyan/php-doc-parser 从这里拿到的phpmanual的全部数据
本文版权归作者iforever(luluyrt@163.com)所有,未经作者本人同意禁止任何形式的转载,转载文章之后必须在文章页面明显位置给出作者和原文连接,否则保留追究法律责任的权利。
pack、unpack自制二进制“数据库”的更多相关文章
- PHP: 深入pack/unpack
https://my.oschina.net/goal/blog/195749 PHP作为一门为web而生的服务器端开发语言,被越来越多的公司所采用.其中不乏大公司,如腾迅.盛大.淘米.新浪等.在对性 ...
- PHP: 深入pack/unpack 字节序
http://my.oschina.net/goal/blog/195749?p=1 目录[-] 写在前面的话 什么是字节序 MSB和LSB 大端序 小端序 网络字节序 主机字节序 总结 pack/u ...
- [转]PHP: 深入pack/unpack
From : http://my.oschina.net/goal/blog/195749 http://www.w3school.com.cn/php/func_misc_pack.asp PHP作 ...
- golang 仿python pack/unpack
写得不完善也不完美 尤其是高低位转换那(go和c 二进制高地位相反 需要转换,还有go int转[]byte长度是4位),希望牛人看后指导一下 项目需要通过socket调取 客户端是go ,服务器端是 ...
- python struct中的pack unpack
python struct中的pack unpack pytyon tuple元组 print struct.unpack("!ihb", buffer) 结果为7 //pyth ...
- PHP: 深入pack/unpack <转> [链接]
PHP: 深入pack/unpack PHP: chr和pack.unpack那些 PHP: pack/unpack补遗
- pg 和sql server 分别如何新建二进制数据库字段以及插入二进制数据的sql语句
PG create table demo ( id int, name bytea ); Insert into demo (id,name)values(256,pg_read_binary_fil ...
- php pack、unpack、ord 函数使用方法(二进制流接口应用实例)
在工作中,我也逐渐了解到pack,unpack,ord对于二进制字节处理的强大. 下面我逐一介绍它们.在我们工作中,用到它们的估计不多. 我在最近一个工作中,因为通讯需要用到二进制流,然后接口用php ...
- Pytho, struct处理二进制(pack和unpack)
[转]Python使用struct处理二进制(pack和unpack用法) Leave a reply 转载自:http://www.cnblogs.com/gala/archive/2011/09/ ...
随机推荐
- node基础02:第一个node程序
1.第一个web服务器 var http = require("http"); http.createServer(function(request, response){ res ...
- Python 操作 MongoDB
原文 这篇文章主要介绍了使用Python脚本操作MongoDB的教程,MongoDB作为非关系型数据库得到了很大的宣传力度,而市面上的教程一般都是讲解JavaScript的脚本操作,本文则是基于Pyt ...
- CentOs中mysql的安装与配置
在linux中安装数据库首选MySQL,Mysql数据库的第一个版本就是发行在Linux系统上,其他选择还可以有postgreSQL,oracle等 在Linux上安装mysql数据库,我们可以去其官 ...
- lecture4-神经网络在语言上的应用
Hinton第四课 这一课主要介绍神经网络在语言处理上应用,而主要是在文本上,并附上了2003年Bengio 等人的19页的论文<A Neural Probabilistic Language ...
- [已开源/文章教程]独立开发 一个社交 APP 的源码/架构分享 (已上架)
0x00 背景 真不是和被推荐了2天的博客园一位大神较真,从他那篇文章的索引式文章内容也学习到了很多东西,看评论区那么多对社交APP源码有兴趣的,正巧我上周把我的一个社交APP开源了,包括androi ...
- Android闹钟设置的解决方案
Android设置闹钟并不像IOS那样这么简单,做过Android设置闹钟的开发者都知道里面的坑有多深.下面记录一下,我解决Android闹钟设置的解决方案. 主要问题 API19开始AlarmMan ...
- 优秀开源代码解读之JS与iOS Native Code互调的优雅实现方案
简介 本篇为大家介绍一个优秀的开源小项目:WebViewJavascriptBridge. 它优雅地实现了在使用UIWebView时JS与ios 的ObjC nativecode之间的互调,支持消息发 ...
- (404) 未找到 获取StatusCode状态码
异常代码: (HttpWebResponse)req.GetResponse(); 当执行这段代码出现异常 解决问题 那如果我们想获得错误发生时候服务器段错误页面的源代码该如何做呢? 其实非常非常简单 ...
- C语言printf()函数:格式化输出函数
C语言printf()函数:格式化输出函数 头文件:#include <stdio.h> printf()函数是最常用的格式化输出函数,其原型为: int printf( char ...
- LaTeX常用数学符号表示方法
转自:http://www.mohu.org/info/symbols/symbols.htm 常用数学符号的 LaTeX 表示方法 (以下内容主要摘自“一份不太简短的 LATEX2e 介绍”) 1. ...