解析搜狗词库(python)

#!/usr/bin/python

# -*- coding: utf-8 -*-

import struct

import sys

import binascii

import pdb

#搜狗的scel词库就是保存的文本的unicode编码，每两个字节一个字符（中文汉字或者英文字母）

#找出其每部分的偏移位置即可

#主要两部分

#1.全局拼音表，貌似是所有的拼音组合，字典序

#       格式为(index,len,pinyin)的列表

#       index: 两个字节的整数 代表这个拼音的索引

#       len: 两个字节的整数 拼音的字节长度

#       pinyin: 当前的拼音，每个字符两个字节，总长len

#

#2.汉语词组表

#       格式为(same,py_table_len,py_table,{word_len,word,ext_len,ext})的一个列表

#       same: 两个字节 整数 同音词数量

#       py_table_len:  两个字节 整数

#       py_table: 整数列表，每个整数两个字节,每个整数代表一个拼音的索引

#

#       word_len:两个字节 整数 代表中文词组字节数长度

#       word: 中文词组,每个中文汉字两个字节，总长度word_len

#       ext_len: 两个字节 整数 代表扩展信息的长度，好像都是10

#       ext: 扩展信息 前两个字节是一个整数(不知道是不是词频) 后八个字节全是0

#

#      {word_len,word,ext_len,ext} 一共重复same次 同音词 相同拼音表

#拼音表偏移，

startPy = 0x1540;

#汉语词组表偏移

startChinese = 0x2628;

#全局拼音表

GPy_Table ={}

#解析结果

#元组(词频,拼音,中文词组)的列表

GTable = []

def byte2str(data):

    '''将原始字节码转为字符串'''

    i = 0;

    length = len(data)

    ret = u''

    while i < length:

        x = data[i] + data[i+1]

        t = unichr(struct.unpack('H',x)[0])

        if t == u'\r':

            ret += u'\n'

        elif t != u' ':

            ret += t

        i += 2

    return ret

#获取拼音表

def getPyTable(data):

    if data[0:4] != "\x9D\x01\x00\x00":

        return None

    data = data[4:]

    pos = 0

    length = len(data)

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print index,

        pos += 2

        l = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print l,

        pos += 2

        py = byte2str(data[pos:pos+l])

        #print py

        GPy_Table[index]=py

        pos += l

#获取一个词组的拼音

def getWordPy(data):

    pos = 0

    length = len(data)

    ret = u''

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        ret += GPy_Table[index]

        pos += 2

    return ret

#获取一个词组

def getWord(data):

    pos = 0

    length = len(data)

    ret = u''

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        ret += GPy_Table[index]

        pos += 2

    return ret

#读取中文表

def getChinese(data):

    #import pdb

    #pdb.set_trace()

    pos = 0

    length = len(data)

    while pos < length:

        #同音词数量

        same = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print '[same]:',same,

        #拼音索引表长度

        pos += 2

        py_table_len = struct.unpack('H',data[pos]+data[pos+1])[0]

        #拼音索引表

        pos += 2

        py = getWordPy(data[pos: pos+py_table_len])

        #中文词组

        pos += py_table_len

        for i in xrange(same):

            #中文词组长度

            c_len = struct.unpack('H',data[pos]+data[pos+1])[0]

            #中文词组

            pos += 2

            word = byte2str(data[pos: pos + c_len])

            #扩展数据长度

            pos += c_len

            ext_len = struct.unpack('H',data[pos]+data[pos+1])[0]

            #词频

            pos += 2

            count  = struct.unpack('H',data[pos]+data[pos+1])[0]

            #保存

            GTable.append((count,py,word))

            #到下个词的偏移位置

            pos +=  ext_len

def deal(file_name):

    print '-'*60

    f = open(file_name,'rb')

    data = f.read()

    f.close()

    if data[0:12] !="\x40\x15\x00\x00\x44\x43\x53\x01\x01\x00\x00\x00":

        print "确认你选择的是搜狗(.scel)词库?"

        sys.exit(0)

    #pdb.set_trace()

    print "词库名：" ,byte2str(data[0x130:0x338])#.encode('GB18030')

    print "词库类型：" ,byte2str(data[0x338:0x540])#.encode('GB18030')

    print "描述信息：" ,byte2str(data[0x540:0xd40])#.encode('GB18030')

    print "词库示例：",byte2str(data[0xd40:startPy])#.encode('GB18030')

    getPyTable(data[startPy:startChinese])

    getChinese(data[startChinese:])

if __name__ == '__main__':

    #将要转换的词库添加在这里就可以了

    o = ['计算机词汇大全【官方推荐】.scel',

    'IT计算机.scel',

    '计算机词汇大全【官方推荐】.scel',

    '北京市城市信息精选.scel',

    '常用餐饮词汇.scel',

    '成语.scel',

    '成语俗语【官方推荐】.scel',

    '法律词汇大全【官方推荐】.scel',

    '房地产词汇大全【官方推荐】.scel',

    '手机词汇大全【官方推荐】.scel',

    '网络流行新词【官方推荐】.scel',

    '歇后语集锦【官方推荐】.scel',

    '饮食大全【官方推荐】.scel',

    ]

    #for f in o:

    #    deal(f)

    print sys.argv[1]

    deal( sys.argv[1] )

    #保存结果

    f = open('sougou.txt','w')

    for count,py,word in GTable:

        #GTable保存着结果，是一个列表，每个元素是一个元组(词频,拼音,中文词组)，有需要的话可以保存成自己需要个格式

        #我没排序，所以结果是按照上面输入文件的顺序

        f.write( unicode('{%(count)s}' %{'count':count}+py+' '+ word).encode('GB18030') )#最终保存文件的编码，可以自给改

        f.write('\n')

    f.close()

解析搜狗词库(python)的更多相关文章

将搜狗词库.scel格式转化为.txt格式
由于项目中要用到词库,而下载的搜狗词库是.scel格式,所以就用python脚本将搜狗词库.scel格式文件转化为.txt格式文件. #!/bin/python # -*- coding: utf-8 ...
CentOS安装搜狗词库
中文输入使用ibus-pinyin. 在ibus-pinyin里使用搜狗词库 # wget http://hslinuxextra.googlecode.com/files/sougou-phrase ...
(转载)Windows下小狼毫输入法（Rime）的安装与配置（含导入搜狗词库）
div id="cnblogs_post_body" class="blogpost-body"> 最近彻底烦透了搜狗拼音输入法的各种流氓行为,自动升级不 ...
Fcitx使用搜狗词库与皮肤
在 \(\text{Linux}\) 环境下,\(\text{Fcitx}\) 确实是最好用的开源输入法之一.然而 \(\text{Windows}\) 下的巨头输入法 -- 搜狗,对 \(\text ...
Elementary OS 使用fcitx安装搜狗词库、搜狗输入法（Linux通用）
刚开始接触Linux的小伙伴可能比较懵逼,我要使用ibus输入法还是fcitx(小企鹅)输入法,其实这两种都不能说是输入法,Linux中输入法的使用是依赖于输入法框架的,其中搜狗输入法和百度输入法都是 ...
将搜狗词库（.scel格式）转化为txt格式
参考:http://blog.csdn.net/zhangzhenhu/article/details/7014271 #!/usr/bin/python # -*- coding: utf-8 -* ...
搜狗词库转txt
#环境需求 Python2 1 #!/bin/python # -*- coding: utf- -*- import struct import sys import binascii import ...
使用Java将搜狗词库文件（文件后缀为.scel）转为.txt文件
要做一个根据词库进行筛选主要词汇的功能,去搜狗下载专业词汇词库时,发现是.scel文件,且通过转换工具(http://tools.bugscaner.com/sceltotxt/)转换为txt时报错如 ...
中州韵输入法(rime)导入搜狗词库
rime是一个非常优秀的输入法,linux平台下的反应速度远超搜狗,也没有隐私风险.2012年开始接触它,到后来抛弃了它,因为rime自带的词库真的太弱了,也懒得折腾.最近发现一个词库转换软件叫ime ...

随机推荐

换博客啦o(*￣▽￣*)ブ啦啦啦啦啦
csdn总挂···而且觉得这里比较好看啦啦啦啦啦一键搬家真好用TUT不用贴原地址了呢
extjs分组查询
<script type="text/jscript"> var grid; Ext.onReady(function () { Ext.QuickTips.init( ...
[NOI导刊2011]影像之结构化特征
问题描述在影像比对中,有一种方法是利用影像中的边缘(edge)资讯,计算每个边缘资讯中具有代表性的结构化特征,以作为比对两张影像是否相似的判断标准.Water-filling方法是从每个边缘图的一个 ...
[原][Android]All WebView methods must be called on the same thread.
问题 webView调用JS出错. class TestJS { ...... public TestJS(){ } ...
[原]SyntaxHighlighter使用笔记
[Date]2013-09-21 [Environment]SyntaxHighlighter 3.0.83 [Author]wintys (wintys@gmail.com) http://wint ...
Redhat Enterprise Linux 6.4图形界面的中文问题
一.界面中文,但Windows中的中文文件名上传到linux后乱码. .bashrc文件: export LANG=zh_CN.UTF-8 /etc/sysconfig/i18n文件: LANG=&q ...
单独批次性任务采用MySQL定时器解决需求
有时候我们在开发的时候会遇到一些需求是在某个固定的时间段实现某些特殊功能,只做一次或者有规律的每分钟一次每小时一次,那么这个时候我们可以启用MySQL的定时器来帮忙解决该问题. 比如,有一个场景是要求 ...
C/C++中的变量作用域
#include <iostream> using namespace std; int i = 1;int j = 2; int main(){ int i = 9; //C/ ...
iOS 限制textField输入的长度
1.电话号码(带3-3-4效果) //指定代理 self.phoneTextField.delegate = self; //当编辑改变的时候,进行字符校验 [self.phoneTextField ...
android 五子棋开发
两天完成基本功能,再对其进行细节bug优化,本小白的思路. 思路: 1.用canvas绘制棋盘:得到手机的分辨率.棋盘大小为19*19.将手机宽屏分为21份,取中间19份为棋盘.上下空白位置为按钮功能 ...

解析搜狗词库(python)

解析搜狗词库(python)的更多相关文章

随机推荐

热门专题