结巴分词和自然语言处理HanLP处理手记

手记实用系列文章：

代码封装类：

#!/usr/bin/env python

# -*- coding:utf-8 -*-

import jieba

import os

import re

import time

from jpype import *

'''

title：利用结巴分词进行文本语料的批量处理

    1 首先对文本进行遍历查找

    2 创建原始文本的保存结构

    3 对原文本进行结巴分词和停用词处理

    4 对预处理结果进行标准化格式，并保存原文件结构路径

author：白宁超

myblog：http://www.cnblogs.com/baiboy/

time：2017年4月28日10:03:09

'''

'''

创建文件目录

path:根目录下创建子目录

'''

def mkdir(path):

    # 判断路径是否存在

    isExists=os.path.exists(path)

    # 判断结果

    if not isExists:

        os.makedirs(path)

        print(path+' 创建成功')

        return True

    else:

        pass

    print('-->请稍后，文本正在预处理中...')

'''

结巴分词工具进行中文分词处理：

read_folder_path：待处理的原始语料根路径

write_folder_path 中文分词经数据清洗后的语料

'''

def CHSegment(read_folder_path,write_folder_path):

    stopwords ={}.fromkeys([line.strip() for line in open('../Database/stopwords/CH_stopWords.txt','r',encoding='utf-8')]) # 停用词表

    # 获取待处理根目录下的所有类别

    folder_list = os.listdir(read_folder_path)

    # 类间循环

    # print(folder_list)

    for folder in folder_list:

        #某类下的路径

        new_folder_path = os.path.join(read_folder_path, folder)

        # 创建一致的保存文件路径

        mkdir(write_folder_path+folder)

         #某类下的保存路径

        save_folder_path = os.path.join(write_folder_path, folder)

        #某类下的全部文件集

        # 类内循环

        files = os.listdir(new_folder_path)

        j = 1

        for file in files:

            if j > len(files):

                break

            # 读取原始语料

            raw = open(os.path.join(new_folder_path, file),'r',encoding='utf-8').read()

            # 只保留汉字

            # raw1 = re.sub("[A-Za-z0-9\[\`\~\!\@\#\$\^\&\*\(\)\=\|\{\}\'\:\;\'\,\[\]\.\<\>\/\?\~\！\@\#\\\&\*\%]", "", raw)

            # jieba分词

            wordslist = jieba.cut(raw, cut_all=False) # 精确模式

            # 停用词处理

            cutwordlist=''

            for word in wordslist:

                if word not in stopwords and word=="\n":

                    cutwordlist+="\n" # 保持原有文本换行格式

                elif len(word)>1 :

                        cutwordlist+=word+"/" #去除空格

            #保存清洗后的数据

            with open(os.path.join(save_folder_path,file),'w',encoding='utf-8') as f:

                f.write(cutwordlist)

                j += 1

'''

结巴分词工具进行中文分词处理：

read_folder_path：待处理的原始语料根路径

write_folder_path 中文分词经数据清洗后的语料

'''

def HanLPSeg(read_folder_path,write_folder_path):

    startJVM(getDefaultJVMPath(), "-Djava.class.path=C:\hanlp\hanlp-1.3.2.jar;C:\hanlp", "-Xms1g", "-Xmx1g") # 启动JVM，Linux需替换分号;为冒号:

    stopwords ={}.fromkeys([line.strip() for line in open('../Database/stopwords/CH_stopWords.txt','r',encoding='utf-8')]) # 停用词表

    # 获取待处理根目录下的所有类别

    folder_list = os.listdir(read_folder_path)

    # 类间循环

    # print(folder_list)

    for folder in folder_list:

        #某类下的路径

        new_folder_path = os.path.join(read_folder_path, folder)

        # 创建一致的保存文件路径

        mkdir(write_folder_path+folder)

         #某类下的保存路径

        save_folder_path = os.path.join(write_folder_path, folder)

        #某类下的全部文件集

        # 类内循环

        files = os.listdir(new_folder_path)

        j = 1

        for file in files:

            if j > len(files):

                break

            # 读取原始语料

            raw = open(os.path.join(new_folder_path, file),'r',encoding='utf-8').read()

            # HanLP分词

            HanLP = JClass('com.hankcs.hanlp.HanLP')

            wordslist = HanLP.segment(raw)

            #保存清洗后的数据

            wordslist1=str(wordslist).split(",")

            # print(wordslist1[1:len(wordslist1)-1])

            flagresult=""

            # 去除标签

            for v in wordslist1[1:len(wordslist1)-1]:

                if "/" in v:

                    slope=v.index("/")

                    letter=v[1:slope]

                    if len(letter)>0 and '\n\u3000\u3000' in letter:

                        flagresult+="\n"

                    else:flagresult+=letter +"/" #去除空格

            # print(flagresult)

            with open(os.path.join(save_folder_path,file),'w',encoding='utf-8') as f:

                f.write(flagresult.replace(' /',''))

            j += 1

    shutdownJVM()

if __name__ == '__main__' :

    print('开始进行文本分词操作：\n')

    t1 = time.time()

    dealpath="../Database/SogouC/FileTest/"

    savepath="../Database/SogouCCut/FileTest/"

    # 待分词的语料类别集根目录

    read_folder_path = '../Database/SogouC/FileNews/'

    write_folder_path = '../Database/SogouCCut/'

    #jieba中文分词

    CHSegment(read_folder_path,write_folder_path) #300个txtq其中结巴分词使用3.31秒

    HanLPSeg(read_folder_path,write_folder_path) #300个txt其中hanlp分词使用1.83秒

    t2 = time.time()

    print('完成中文文本切分: '+str(t2-t1)+"秒。")

运行效果：

结巴分词和自然语言处理HanLP处理手记的更多相关文章

Python中结巴分词使用手记
手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...
python 结巴分词学习
结巴分词(自然语言处理之中文分词器) jieba分词算法使用了基于前缀词典实现高效的词图扫描,生成句子中汉字所有可能生成词情况所构成的有向无环图(DAG), 再采用了动态规划查找最大概率路径,找出基于 ...
结巴分词3--基于汉字成词能力的HMM模型识别未登录词
作者:zhbzz2007 出处:http://www.cnblogs.com/zhbzz2007 欢迎转载,也请保留这段声明.谢谢! 1 算法简介在结巴分词2--基于前缀词典及动态规划实现分词博 ...
中文分词之结巴分词~~~附使用场景+demo（net）
常用技能(更新ing):http://www.cnblogs.com/dunitian/p/4822808.html#skill 技能总纲(更新ing):http://www.cnblogs.com/ ...
python中文分词：结巴分词
中文分词是中文文本处理的一个基础性工作,结巴分词利用进行中文分词.其基本实现原理有三点: 基于Trie树结构实现高效的词图扫描,生成句子中汉字所有可能成词情况所构成的有向无环图(DAG) 采用了动态规 ...
Python 结巴分词（1）分词
利用结巴分词来进行词频的统计,并输出到文件中. 结巴分词github地址:结巴分词结巴分词的特点: 支持三种分词模式: 精确模式,试图将句子最精确地切开,适合文本分析: 全模式,把句子中所有的可以成 ...
Python 结巴分词模块
原文链接:http://www.gowhich.com/blog/147?utm_source=tuicool&utm_medium=referral PS:结巴分词支持Python3 源码下 ...
solr+jieba结巴分词
为什么选择结巴分词分词效率高词料库构建时使用的是jieba (python) 结巴分词Java版本下载 git clone https://github.com/huaban/jieba-ana ...
北大开源全新中文分词工具包：准确率远超THULAC、结巴分词
最近,北大开源了一个中文分词工具包,它在多个分词数据集上都有非常高的分词准确率.其中广泛使用的结巴分词误差率高达 18.55% 和 20.42,而北大的 pkuseg 只有 3.25% 与 4.32% ...

随机推荐

review-questions
questions: python字典中items()和iteritems()的区别 items()返回的是列表对象,而iteritems()返回的是迭代器对象 print dic.items() # ...
python 全栈开发，Day50(Javascript简介,第一个JavaScript代码,数据类型,运算符,数据类型转换,流程控制,百度换肤,显示隐藏)
一.Javascript简介 Web前端有三层: HTML:从语义的角度,描述页面结构 CSS:从审美的角度,描述样式(美化页面) JavaScript:从交互的角度,描述行为(提升用户体验) Jav ...
LINQ学习之旅（三）
Linq to Sql语句之Join和Order By Join操作适用场景:在我们表关系中有一对一关系,一对多关系,多对多关系等.对各个表之间的关系,就用这些实现对多个表的操作. 说明:在Join ...
转发(Forward)和重定向(Redirect)的区别
转发是服务器行为,重定向是客户端行为. 转发(Forword) :通过RequestDispatcher对象的forward(HttpServletRequest request,HttpServle ...
Unity3D 之 console面板的停靠
是否苦于不知如何停靠console, 是否后悔将它拉出来, 是否在纠结为何没办法拉回去. 将console或其他面板停靠的方法有两种: 1.Window -> Layouts -> Def ...
Burp Suite之Intruder模块（四）
Burp Suite之Intruder模块(三) Intruder介绍: Burp intruder是一个强大的工具,用于自动对Web应用程序自定义的攻击.它可以用来自动执行所有类型的任务您的测试过程 ...
Coredata 单表简单使用
** 使用Coredata 工程中的DataModel创建:系统创建.手动创建** ** 使用Coredata需要要导入<CoreData/CoreData.h> ** 1.系统创建(系统 ...
聊聊kafka结构
因为kafka用到的地方比较多,日志收集.数据同步等,所以咱们来聊聊kafka. 首先先看看kafaka的结构,producer将消息放到一个Topic然后push到broker,然后cosumer从 ...
HTML的lang属性的作用
今天翻了一下<css权威指南>选择器章节,看到伪类选择器,也叫语言选择器:lang(language),顾名思义它会根据html设置的语言应用对应样式,如: *:lang(en){ col ...
go语言学习-基础知识
go程序的基本结构一个可以最简单的可运行的go程序需要满足下面两个条件: 有一个main()函数 main()函数在main包中例如: 在go语言中的 hello world 程序如下: // m ...

结巴分词和自然语言处理HanLP处理手记

手记实用系列文章：

代码封装类：

运行效果：

结巴分词和自然语言处理HanLP处理手记的更多相关文章

随机推荐

热门专题