Python中文语料批量预处理手记

手记实用系列文章：

语料预处理封装类：

#coding=utf-8

import os

import jieba

import sys

import re

import time

import jieba.posseg as pseg

sys.path.append("../")

jieba.load_userdict("../Database/userdict.txt") # 加载自定义分词词典

'''

title：利用结巴分词进行文本语料处理：单文本处理器、批量文件处理器

    1 首先对文本进行遍历查找

    2 创建原始文本的保存结构

    3 对原文本进行结巴分词和停用词处理

    4 对预处理结果进行标准化格式，并保存原文件结构路径

author：白宁超

myblog：http://www.cnblogs.com/baiboy/

'''

'''

分词.词性标注以及去停用词

stopwordspath： 停用词路径

dealpath：中文数据预处理文件的路径

savepath：中文数据预处理结果的保存路径

'''

def cutTxtWord(dealpath,savepath,stopwordspath):

    stopwords = {}.fromkeys([ line.rstrip() for line in open(stopwordspath,"r",encoding='utf-8')]) # 停用词表

    with open(dealpath,"r",encoding='utf-8') as f:

        txtlist=f.read() # 读取待处理的文本

    words =pseg.cut(txtlist) # 带词性标注的分词结果

    cutresult=""# 获取去除停用词后的分词结果

    for word, flag in words:

        if word not in stopwords:

            cutresult += word+"/"+flag+" " #去停用词

            getFlag(cutresult,savepath) #

'''

分词.词性标注以及去停用词

stopwordspath： 停用词路径

read_folder_path ：中文数据预处理文件的路径

write_folder_path ：中文数据预处理结果的保存路径

filescount=300 #设置文件夹下文件最多多少个

'''

def cutFileWord(read_folder_path,write_folder_path,stopwordspath):

    # 停用词表

    stopwords = {}.fromkeys([ line.rstrip() for line in open(stopwordspath,"r",encoding='utf-8')])

    # 获取待处理根目录下的所有类别

    folder_list = os.listdir(read_folder_path)

    # 类间循环

    for folder in folder_list:

        #某类下的路径

        new_folder_path = os.path.join(read_folder_path, folder)

        # 创建保存文件目录

        path=write_folder_path+folder #保存文件的子文件

        isExists=os.path.exists(path)

        if not isExists:

            os.makedirs(path)

            print(path+' 创建成功')

        else: pass

        save_folder_path = os.path.join(write_folder_path, folder)#某类下的保存路径

        print('--> 请稍等，正在处理中...')

        # 类内循环

        files = os.listdir(new_folder_path)

        j = 1

        for file in files:

            if j > len(files): break

            dealpath = os.path.join(new_folder_path, file) #处理单个文件的路径

            with open(dealpath,"r",encoding='utf-8') as f:

                txtlist=f.read()

                # python 过滤中文、英文标点特殊符号

                # txtlist1 = re.sub("[\s+\.\!\/_,$%^*(+\"\']+|[+——！，。？、~@#￥%……&*（）]+", "",txtlist)

            words =pseg.cut(txtlist) # 带词性标注的分词结果

            cutresult="" # 单个文本：分词后经停用词处理后的结果

            for word, flag in words:

                if word not in stopwords:

                    cutresult += word+"/"+flag+" " #去停用词

            savepath = os.path.join(save_folder_path,file)

            getFlag(cutresult,savepath)

            j += 1

'''

做词性筛选

cutresult：str类型，初切分的结果

savepath： 保存文件路径

'''

def getFlag(cutresult,savepath):

    txtlist=[] #过滤掉的词性后的结果

    #词列表为自己定义要过滤掉的词性

    cixing=["/x","/zg","/uj","/ul","/e","/d","/uz","/y"]

    for line in cutresult.split('\n'):

        line_list2=re.split('[ ]', line)

        line_list2.append("\n") # 保持原段落格式存在

        line_list=line_list2[:]

        for segs in line_list2:

            for K in cixing:

                if K in segs:

                    line_list.remove(segs)

                    break

                else:

                    pass

        txtlist.extend(line_list)

    # 去除词性标签

    resultlist=txtlist[:]

    flagresult=""

    for v in txtlist:

        if "/" in v:

            slope=v.index("/")

            letter=v[0:slope]+" "

            flagresult+= letter

        else:

            flagresult+= v

    standdata(flagresult,savepath)

'''

标准化处理，去除空行，空白字符等。

flagresult:筛选过的结果

'''

def standdata(flagresult,savepath):

    f2=open(savepath,"w",encoding='utf-8')

    for line in flagresult.split('\n'):

        if len(line)>=2:

            line_clean="/ ".join(line.split())

            lines=line_clean+" "+"\n"

            f2.write(lines)

        else: pass

    f2.close()

if __name__ == '__main__' :

    t1=time.time()

    # 测试单个文件

    dealpath="../Database/SogouC/FileTest/1.txt"

    savepath="../Database/SogouCCut/FileTest/1.txt"

    stopwordspath='../Database/stopwords/CH_stopWords.txt'

    stopwordspath1='../Database/stopwords/HG_stopWords.txt' # 哈工大停用词表

    # 批量处理文件夹下的文件

    # rfolder_path = '../Database/SogouC/Sample/'

    rfolder_path = '../Database/SogouC/FileNews/'

    # 分词处理后保存根路径

    wfolder_path = '../Database/SogouCCut/'

    # 中文语料预处理器

    # cutTxtWord(dealpath,savepath,stopwordspath) # 单文本预处理器

    cutFileWord(rfolder_path,wfolder_path,stopwordspath) # 多文本预处理器

    t2=time.time()

    print("中文语料语处理完成，耗时："+str(t2-t1)+"秒。") #反馈结果

执行结果：

Python中文语料批量预处理手记的更多相关文章

python中文语料分词处理，按字或者词cut_sentence
cut_sentence.py import string import jieba import jieba.posseg as psg import logging #关闭jieba日制 jieb ...
Python中结巴分词使用手记
手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...
基于CBOW网络手动实现面向中文语料的word2vec
最近在工作之余学习NLP相关的知识,对word2vec的原理进行了研究.在本篇文章中,尝试使用TensorFlow自行构建.训练出一个word2vec模型,以强化学习效果,加深理解. 一.背景知识: ...
wiki中文语料的word2vec模型构建
一.利用wiki中文语料进行word2vec模型构建 1)数据获取到wiki官网下载中文语料,下载完成后会得到命名为zhwiki-latest-pages-articles.xml.bz2的文件,里 ...
python调用hanlp分词包手记
python调用hanlp分词包手记 Hanlp作为一款重要的分词工具,本月初的时候看到大快搜索发布了hanlp的1.7版本,新增了文本聚类.流水线分词等功能.关于hanlp1.7版本的新功能,后 ...
word2vec词向量处理中文语料
word2vec介绍 word2vec官网:https://code.google.com/p/word2vec/ word2vec是google的一个开源工具,能够根据输入的词的集合计算出词与词之间 ...
利用RNN进行中文文本分类（数据集是复旦中文语料）
利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) 1.训练词向量数据预处理参考利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) ,现在我们有了分词 ...
基于tensorflow的文本分类总结（数据集是复旦中文语料）
代码已上传到github:https://github.com/taishan1994/tensorflow-text-classification 往期精彩: 利用TfidfVectorizer进行 ...
【原】python中文文本挖掘资料集合
这些网址是我在学习python中文文本挖掘时觉得比较好的网站,记录一下,后期也会不定期添加: 1.http://www.52nlp.cn/python-%E7%BD%91%E9%A1%B5%E7% ...

随机推荐

Asp.Net Core WebAPI入门整理（三）跨域处理
一.Core WebAPI中的跨域处理 1.在使用WebAPI项目的时候基本上都会用到跨域处理 2.Core WebAPI的项目中自带了跨域Cors的处理,不需要单独添加程序包 3.使用方法简单 ...
通过生成支付二维码来实现微信支付的解决方案 - EasyWechat版（转）
上一篇我们讲了在微信浏览器内实现微信支付的功能,它特别适合于一些基于微信公众号的h5站点等,支付流程也相当流畅,但是... 还有一种情况,比如现在北哥兄弟连PC版,是生成了一个二维码,这个二维码是专属 ...
hdu 2066 多起点多终点
多起点多终点无向图结点的个数要自己求 Sample Input6 2 3 //边数起点数终点数1 3 5 //u v w1 4 72 8 123 8 44 9 129 10 21 2 //起 ...
floor()函数和round()函数的区别
floor()函数和round()函数的区别 2018-08-17 09:40:00 1.floor()函数:取整,保留整数部分,舍弃小数部分. 2.round()函数:四舍五入.round(x, ...
POJ1006 Biorhythms【中国剩余定理】
<题目链接> 题目大意: 人体的体力每23天会达到峰值,情感每28天会达到峰值,智力每33天会达到峰值,一个人在a天体力达到峰值,b天情感达到峰值,c天智力达到峰值,求这个人下一次体力情感 ...
细说Vue作用域插槽，匹配应用场景。
最近在官方文档中看到,vue新增了一种插槽机制,叫做作用域插槽.要求的版本是2.1.0+. 首先来说一下:顾名思义,所谓作用域插槽,主要就在作用域,需要注意的是(以下几点看不懂不要紧,配合下面的例子, ...
FTP 其他设置
参考文章 http://faichen.vip.blog.163.com/blog/static/37644066201010362051291/
collections集合模块 [namedtuple,deque,*]
collections是Python内建的一个集合模块,提供了许多有用的集合类. namedtuple namedtuple是一个函数, 它用来创建一个自定义的tuple对象,并且规定了 tuple元 ...
每日踩坑 2018-01-09 WebAPI会如何面对枚举参数？
这一块确实有些疑问, 众所周知枚举参数我们传送枚举值所对应的数字就行了, 以前 Leader 跟我讲过,枚举参数会将字符串值也能够成功转化,而且枚举值定义之外的数字也可以被转为枚举值. 主要的问题在 ...
洛谷.4015.运输问题(SPFA费用流)
题目链接嗯..水题洛谷这网络流二十四题的难度评价真神奇.. #include <queue> #include <cstdio> #include <cctype&g ...

Python中文语料批量预处理手记

手记实用系列文章：

语料预处理封装类：

执行结果：

Python中文语料批量预处理手记的更多相关文章

随机推荐

热门专题