python实例：利用jieba库，分析统计金庸名著《倚天屠龙记》中人物名出现次数并排序

本实例主要用到python的jieba库

首先当然是安装pip install jieba

这里比较关键的是如下几个步骤：

加载文本，分析文本

txt=open("C:\\Users\\Beckham\\Desktop\\python\\倚天屠龙记.txt","r", encoding='utf-8').read()    #打开倚天屠龙记文本

words=jieba.lcut(txt)   #jieba库分析文本

对数据进行筛选和处理

for word in words:    #筛选分析后的词组

    if len(word)==1:   #因为词组中的汉字数大于1个即认为是一个词组，所以通过continue结束点读取的汉字书为1的内容

        continue

    elif word=="教主":  #书中教主也指张无忌，即循环读取到教主也认为是张无忌这个名字出现一次，后面类似

        rword="张无忌"

    elif word=="无忌":

        rword="张无忌"

    elif word=="义父":

        rword="谢逊"

    else:

        rword=word

    counts[rword]=counts.get(rword,0)+1  #对rword出现的频率进行统计，当rword不在words时，返回值是0，当rword在words中时，返回+1，以此进行累计计数

for word in exculdes:#如果循环读取到的词组与exculdes字典内的内容匹配，那么过滤掉（不显示）这个词组

    del(counts[word])

创建列表显示和排序

items=list(counts.items())#字典到列表

items.sort(key=lambda x:x[1],reverse=True)#lambda是一个隐函数，是固定写法，以下命令的意思就是按照记录的第2列排序  

for i in range(15):#显示前15位数据

    word,count=items[i]

    print("{0:<10}{1:>10}".format(word,count)) #0:<10左对齐，宽度10，”>10"右对齐

具体脚本如下，每一步都有解析，就不分步解释了

# -*-coding:utf8-*-

# encoding:utf-8

import jieba   #倒入jieba库

txt=open("C:\\Users\\Beckham\\Desktop\\python\\倚天屠龙记.txt","r", encoding='utf-8').read()    #打开倚天屠龙记文本

exculdes={"说道","甚么","自己","武功","咱们","一声","心中","少林","一个","弟子",

          "明教","便是","之中","如何","师父","只见","怎么","两个","没有","不是","不知","这个","不能","只是",

         "他们","突然","出来","如此","今日","知道","我们","心想","二人","两人","不敢","虽然","姑娘","这时","众人"

          ,"可是","原来","之下","当下","身子","你们","脸上","左手","手中","倘若","之后","起来","喝道","武当派","跟着"

          ,"武当","却是","登时","身上","说话","长剑","峨嵋派","性命","难道","丐帮","兄弟","见到","魔教","不可","心下"

          ,"之间","少林寺","伸手","高手","一招","这里","正是"}   #创建字典，主要用于存储非人物名词，供后面剔除使用

words=jieba.lcut(txt)   #jieba库分析文本

counts={}

for word in words:    #筛选分析后的名词

    if len(word)==1:   #因为词组中的汉字数大于1个即认为是一个词组，所以通过continue结束掉读取的汉字书为1的内容

        continue

    elif word=="教主":  #书中教主也指张无忌，即循环读取到教主也认为是张无忌这个名字出现一次，后面类似

        rword="张无忌"

    elif word=="无忌":

        rword="张无忌"

    elif word=="义父":

        rword="谢逊"

    else:

        rword=word

    counts[rword]=counts.get(rword,0)+1  #对rword出现的频率进行统计，当rword不在words时，返回值是0，当rword在words中时，返回+1，以此进行累计计数

for word in exculdes:#如果循环读取到的词组与exculdes字典内的内容匹配，那么过滤掉（不显示）这个词组

    del(counts[word])

items=list(counts.items())#字典到列表

items.sort(key=lambda x:x[1],reverse=True)#lambda是一个隐函数，是固定写法，以下命令的意思就是按照记录的第2列排序  

for i in range(15):#显示前15位数据

    word,count=items[i]

    print("{0:<10}{1:>10}".format(word,count)) #0:<10左对齐，宽度10，”>10"右对齐

毫无疑问，张无忌妥妥的主角

参考：

https://gitee.com/huangshenru/codes/clneriovm0sqxw5k89j2h98

https://www.cnblogs.com/0330lgs/p/10648168.html

python实例：利用jieba库，分析统计金庸名著《倚天屠龙记》中人物名出现次数并排序的更多相关文章

Python之利用jieba库做词频统计且制作词云图
一.环境以及注意事项 1.windows10家庭版 python 3.7.1 2.需要使用到的库 wordcloud(词云),jieba(中文分词库),安装过程不展示 3.注意事项:由于wordclo ...
python 利用jieba库词频统计
1 #统计<三国志>里人物的出现次数 2 3 import jieba 4 text = open('threekingdoms.txt','r',encoding='utf-8').re ...
Python实例---利用正则实现计算器[FTL版]
import re # 格式化 def format_str(str): str = str.replace('--', '+') str = str.replace('-+', '-') str = ...
jieba库词频统计
一.jieba 库简介 (1) jieba 库的分词原理是利用一个中文词库,将待分词的内容与分词词库进行比对,通过图结构和动态规划方法找到最大概率的词组:除此之外,jieba 库还提供了增加自定义中文 ...
jieba库词频统计练习
在sypder上运行jieba库的代码: import matplotlib.pyplot as pltfracs = [2,2,1,1,1]labels = 'houqin', 'jiemian', ...
python入门之jieba库的使用
对于一段英文,如果希望提取其中的的单词,只需要使用字符串处理的split()方法即可,例如“China is a great country”. 然而对于中文文本,中文单词之间缺少分隔符,这是中文 ...
python 中文分词库 jieba库
jieba库概述: jieba是优秀的中文分词第三方库中文文本需要通过分词获得单个的词语 jieba是优秀的中文分词第三方库,需要额外安装 jieba库分为精确模式.全模式.搜索引擎模式原理 1. ...
Python爬虫实例（六）多进程下载金庸网小说
目标任务:使用多进程下载金庸网各个版本(旧版.修订版.新修版)的小说代码如下: # -*- coding: utf-8 -*- import requests from lxml import et ...
【python】利用jieba中文分词进行词频统计
以下代码对鲁迅的<祝福>进行了词频统计: import io import jieba txt = io.open("zhufu.txt", "r" ...

随机推荐

Eclipse引入DTD文件
首先,去MyBatis官方网站下载dtd文件.(本篇本章只演示如何引入config.dtd文件,mapper.dtd同操作) 打开Eclipse,选择Window下面的Preferences选项. 左 ...
MapReduce之提交job源码分析 FileInputFormat源码解析
MapReduce之提交job源码分析 job 提交流程源码详解 //runner 类中提交job waitForCompletion() submit(); // 1 建立连接 connect(); ...
python自动化测试之DDT数据驱动
时隔已久,再次冒烟,自动化测试工作仍在继续,自动化测试中的数据驱动技术尤为重要,不然咋去实现数据分离呢,对吧,这里就简单介绍下与传统unittest自动化测试框架匹配的DDT数据驱动技术. 话不多说, ...
使用Java实现数据库编程项目（宠物商店）
创建数据库代码: DROP DATABASE IF EXISTS petShop; CREATE DATABASE petShop; USE petShop; /*创建表*/ CREATE TABLE ...
Linux平台 Oracle 19c RAC安装Part2：GI配置
三.GI(Grid Infrastructure)安装 3.1 解压GI的安装包 3.2 安装配置Xmanager软件 3.3 共享存储LUN的赋权 3.4 使用Xmanager图形化界面配置GI 3 ...
superset安装文档
1 安装python3.6 yum install epel-release -y yum install https://centos7.iuscommunity.org/ius-release.r ...
jboss 未授权访问漏洞复现
jboss 未授权访问漏洞复现一.漏洞描述未授权访问管理控制台,通过该漏洞,可以后台管理服务,可以通过脚本命令执行系统命令,如反弹shell,wget写webshell文件. 二.漏洞环境搭建及复 ...
【转载】【VSCode】Windows下VSCode编译调试c/c++
转载自:http://blog.csdn.net/c_duoduo/article/details/51615381 懒得自己配置或自己配置出现不明问题的朋友可以点这里: [VSCode]Window ...
激活函数、正向传播、反向传播及softmax分类器，一篇就够了！
1. 深度学习有哪些应用图像:图像识别.物体识别.图片美化.图片修复.目标检测. 自然语言处理:机器创作.个性化推荐.文本分类.翻译.自动纠错.情感分析. 数值预测.量化交易 2. 什么是神经网络 ...
PYNQ上手笔记 | ① 启动Pynq
现在人工智能非常火爆,一般的教程都是为博硕生准备的,太难看懂了,分享一个非常适合小白入门的教程,不仅通俗易懂而且还很风趣幽默,点☞这里☜进入传送门~ = = = = 我是华丽的分割线 = ...

python实例：利用jieba库，分析统计金庸名著《倚天屠龙记》中人物名出现次数并排序

python实例：利用jieba库，分析统计金庸名著《倚天屠龙记》中人物名出现次数并排序的更多相关文章

随机推荐

热门专题