Python - 利用词云wordcloud，jieba和中国地图制作四大名著的热词图

热词图很酷炫，也非常适合热点事件，抓住重点，以图文结合的方式表现出来，很有冲击力。下面这段代码是制作热词图的，用到了以下技术：

jieba，把文本分词

wordcloud，制作热图

chardet，辨别文件的编码格式，其中中文统一为GB18030，更加的兼容

imageio，提取图片的形状

其他：自动识别文件编码，自动识别txt文件，图片文件名与txt文件一致，使用的是四大名著的文本（自行百度），部分中国地图

上代码：

import os

import jieba

import wordcloud

import chardet

import imageio

directory = "D:\\"

mask = imageio.imread(r"D:\map.jpg")  # 用于最后图像图形

directory_lists = os.scandir(directory)

for directory_list in directory_lists:

    if directory_list.is_dir() or directory_list.path.split('.')[-1] != "txt":

        continue

    with open(directory_list.path, 'rb') as fd:

        coding = chardet.detect(fd.read()[:1000])['encoding']

        if coding.upper() == 'GB2312' or coding == 'GBK':

            coding = 'GB18030'

    file = open(directory_list.path, 'r', encoding=coding)

    text = file.read()

    file.close()

    jieba_text = ' '.join(jieba.lcut(text))

    w = wordcloud.WordCloud(height=800, width=1600, font_path='msyh.ttc', background_color='white', stopwords={'Page'}, mask=mask)

    w.generate(jieba_text)

    w.to_file('{}.png'.format(directory_list.path.split('.')[0]))

输出：

仔细看输出的内容，还是挺有意思的，哈哈哈。

Python - 利用词云wordcloud，jieba和中国地图制作四大名著的热词图的更多相关文章

scrapy-redis爬取豆瓣电影短评，使用词云wordcloud展示
1.数据是使用scrapy-redis爬取的,存放在redis里面,爬取的是最近大热电影<海王> 2.使用了jieba中文分词解析库 3.使用了停用词stopwords,过滤掉一些无意义的 ...
词云wordcloud类介绍&python制作词云图&词云图乱码问题等小坑
词云图,大家一定见过,大数据时代大家经常见,我们今天就来用python的第三方库wordcloud,来制作一个大数据词云图,同时会降到这个过程中遇到的各种坑, 举个例子,下面是我从自己的微信上抓的微信 ...
词云wordcloud入门示例
整体简介: 词云图,也叫文字云,是对文本中出现频率较高的“关键词”予以视觉化的展现,词云图过滤掉大量的低频低质的文本信息,使得浏览者只要一眼扫过文本就可领略文本的主旨. 基于Python的词云生成类库 ...
python利用百度云接口实现车牌识别
一个小需求---实现车牌识别. 目前有两个想法调云在线的接口或者使用SDK做开发(配置环境和编译第三方库很麻烦,当然使用python可以避免这些问题) 自己实现车牌识别算法(复杂) ! 一开始准备使 ...
用Python制作中国地图、地球平面图及球形图
绘制地图在python中主要用到的 basemap 库,这个库是 matplotlib 库中一个用于在 Python 中绘制地图上的 2D 数据的工具包. 首先安装库: 1.安装 geos 库:Pyt ...
词云-wordcloud
import jiebabook = "2015.txt"txt = open(book).read()ex = {'不是','就是','的话','1.1','docin','ww ...
使用jieba和wordcloud进行中文分词并生成《悲伤逆流成河》词云
因为词云有利于体现文本信息,所以我就将那天无聊时爬取的<悲伤逆流成河>的评论处理了一下,生成了词云. 关于爬取影评的爬虫大概长这个样子(实际上是没有爬完的): #!/usr/bin/env ...
wordcloud + jieba 生成词云
利用jieba库和wordcloud生成中文词云. jieba库:中文分词第三方库分词原理: 利用中文词库,确定汉字之间的关联概率,关联概率大的生成词组三种分词模式: 1.精确模式:把文本精确的切 ...
Java爬取B站弹幕 —— Python云图Wordcloud生成弹幕词云
一 . Java爬取B站弹幕弹幕的存储位置如何通过B站视频AV号找到弹幕对应的xml文件号首先爬取视频网页,将对应视频网页源码获得就可以找到该视频的av号aid=8678034 还有弹幕序号, ...

随机推荐

.Net Web Api返回Json数据中原对象变量名大小写问题
这两天在工作中使用SignalR的WebSocket做数据实时传递的功能开发,在后端主动向前端广播数据以Json传递时,前端获取的Json中对应类的变量名首字母默认传递的是大写.而前端一直获取到的后台 ...
延时对象promise的使用
promise是ES6(ECMA Script6)的新标准,只能在支持ES6的浏览器中使用 Promise是一个延时对象,创建延时对象时需要传入一个函数类型的参数这个函数有两个参数:resolve和 ...
Aircoinst 三层架构ASP.NET开源
<注意! 本源码为我本人所写,可能有点烂.仅供学习使用,请勿进行商业用途~!> <本源码永久归于MineLSG 及 Aircoinst_慈所拥有> 使用方法:直接拷贝一.结 ...
python中的两个高阶函数map（）和reduce（）
1.map()传入的有两个参数,函数和可迭代对象(Itreable),map()是把传入的函数依次作用于序列的每个元素,结果返回的是一个新的可迭代对象(Iterable). map()代码如下: # ...
新建基于STM32F103ZET6的工程-HAL库版本
1.STM32F103ZET6简介 STM32F103ZET6的FLASH容量为512K,64K的SRAM.按照STM32芯片的容量产品划分,STM32F103ZET6属于大容量的芯片. 2.下载HA ...
js实现多级联动
<head> <meta http-equiv="Content-Type" content="text/html; charset=utf-8&quo ...
Nordic nRF52820超低功耗蓝牙5.2 SoC芯片-低端无线连接方案首选
nRF52820是功耗超低的低功耗蓝牙 (Bluetooth Low Energy /Bluetooth LE).蓝牙mesh.Thread.Zigbee和2.4 GHz专有低端无线连接解决方案.nR ...
《mysql 必知必会》速查指南
目录增添加一整行插入多行删删除指定行删除所有行改查简单检索结果筛选结果排序结果过滤创建字段处理函数数据分组其他高级用法文章内容均出自 <MySQL 必知必会&g ...
【memcache】Memcached
一.Memcached 简介 1. 官网:http://www.memcached.org 2. Memcached是一个自由开源的,高性能,分布式内存对象缓存系统. 二.作用: 1. 将数据存入内存 ...
mysql 聚集函数 count 使用详解
mysql 聚集函数 count 使用详解本文将探讨以下问题 1.count(*) . count(n).count(null)与count(fieldName) 2.distinct 与 coun ...

Python - 利用词云wordcloud，jieba和中国地图制作四大名著的热词图

Python - 利用词云wordcloud，jieba和中国地图制作四大名著的热词图的更多相关文章

随机推荐

热门专题