一、上节课回顾

(一)数据类型

对世间万物的状态分类

(1)数字类型

1. 整形int

2. 浮点型float

(2)字符串类型str

索引取值/索引切片

startswith()以开始

endswith()以结尾

join()以字符串的内容拼接列表内的元素

(3)列表类型list

索引取值/索引修改/索引切片

append()往后加值

del 按索引删除值

(4)字典类型dict

{}内逗号隔开多个键(一般为字符串)值(任意数据类型)对(对应)

按key取值/按key修改值/按key增加值

del 按key删除值

(二)jieba模块

作用:切割一段内容

(三)wordcloud模块

作用:生成词云图

二、文本处理

(一)什么是文本

:.txt .docx .md  .py .xml  .ini存储的是文字

对应的由视频/音频文件(多媒体文件)

(二)如何处理

  1. #打开文件的三种模式:r(只读不写),w(只写不读,清空文件),a(只写不读,追加)
  2. file_path = r'F:\预科班\day05\anhao.txt'
  3. f = open(file_path,'a',encoding = 'gbk')
  4. print(f.readable())#是否可读,如果是为ture

(三)文本高级

t和b模式(text和bytes)

音频/视频文件通过rb模式打开(读取二进制)

  1. f = open(r'F:\预科班\day05\anhao.txt','rb',encoding= 'utf8')
  2. data = f.read()
  3. print(data)
  4. f.close()

使用with open () as可以自动关闭文件

  1. with open (r'F:\预科班\day05\anhao.txt','r+',enconding = 'utf8') as f:
  2. data = f.read()
  3. print(data)

(四)文本处理+词云分析

  1. import jieba
  2. import imageio
  3. import wordcloud
  4. # 1. 读取文件内容
  5. with open(r'F:\预科班\day05\anhao.txt','r') as fr:
  6. # for i in range(1000):
  7. # fr.write('回家的诱惑,')
  8. # fr.flush() # 相当于保存
  9. data = fr.read()
  10. # 2. 使用结巴模块对文件内容切割
  11. # jieba.add_word('回家的诱惑') # 让"回家的诱惑"成为一个单词
  12. # jieba.del_word('女士')
  13. # jieba.del_word('先生')
  14. data_list = jieba.lcut(data)
  15. data = ' '.join(data_list)
  16. # 3. 找到一张的图片
  17. img = imageio.imread(r'F:\预科班\day05\nini.jpg')
  18. # 4. 使用词云模块生成词云
  19. w = wordcloud.WordCloud(background_color='white',mask=img,font_path=r'C:\Windows\Fonts\simsun.ttc',max_words=150)
  20. w.generate(data)
  21. w.to_file('weixiao.png')

day05整理的更多相关文章

  1. Java 复习整理day05

    1 package com.it.demo01_oop; 2 3 import java.util.Arrays; 4 5 /* 6 案例: 演示面向过程和面向对象代码的区别 7 8 面向过程编程思想 ...

  2. dotNET跨平台相关文档整理

    一直在从事C#开发的相关技术工作,从C# 1.0一路用到现在的C# 6.0, 通常情况下被局限于Windows平台,Mono项目把我们C#程序带到了Windows之外的平台,在工作之余花了很多时间在M ...

  3. UWP学习目录整理

    UWP学习目录整理 0x00 可以忽略的废话 10月6号靠着半听半猜和文字直播的补充看完了微软的秋季新品发布会,信仰充值成功,对UWP的开发十分感兴趣,打算后面找时间学习一下.谁想到学习的欲望越来越强 ...

  4. SQL Server 常用内置函数(built-in)持续整理

    本文用于收集在运维中经常使用的系统内置函数,持续整理中 一,常用Metadata函数 1,查看数据库的ID和Name db_id(‘DB Name’),db_name('DB ID') 2,查看对象的 ...

  5. kafka学习笔记:知识点整理

    一.为什么需要消息系统 1.解耦: 允许你独立的扩展或修改两边的处理过程,只要确保它们遵守同样的接口约束. 2.冗余: 消息队列把数据进行持久化直到它们已经被完全处理,通过这一方式规避了数据丢失风险. ...

  6. JAVA程序员常用软件整理下载

    ********为了大家学习方便,特意整理软件下载如下:*************Java类软件:-------------------------------JDK7.0:http://pan.ba ...

  7. js数组学习整理

    原文地址:js数组学习整理 常用的js数组操作方法及原理 1.声明数组的方式 var colors = new Array();//空的数组 var colors = new Array(3); // ...

  8. GJM : C#设计模式汇总整理——导航 【原创】

    感谢您的阅读.喜欢的.有用的就请大哥大嫂们高抬贵手"推荐一下"吧!你的精神支持是博主强大的写作动力以及转载收藏动力.欢迎转载! 版权声明:本文原创发表于 [请点击连接前往] ,未经 ...

  9. 整理下.net分布式系统架构的思路

    最近看到有部分招聘信息,要求应聘者说一下分布式系统架构的思路.今天早晨正好有些时间,我也把我们实际在.net方面网站架构的演化路线整理一下,只是我自己的一些想法,欢迎大家批评指正. 首先说明的是.ne ...

随机推荐

  1. RestClient火狐接口测试

    一.RestClient的简单介绍 RESTClient是一款用于测试各种Web服务的插件,它可以向服务器发送各种HTTP请求(用户也可以自定义请求方式),并显示服务器响应.二.RESTClient的 ...

  2. Mybatis逆向工程过程中出现targetRuntime in context mybatisGenerator is invalid

    最开始设置的Mybatis,但是逆向工程准备就绪后出现问题 报错为targetRuntime in context mybatisGenerator is invalid 后来修改为Mybatis3能 ...

  3. Tomcat+Nginx+Linux+Mysql部署豆瓣TOP250的项目到腾讯云服务器

    写在前面 因为前面有写过一篇关于豆瓣的top250的电影的可视化展示项目,你可以移步http://blog.csdn.net/liuge36/article/details/78607955了解这个项 ...

  4. Airtest之web自动化(一)

    Airtest之web自动化(一) [此文档有许多涉及到gif动图的地方,请全屏观看]   了解Airtest: 简介: Airtest是由网易团队开发的一款自动化框架,前期运用与游戏测试(通过截图识 ...

  5. Unity - 存读档机制简析

    本文旨在于简要分析Unity中的两种存档机制,即:PlayerPrefs数据持久化方法及Serialization数据序列化方法 较比与源项目,我另加了JSON方法.XML方法等及一些Unity设置, ...

  6. 讨论c/c++计算小数的精度问题

    求出所有100以下整数与一位小数相乘等于相加的浮点数这个有Bug浮点数计算时精度会出现误差 除非使用非常精确的类型或限制浮点的位数 比如 #include <iostream> int m ...

  7. Flask基础(16)-->WTForms表单创建和简单验证

    Flask基础(16)-->WTForms表单创建和简单验证 前言:使用Flask_WTF需要配置参数SECRET_KEYCSRF_ENABLED是为了CSRF(跨站请求伪造)保护.SECRET ...

  8. Kafka 学习笔记之 Producer/Consumer (Scala)

    既然Kafka使用Scala写的,最近也在慢慢学习Scala的语法,虽然还比较生疏,但是还是想尝试下用Scala实现Producer和Consumer,并且用HashPartitioner实现消息根据 ...

  9. 分库分表(3) ---SpringBoot + ShardingSphere 实现读写分离

    分库分表(3)---ShardingSphere实现读写分离 有关ShardingSphere概念前面写了两篇博客: 1.分库分表(1) --- 理论 2. 分库分表(2) --- ShardingS ...

  10. Nullable Reference Types 可空引用类型

    在写C#代码的时候,你可能经常会遇到这个错误: 但如果想避免NullReferenceException的发生,确实需要做很多麻烦的工作. 可空引用类型 Null Reference Type 所以, ...