Python 3爬虫、数据清洗与可视化实战PDF高清完整版免费下载|百度云盘
百度云盘:Python 3爬虫、数据清洗与可视化实战PDF高清完整版免费下载
提取码:
内容简介
《Python 3爬虫、数据清洗与可视化实战》是一本通过实战教初学者学习采集数据、清洗和组织数据进行分析及可视化的Python 读物。《Python 3爬虫、数据清洗与可视化实战》案例均经过实战检验,笔者在实践过程中深感采集数据、清洗和组织数据的重要性,作为一名数据行业的“码农”,数据就是沃土,没有数据,我们将无田可耕。
《Python 3爬虫、数据清洗与可视化实战》共分11 章,6 个核心主题:其一是Python 基础入门,包括环境配置、基本操作、数据类型、语句和函数;其二是Python 爬虫的构建,包括网页结构解析、爬虫流程设计、代码优化、效率优化、容错处理、反防爬虫、表单交互和模拟页面点击;其三是Python 数据库应用,包括MongoDB、MySQL 在Python中的连接与应用;其四是数据清洗和组织,包括NumPy 数组知识、pandas 数据的读写、分组变形、缺失值异常值处理、时序数据处理和正则表达式的使用;其五是综合应用案例,帮助读者贯穿爬虫、数据清洗与组织的过程;最后是数据可视化,包括Matplotlib 和Pyecharts 两个库的使用,涉及饼图、柱形图、线图、
词云图、地图等图形,帮助读者进入可视化的殿堂。
《Python 3爬虫、数据清洗与可视化实战》以实战为主,适合Python 初学者及高等院校的相关专业学生,也适合Python 培训机构作为实验教材使用。
作者简介
零一
沐垚科技创始人,电商自媒体,资深数据分析师,8年电商从业经验,擅长Excel、Power BI、R、Python等工具,主要研究数据化运营、商业智能和人工智能在电商领域的应用,专注数据+电商的新零售服务。 出版《电商数据分析淘宝实战》《美丽的电商运营日记》《Excel BI 之道:从零开始学Power工具应用》《淘宝、天猫电商数据分析与挖掘实战》
目录
1.1 安装Python 环境 1
1.1.1 Python 3.6.2 安装与配置 1
1.1.2 使用IDE 工具——PyCharm 4
1.1.3 使用IDE 工具——Anaconda 4
1.2 Python 操作入门 6
1.2.1 编写第一个Python 代码 6
1.2.2 Python 基本操作 9
1.2.3 变量 10
1.3 Python 数据类型 10
1.3.1 数字 10
1.3.2 字符串 11
1.3.3 列表 13
1.3.4 元组 14
1.3.5 集合 15
1.3.6 字典 15
1.4 Python 语句与函数 16
1.4.1 条件语句 16
1.4.2 循环语句 16
1.4.3 函数 17
第2 章 写一个简单的爬虫 18
2.1 关于爬虫的合法性 18
2.2 了解网页 20
2.2.1 认识网页结构 21
2.2.2 写一个简单的HTML 21
2.3 使用requests 库请求网站 23
2.3.1 安装requests 库 23
2.3.2 爬虫的基本原理 25
2.3.3 使用GET 方式抓取数据 26
2.3.4 使用POST 方式抓取数据 27
2.4 使用Beautiful Soup 解析网页 30
2.5 清洗和组织数据 34
2.6 爬虫攻防战 35
第3 章 用API 爬取天气预报数据 38
3.1 注册免费API 和阅读技术文档 38
3.2 获取API 数据 40
3.3 存储数据到MongoDB 45
3.3.1 下载并安装MongoDB 45
3.3.2 在PyCharm 中安装Mongo Plugin 46
3.3.3 将数据存入MongoDB 49
3.4 MongoDB 数据库查询 52
第4 章 大型爬虫案例:抓取某电商网站的商品数据 55
4.1 观察页面特征和解析数据 55
4.2 工作流程分析 64
4.3 构建类目树 65
4.4 获取产品列表 68
4.5 代码优化 70
4.6 爬虫效率优化 74
4.7 容错处理 77
第5 章 Scrapy 爬虫 78
5.1 Scrapy 简介 78
5.2 Scrapy 安装 79
5.3 案例:用Scrapy 抓取股票行情 80
第6 章 Selenium爬虫 88
6.1 Selenium 简介 88
6.2 案例:用Selenium 抓取电商网站数据 90
第7 章 数据库连接和查询 100
7.1 使用PyMySQL 100
7.1.1 连接数据库 100
7.1.2 案例:某电商网站女装行业TOP100 销量数据 102
7.2 使用SQLAlchemy 104
7.2.1 SQLAlchemy 基本介绍 104
7.2.2 SQLAlchemy 基本语法 105
7.3 MongoDB 107
7.3.1 MongoDB 基本语法 107
7.3.2 案例:在某电商网站搜索“连衣裙”的商品数据 107
第8 章 NumPy 109
8.1 NumPy 简介 109
8.2 一维数组 110
8.2.1 数组与列表的异同 110
8.2.2 数组的创建 111
8.3 多维数组 111
8.3.1 多维数组的高效性能 112
8.3.2 多维数组的索引与切片 113
8.3.3 多维数组的属性 113
8.4 数组的运算 115
第9 章 pandas 数据清洗 117
9.1 数据读写、选择、整理和描述 117
9.1.1 从CSV 中读取数据 119
9.1.2 向CSV 写入数据 120
9.1.3 数据选择 120
9.1.4 数据整理 122
9.1.5 数据描述 123
9.2 数据分组、分割、合并和变形 124
9.2.1 数据分组 124
9.2.2 数据分割 127
9.2.3 数据合并 128
9.2.4 数据变形 134
9.2.5 案例:旅游数据的分析与变形 136
9.3 缺失值、异常值和重复值处理 140
9.3.1 缺失值处理 140
9.3.2 检测和过滤异常值 144
9.3.3 移除重复数据 147
9.3.4 案例:旅游数据的值检查与处理 149
9.4 时序数据处理 152
9.4.1 日期/时间数据转换 152
9.4.2 时序数据基础操作 153
9.4.3 案例:天气数据分析与处理 155
9.5 数据类型转换 158
9.6 正则表达式 160
9.6.1 元字符与限定符 161
9.6.2 案例:用正则表达式提取网页文本信息 162
第10 章 综合应用实例 164
10.1 按性价比给用户推荐旅游产品 164
10.1.1 数据采集 165
10.1.2 数据清洗、建模 169
10.2 通过热力图分析为用户提供出行建议 172
10.2.1 某旅游网站热门景点爬虫代码(qunaer_sights.py) 175
10.2.2 提取CSV 文件中经纬度和销量信息 178
10.2.3 创建景点门票销量热力地图HTML 文件 179
第11 章 数据可视化 182
11.1 matplotlib 183
11.1.1 画出各省份平均价格、各省份平均成交量柱状图 183
11.1.2 画出各省份平均成交量折线图、柱状图、箱形图和饼图 184
11.1.3 画出价格与成交量的散点图 185
11.2 pyecharts 186
11.2.1 Echarts 简介 186
11.2.2 pyecharts 简介 187
11.2.3 初识pyecharts,玫瑰相送 187
11.2.4 pyecharts 基本语法 188
11.2.5 基于商业分析的pyecharts 图表绘制 190
11.2.6 使用pyecharts 绘制其他图表 199
11.2.7 pyecharts 和Jupyter 203
Python 3爬虫、数据清洗与可视化实战PDF高清完整版免费下载|百度云盘的更多相关文章
- Python3网络爬虫开发实战PDF高清完整版免费下载|百度云盘
百度云盘:Python3网络爬虫开发实战高清完整版免费下载 提取码:d03u 内容简介 本书介绍了如何利用Python 3开发网络爬虫,书中首先介绍了环境配置和基础知识,然后讨论了urllib.req ...
- python网络爬虫实战PDF高清完整版免费下载|百度云盘|Python基础教程免费电子书
点击获取提取码:vg1y python网络爬虫实战帮助读者学习Python并开发出符合自己要求的网络爬虫.网络爬虫,又被称为网页蜘蛛,网络机器人,是一种按照一定的规则,自动地抓取互联网信息的程序或者脚 ...
- Python学习手册(第4版)PDF高清完整版免费下载|百度云盘
Python学习手册(第4版)PDF高清完整版免费下载|百度云盘 提取码:z6il 内容简介 Google和YouTube由于Python的高可适应性.易于维护以及适合于快速开发而采用它.如果你想要编 ...
- Python程序设计(第3版)PDF高清完整版免费下载|百度网盘
百度网盘:Python程序设计(第3版)PDF高清完整版免费下载 提取码:48u4 内容简介 本书是面向大学计算机科学专业第一门程的教材.本书以Python语言为工具,采用相当传统的方法,强调解决问题 ...
- Python网络数据采集PDF高清完整版免费下载|百度云盘
百度云盘:Python网络数据采集PDF高清完整版免费下载 提取码:1vc5 内容简介 本书采用简洁强大的Python语言,介绍了网络数据采集,并为采集新式网络中的各种数据类型提供了全面的指导.第 ...
- Python编程之美:最佳实践指南PDF高清完整版免费下载|百度云盘|Python新手到进阶
百度云盘:Python编程之美:最佳实践指南PDF高清完整版免费下载 提取码:1py6 内容简介 <Python编程之美:最佳实践指南>是Python用户的一本百科式学习指南,由Pytho ...
- Python快速入门PDF高清完整版免费下载|百度云盘
百度云盘:Python快速入门PDF高清完整版免费下载 提取码:w5y8 内容简介 这是一本Python快速入门书,基于Python 3.6编写.本书分为4部分,第一部分讲解Python的基础知识,对 ...
- Python性能分析与优化PDF高清完整版免费下载|百度云盘
百度云盘|Python性能分析与优化PDF高清完整版免费下载 提取码:ubjt 内容简介 全面掌握Python代码性能分析和优化方法,消除性能瓶颈,迅速改善程序性能! 对于Python程序员来说,仅仅 ...
- Python基础教程(第3版)PDF高清完整版免费下载|百度云盘
百度云盘:Python基础教程(第3版)PDF高清完整版免费下载 提取码:gkiy 内容简介 本书包括Python程序设计的方方面面:首先从Python的安装开始,随后介绍了Python的基础知识和基 ...
随机推荐
- 多图解释Redis的整数集合intset升级过程
redis源码分析系列文章 [Redis源码系列]在Liunx安装和常见API 为什么要从Redis源码分析 String底层实现——动态字符串SDS 双向链表都不懂,还说懂Redis? 面试官:说说 ...
- MongoDB快速入门教程 (1)
1.MongoDB初识 1.1.MongoDB是什么? MongoDB是一个基于分布式文件存储的数据库.由C++语言编写.旨在为WEB应用提供可扩展的高性能数据存储解决方案. MongoDB是一个介于 ...
- 部署JUnit
JUnit的简介和使用:http://blog.csdn.net/luanlouis/article/details/37562165 jar包下载地址:http://www.java2s.com/C ...
- python编码--解码
在py3中只有两种数据类型:str bytes str: 存unicode(万国码)编码--全球通用的 bytes:存的是16进制的 1.str s='ehllo 丽庆' --->它存在内 ...
- Electron 初识-搭建一个简易桌面应用
Electron 快速入门 简介 Electron 可以让你使用纯 JavaScript 调用丰富的原生 APIs 来创造桌面应用.你可以把它看作是专注于桌面应用而不是 web 服务器的,io.j ...
- Netty系列之源码解析(一)
本文首发于微信公众号[猿灯塔],转载引用请说明出处 接下来的时间灯塔君持续更新Netty系列一共九篇 当前:Netty 源码解析(一)开始 Netty 源码解析(二): Netty 的 Channel ...
- css3 自定义字体_使用@font-face方式实现个性化字体
当我们在浏览一些网站时发现,里面含有一些十分个性的字体,这些字体并不是我们电脑上安装的字体.那么css是如何实现自定义字体的呢? 资源网站大全https://55wd.com 在css3中可以通过@f ...
- 移动端Retina屏boder 1px显示为2px或3px的解决方法
我们在开发移动端web项目时经常遇到设置border:1px,但是显示的边框却为2px或是3px粗细,这是因为设备像素比devicePixelRatio为2或3引起的. 何为“设备像素比deviceP ...
- 转载--- 写给Node.js学徒的7个建议
贴士 1: 在开发环境使用nodemon,在生产环境使用pm2 当你第一次开发Node.js应用的时候, 其中一件事情就是一次又一次的运行[file].js 就和揭伤疤一样. 当我第一次开发的node ...
- 手把手教你玩转Git
文章已托管到GitHub,大家可以去GitHub查看下载!并搜索关注微信公众号 码出Offer 领取各种学习资料! 微信公众号码出Offer Git应用 一.初识Git 1.1 Git的简史 同生活中 ...