案例学python——案例一:抓图
最近项目不那么紧张,有时间来研究一下Python,先前断断续续的自学了一段时间,有些浅基础。刚好在码云上看到比较适合的案例,跟着案例再往前走一波。
案例一:爬虫抓图
开发工具:PyCharm 脚本语言:Python 3.7.1 开发环境:Win10 爬取网站:妹子图
# Win下直接装的 python3
pip install bs4、pip install requests
# Linux python2 python3 共存
pip3 install bs4、pip3 install requests pip list 查看库
导库说明
# 导入requests库 导入目的:负责发送网络请求
import requests
# 导入文件操作库OS 导入目的:读写
import os
# bs4全名BeautifulSoup,是编写python爬虫常用库之一,主要用来解析html标签。 性能据说可能差了点,入门级凑合着用吧。
import bs4
from bs4 import BeautifulSoup
# 基础类库
import sys
# Python 3.x 解决中文编码问题
import importlib
importlib.reload(sys)
先上源代码:
#coding=utf-8
#!/usr/bin/python
# 导入requests库
import requests
# 导入文件操作库
import os
import bs4
from bs4 import BeautifulSoup
import sys
import importlib
importlib.reload(sys) # 给请求指定一个请求头来模拟chrome浏览器
global headers
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36'}
# 爬图地址
mziTu = 'http://www.mzitu.com/'
# 定义存储位置
global save_path
save_path = 'G:\BeautifulPictures' # 创建文件夹
def createFile(file_path):
if os.path.exists(file_path) is False:
os.makedirs(file_path)
# 切换路径至上面创建的文件夹
os.chdir(file_path) # 下载文件
def download(page_no, file_path):
global headers
res_sub = requests.get(page_no, headers=headers)
# 解析html
soup_sub = BeautifulSoup(res_sub.text, 'html.parser')
# 获取页面的栏目地址
all_a = soup_sub.find('div',class_='postlist').find_all('a',target='_blank')
count = 0
for a in all_a:
count = count + 1
if (count % 2) == 0:
print("内页第几页:" + str(count))
# 提取href
href = a.attrs['href']
print("套图地址:" + href)
res_sub_1 = requests.get(href, headers=headers)
soup_sub_1 = BeautifulSoup(res_sub_1.text, 'html.parser')
# ------ 这里最好使用异常处理 ------
try:
# 获取套图的最大数量
pic_max = soup_sub_1.find('div',class_='pagenavi').find_all('span')[6].text
print("套图数量:" + pic_max)
for j in range(1, int(pic_max) + 1):
# print("子内页第几页:" + str(j))
# j int类型需要转字符串
href_sub = href + "/" + str(j)
print(href_sub)
res_sub_2 = requests.get(href_sub, headers=headers)
soup_sub_2 = BeautifulSoup(res_sub_2.text, "html.parser")
img = soup_sub_2.find('div', class_='main-image').find('img')
if isinstance(img, bs4.element.Tag):
# 提取src
url = img.attrs['src']
array = url.split('/')
file_name = array[len(array)-1]
# print(file_name)
# 防盗链加入Referer
headers = {'Referer': href}
img = requests.get(url, headers=headers)
# print('开始保存图片')
f = open(file_name, 'ab')
f.write(img.content)
# print(file_name, '图片保存成功!')
f.close()
except Exception as e:
print(e) # 主方法
def main():
res = requests.get(mziTu, headers=headers)
# 使用自带的html.parser解析
soup = BeautifulSoup(res.text, 'html.parser')
# 创建文件夹
createFile(save_path)
# 获取首页总页数
img_max = soup.find('div', class_='nav-links').find_all('a')[3].text
# print("总页数:"+img_max)
for i in range(1, int(img_max) + 1):
# 获取每页的URL地址
if i == 1:
page = mziTu
else:
page = mziTu + 'page/' + str(i)
file = save_path + '\\' + str(i)
createFile(file)
# 下载每页的图片
print("套图页码:" + page)
download(page, file) if __name__ == '__main__':
main()
代码分析:
if __name__ == '__main__':
main()
这段代码啥意思呢?
if __name__ == '__main__'的意思是:当.py文件被直接运行时,if __name__ == '__main__'之下的代码块将被运行;当.py文件以模块形式被导入时,if __name__ == '__main__'之下的代码块不被运行。
如果没有这段代码 主方法main()也就无法被直接运行,可以简单先理解为启动主方法的入口。
然后我们再看主方法
# 主方法
def main():
res = requests.get(mziTu, headers=headers)
// 我们可以从这个对象res中获取所有我们想要的信息 下行res.text 就是当前页面的html信息 具体看对应API
# 使用自带的html.parser解析
soup = BeautifulSoup(res.text, 'html.parser')
//html字符串创建BeautifulSoup对象 此处可以soup.title soup.title.name soup.title.string soup.a['href'] soup.p['class'] 不嫌事多,你可以打印出来看看,具体看对应API
# 创建文件夹
createFile(save_path) //创建目标文件夹,作用当然用来存爬到的资源
# 获取首页总页数
img_max = soup.find('div', class_='nav-links').find_all('a')[3].text
# print("总页数:"+img_max)
for i in range(1, int(img_max) + 1):
# 获取每页的URL地址
if i == 1:
page = mziTu
else:
page = mziTu + 'page/' + str(i)
file = save_path + '\\' + str(i)
createFile(file)
# 下载每页的图片
print("套图页码:" + page)
download(page, file)
核心代码
res = requests.get(mziTu, headers=headers)
soup = BeautifulSoup(res.text, 'html.parser')以上两段代码我们基本上拿到了以下html信息的全部
# 获取首页总页数
img_max = soup.find('div', class_='nav-links').find_all('a')[3].text
第一步:soup.find('div',class='nav-links')取到class='nav-links'的div
第二步:.find_all('a') 在该div内取全部的<a></a>标签 为一个数组
第三步:.find_all('a')[3] 取第四个<a></a>标签 数组下标从0开始
第四步:.find_all('a')[3].text 取得页码总数 也就是 200
for i in range(1, int(img_max) + 1):
# 获取每页的URL地址
if i == 1:
page = mziTu
else:
page = mziTu + 'page/' + str(i)
file = save_path + '\\' + str(i)
createFile(file)
# 下载每页的图片
print("套图页码:" + page)
download(page, file)
这段理解起来很简单
第一步:创建存放文件夹 此处save_path="G:\BeautifulPictures\num" num=[1,200] 程序运行后,此目录有源源不断的图片纷至杳来。
第二步:拼接源文件(每一张图片)路径?目标是此,但此处具体到每一页(路径是:http://www.mzitu.com/page/num num=[1,200]),还没深入到每一个专题。要想具体到每一张只能继续往下爬,此处可移步download(page,file)方法。 例如现在num=4 经过download()方法就可以具体到每一张图片了 下面分析download()方法
# 下载文件
def download(page_no, file_path):
global headers
res_sub = requests.get(page_no, headers=headers)
# 解析html
soup_sub = BeautifulSoup(res_sub.text, 'html.parser')
# 获取页面的栏目地址
all_a = soup_sub.find('div',class_='postlist').find_all('a',target='_blank')
count = 0
for a in all_a:
count = count + 1
if (count % 2) == 0:
print("内页第几页:" + str(count))
# 提取href
href = a.attrs['href']
print("套图地址:" + href)
res_sub_1 = requests.get(href, headers=headers)
soup_sub_1 = BeautifulSoup(res_sub_1.text, 'html.parser')
# ------ 这里最好使用异常处理 ------
try:
# 获取套图的最大数量
pic_max = soup_sub_1.find('div',class_='pagenavi').find_all('span')[6].text
print("套图数量:" + pic_max)
for j in range(1, int(pic_max) + 1):
# print("子内页第几页:" + str(j))
# j int类型需要转字符串
href_sub = href + "/" + str(j)
print(href_sub)
res_sub_2 = requests.get(href_sub, headers=headers)
soup_sub_2 = BeautifulSoup(res_sub_2.text, "html.parser")
img = soup_sub_2.find('div', class_='main-image').find('img')
if isinstance(img, bs4.element.Tag):
# 提取src
url = img.attrs['src']
array = url.split('/')
file_name = array[len(array)-1]
# print(file_name)
# 防盗链加入Referer
headers = {'Referer': href}
img = requests.get(url, headers=headers)
# print('开始保存图片')
f = open(file_name, 'ab')
f.write(img.content)
# print(file_name, '图片保存成功!')
f.close()
except Exception as e:
print(e)
假设num=4 ,此时
page_no='http://www.mzitu.com/page/4'
经过request.get(),发送get请求,再被BeautifulSoup解析我们就拿到了下面的html代码
res_sub = requests.get(page_no, headers=headers)
# 解析html
soup_sub = BeautifulSoup(res_sub.text, 'html.parser')
然后我们很容易看到我们的目标文件是,id='pins'下的所有<a></a>标签,如下图。此herf只具体到每一个小姐姐的第一张照片,还不能具体到小姐姐的每一张照片。没关系,点击链接进去,再看看。
此时我们再看
再扒一层就到具体的每一张图片的地址了,读一波,写一波f.write(img.content),一波走起,保存本地,
然后看本地的战利品:请爱惜自己的身体
个人小小的赶脚,爬虫抓包,找到你需要下载的每一个路径,一步步去按标签爬,保存本地。貌似也挺简单的哈。第一次跑Python代码,不好的地方见笑。
源代码码云地址:https://gitee.com/52itstyle/Python 感兴趣的一起学一波,组个队。
补充:如果是Python2.7版本的话
import importlib
importlib.reload(sys)
替换成下面的导入可解决Python版本不同导致的编码问题
import imp
imp.reload(sys)
sys.setdefaultencoding('utf8')
案例学python——案例一:抓图的更多相关文章
- 案例学python——案例三:豆瓣电影信息入库
闲扯皮 昨晚给高中的妹妹微信讲题,函数题,小姑娘都十二点了还迷迷糊糊.今天凌晨三点多,被连续的警报声给惊醒了,以为上海拉了防空警报,难不成地震,空袭?难道是楼下那个车主车子被堵了,长按喇叭?开窗看看, ...
- 案例学python——案例二:连接数据库MySql
调侃的话:案例一跑完之后,欣赏把玩了一番.人就有点飘飘然,昨天除了做饭吃饭,就是玩三国杀,江郎才尽,今天周一,不飘了,敲点代码,看看Python操作数据库有啥不一样的. 前期准备: 1.数据库 电脑上 ...
- 获取字段唯一值工具- -ArcPy和Python案例学习笔记
获取字段唯一值工具- -ArcPy和Python案例学习笔记 目的:获取某一字段的唯一值,可以作为工具使用,也可以作为函数调用 联系方式:谢老师,135-4855-4328,xiexiaokui# ...
- 14.python案例:爬取电影天堂中所有电视剧信息
1.python案例:爬取电影天堂中所有电视剧信息 #!/usr/bin/env python3 # -*- coding: UTF-8 -*- '''======================== ...
- 第7.27节 Python案例详解: @property装饰器定义属性访问方法getter、setter、deleter
上节详细介绍了利用@property装饰器定义属性的语法,本节通过具体案例来进一步说明. 一. 案例说明 本节的案例是定义Rectangle(长方形)类,为了说明问题,除构造函数外,其他方法都只 ...
- 第7.25节 Python案例详解:使用property函数定义与实例变量同名的属性会怎样?
第7.25节 Python案例详解:使用property函数定义与实例变量同名的属性会怎样? 一. 案例说明 我们上节提到了,使用property函数定义的属性不要与类内已经定义的普通实例变量重 ...
- 第7.24节 Python案例详解:使用property函数定义属性简化属性访问代码实现
第7.24节 Python案例详解:使用property函数定义属性简化属性访问代码实现 一. 案例说明 本节将通过一个案例介绍怎么使用property定义快捷的属性访问.案例中使用Rectan ...
- 基于python做的抓图程序1.0.00版本
#coding=gbkimport urllibimport urllib2import reimport osimport time# import readline def getHtml(url ...
- python案例:使用if语句实现一个猜拳游戏
任务要求: 在控制台中提示输入石头.剪刀.布,按回车键,然后给出游戏结果. 分析: 我们知道在游戏规则中,石头克剪刀,剪刀克布,布克石头.但是这在计算机中并不是很好直接的表示,因此我们分别用0.1.2 ...
随机推荐
- LDA背景资料
[https://zhuanlan.zhihu.com/p/30226687] LDA模型的前世今生 在文本挖掘中,有一项重要的工作就是分析和挖掘出文本中隐含的结构信息,而不依赖任何提前标注的信息.L ...
- 简述 Spring Cloud 是什么2
一.概念定义 Spring Cloud是一个微服务框架,相比Dubbo等RPC框架, Spring Cloud提供的全套的分布式系统解决方案. Spring Cloud对微服务基础框架Ne ...
- 谷歌浏览器javascript错误提示插件
JavaScript-Errors-Notifier_v2.1.7 下载地址 安装方法: http://chromecj.com/utilities/2014-09/181.html 设置方式:
- 4.3Python数据类型(3)之字符串类型
返回总目录 目录: 1.字符串的概念 2.字符串的形式 3.字符串的转义符 4.字符串一般操作 5.字符串函数操作 (一)字符串的概念 由单个字符组成的一个集合 (二)字符串的形式 双引号与单引号的效 ...
- iOS解析XML实现省市区选择
1.具体内容就不再赘述了.直接看关键代码. viewController.h // // ViewController.h // ParseXmlToRealizeChooseCityDemo // ...
- Spring AOP的实现研究
1. 背景 在前文Spring IOC容器创建bean过程浅析已经介绍了Spring IOC创建初始化bean的大致过程.现在对Spring的AOP实现机制进行研究分析. 2. 名词与概念 名词 概念 ...
- BZOJ1023:[SHOI2008]cactus仙人掌图(圆方树,DP,单调队列)
Description 如果某个无向连通图的任意一条边至多只出现在一条简单回路(simple cycle)里,我们就称这张图为仙人掌图(cactus). 所谓简单回路就是指在图上不重复经过任何一个顶点 ...
- go标准库的学习-strings-字符串操作
参考https://studygolang.com/pkgdoc 导入方式: import "strings" strings包实现了用于操作字符的简单函数. 常用的几个函数: f ...
- nginx和php-fpm调用方式
一.背景: 在开发中碰到一个问题,项目以nginx+php-fpm形式访问交互,结果访问项目时报错如下图: 二.分析: 提示很明确嘛,去看error.log(在nginx.conf或者vhost里 ...
- ubuntu16.04下zabbix安装和配置
介绍 Zabbix是用于网络和应用的开源监控软件. 它提供从服务器,虚拟机和任何其他类型的网络设备收集的数千个度量的实时监控. 这些指标可以帮助您确定IT基础架构的当前运行状况,并在客户投诉之前检测硬 ...