20200311_最新爬取mzitu

废话不多, 直接上代码, python3.6:

import requests

from bs4 import BeautifulSoup

import os

import time;

import random

#pip install BeautifulSoup4 -i  https://pypi.douban.com/simple

#pip install requests -i  https://pypi.douban.com/simple

# http请求头

Hostreferer = {

    'Referer': 'http://www.mzitu.com',

    'Upgrade-Insecure-Requests': '1',

    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'

}

# 此请求头Referer破解盗图链接

Picreferer = {

    # 'User-Agent': 'Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1)',

    # 'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3679.0 Safari/537.36',

    # 'Referer': 'http://i.meizitu.net',

    # https://www.mzitu.com/224497/3

    'Referer': 'http://www.mzitu.com',

    'Upgrade-Insecure-Requests': '1',

    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'

}

all_url = 'https://www.mzitu.com'

# 对mzitu主页all_url发起请求，将返回的HTML数据保存，便于解析

start_html = requests.get(all_url, headers=Hostreferer)

soup = BeautifulSoup(start_html.text, "html.parser") # 缩进格式

page = soup.find_all('a', class_='page-numbers')

# 最大页数

max_page = page[-2].text

for n in range(1, int(max_page) + 1):

    path = 'D:/mzitu/' #存储路径

    all_url = 'https://www.mzitu.com' #重新赋值

    if n!=1:

        all_url=  all_url+"/page/"+str(n)+"/";

    print('开始爬第 %s 页, 网址是 %s' % (n , all_url))

    start_html = requests.get(all_url, headers=Hostreferer);

    soup = BeautifulSoup(start_html.text, "html.parser")

#    alt =  soup.find(id='pins').find_all('a', target='_blank').find_all('img',class_='lazy').get('alt');

    hrefs = soup.find(id='pins').find_all('a', target='_blank'); #根据ID找

    for href in hrefs:

        imgs = href.find('img',class_='lazy');

        if imgs == None:

            break;

        alt = imgs.get('alt');

        url = href.get('href');

        start_html2 = requests.get(url, headers=Hostreferer);

        soup2 = BeautifulSoup(start_html2.text, "html.parser")  # 缩进格式

        page2 = soup2.find('div', class_='pagenavi').find_all('a');

        # print (page2[0])

        max_page2 = page2[-2].text;

        path = path + alt.strip().replace('?', '');

        if (os.path.exists(path)):

            pass

            # print('目录已存在')

        else:

            os.makedirs(path)

        for m in range(1,int(max_page2)):

            time.sleep(random.randint(1,5))

            # alt = href.find('img', class_='lazy').get('alt');

            # url = href.get('href');

            url3 = url+'/'+str(m)+'/'

            print('开始爬→%s' % url3)

            start_html3 = requests.get(url3, headers=Hostreferer);

            soup3 = BeautifulSoup(start_html3.text, "html.parser")  # 缩进格式

            picSrc = soup3.find('div', class_='main-image').find('a').find('img').get('src');#.get('src');#.get('src'); #div class="main-image"

            # imglist = #获取当前页上所有的子连接, 不包含class="box"

            html = requests.get(picSrc, headers=Picreferer)

            # 提取图片名字

            file_name = path+'/'+picSrc.split(r'/')[-1];

            # 保存图片

            f = open(file_name, 'wb')

            f.write(html.content)

            f.close()

            print('图片保存到%s' % file_name);

20200311_最新爬取mzitu的更多相关文章

java爬虫系列第二讲-爬取最新动作电影《海王》迅雷下载地址
1. 目标使用webmagic爬取动作电影列表信息爬取电影<海王>详细信息[电影名称.电影迅雷下载地址列表] 2. 爬取最新动作片列表获取电影列表页面数据来源地址访问http:// ...
python利用requests和threading模块，实现多线程爬取电影天堂最新电影信息。
利用爬到的数据,基于Django搭建的一个最新电影信息网站: n1celll.xyz (用的花生壳动态域名解析,服务器在自己的电脑上,纯属自娱自乐哈.) 今天想利用所学知识来爬取电影天堂所有最新电影 ...
scrapy实战--爬取最新美剧
现在写一个利用scrapy爬虫框架爬取最新美剧的项目. 准备工作: 目标地址:http://www.meijutt.com/new100.html 爬取项目:美剧名称.状态.电视台.更新时间 1.创建 ...
python爬取斗图网中的 “最新套图”和“最新表情”
1.分析斗图网斗图网地址:http://www.doutula.com 网站的顶部有这两个部分: 先分析“最新套图” 发现地址栏变成了这个链接,我们在点击第二页可见,每一页的地址栏只有后面的pag ...
scrapy 动态网页处理——爬取鼠绘海贼王最新漫画
简介 scrapy是基于python的爬虫框架,易于学习与使用.本篇文章主要介绍如何使用scrapy爬取鼠绘漫画网海贼王最新一集的漫画. 源码参见:https://github.com/liudaol ...
利用python3 爬虫定制版妹子图mzitu爬取
在刚开始学爬虫的时候,用来练手的基础爬虫就是爬取各种妹子图片,前几天同时说了这个,便准备随便写一个...最后发现真是三天不练..什么都记不住了!!所以花了政治一天重新写了一个爬虫程序,并且支持按照时间 ...
requests结合xpath爬取豆瓣最新上映电影
# -*- coding: utf-8 -*- """ 豆瓣最新上映电影爬取 # ul = etree.tostring(ul, encoding="utf-8 ...
5分钟python爬虫案例，手把手教爬取国内外最新疫情历史数据
俗话说的好,“授之以鱼不如授之以渔”,所以小编今天就把爬疫情历史数据的方法分享给你们. 基本思路:分析腾讯新闻“抗肺炎”版块,采用“倒推法”找到疫情数据接口,然后用python模拟请求,进而保存疫情历 ...
python爬虫（正则取数据）读取表格内的基金代码后爬取基金最新净值，同时写到对应的表格中，基于最近一次购买净值计算出涨跌幅（名字有点长）
最近基金跌的真够猛,虽说是定投,但大幅度下跌,有时候适当的增加定投数也是降低平均成本的一种方式每天去看去算太费时间,写了个爬虫,让他自动抓数据后自动计算出来吧实现逻辑: 1.创建了一个excel表 ...

随机推荐

(C#2,.net framework2.0,Visual Studio 2003)之前版本
(C#2,.net framework2.0,Visual Studio 2003)之前版本归为最初的版本(主要是针对.net framework),其主要定义了最基本的类型.特性. 1.基本的类型 ...
1.使用javax.mail, spring的JavaMailSender,springboot发送邮件
一.java发邮件电子邮件服务器:这些邮件服务器就类似于邮局,它主要负责接收用户投递过来的邮件,并把邮件投递到邮件接收者的电子邮箱中,按功能划分有两种类型 SMTP邮件服务器:用户替用户发送邮件和接 ...
k8s event监控利器kube-eventer对接企微告警
背景监控是保障系统稳定性的重要组成部分,在Kubernetes开源生态中,资源类的监控工具与组件监控百花齐放. cAdvisor:kubelet内置的cAdvisor,监控容器资源,如容器cpu.内 ...
MySQL全面瓦解11：子查询和组合查询
概述子查询是SQL查询中的重要一块,是我们基于多表之间进行数据聚合和判断的一种手段,使得我们的处理复杂数据更加的便捷,这一节我们主要来了解一下子查询. 先做一下数据准备,这边建立三张表:班级.学生. ...
Netlink 内核实现分析 1
Netlink 是一种IPC(Inter Process Commumicate)机制,它是一种用于内核与用户空间通信的机制,在一般情况下,用户态和内核态通信会使用传统的Ioctl.sysfs属性文件 ...
Android 架构组件-Lifecycle、LiveData、ViewModel
Lifecycle Lifecycle组件包括LifecycleOwner.LifecleObserver,能方便监听Activity或者Fragment的生命周期. 步骤: 1.实现Lifecycl ...
ubuntu掉电出现检查文件系统的问题
修改: /etc/default/rcS FSCKFIX=no 为 FSCKFIX=yes 出现这个情况的原因是硬件时钟偏移了显示上次挂载根目录在未来时间. 写于: 2013年11月28日更新于: ...
MYSQL学习(三) --索引详解
创建高性能索引 (一)索引简介索引的定义索引,在数据结构的查找那部分知识中有专门的定义.就是把关键字和它对应的记录关联起来的过程.索引由若干个索引项组成.每个索引项至少包含两部分内容.关键字和关键 ...
kali linux与虚拟机Vmware安装vmware tools（主机与虚拟机的文件拖拽）
一.打开虚拟机任务栏"虚拟机"-----点击安装Vmware tools 二.回到开启的kali linux系统中,找到vmware tools CD文件夹,拖拽出文件中的压缩文件 ...
插件SimSynth合成器功能介绍
本章节采用图文结合的方式给大家介绍下电音编曲软件"水果"FL Studio中SimSynth合成器的功能介绍,感兴趣的朋友可以一起进来沟通交流哦. SimSynth插件是FL St ...

20200311_最新爬取mzitu

20200311_最新爬取mzitu的更多相关文章

随机推荐

热门专题