python 爬虫糗百成人

import urllib

from time import sleep

import requests

from lxml import etree

try:

    def all_links(url,page):

        # if "900.html" in url:

        #     print("结束");

        #     return None

        url = url + str(page) + ".html";

        response = requests.get(url)

        print(url, response.status_code)

        html = etree.HTML(response.content.decode('gbk'))

        ## 获取图片 并且保存

        imgs = html.xpath('.//div[@id="wrapper"]//div[@class="ui-module"]//img/@src')

        for img in imgs:

            file_name = img.split('/')[-1]

            first = img.split('/')[0]

            if first != 'http:' and first != 'https:':

                print("错误图片"+img)

            else:

                dir_path = "/www/spider/images/"

                try:

                    file_content = requests.get(img)

                    if file_content.status_code != 200:

                        print(img,"下载失败")

                    else:

                        #urllib.request.urlretrieve(img, dir_path + file_name)

                        with open(dir_path+file_name,"wb") as f:

                            f.write(file_content.content)

                            print("保存图片" + dir_path + file_name + "成功")

                except Exception as ee:

                    print(str(ee))

        # links = html.xpath('.//div[@class="page"]//a[contains(text(),"下一页")]/@href')

        # print(links)

        # if len(links) < 1:

        #     pass

        # else:

        sleep(1)

        host = 'http://www.qiubaichengren.net/'

        next_page = page + 1

        all_links(host,next_page)

    for i in range(1,991):

        all_links("http://www.qiubaichengren.net/",354)

except Exception as e:

    print(str(e))

循环的版本

import urllib
from time import sleep

import requests
from lxml import etree

try:
    def all_links(url):
        if "100.html" in url:
            print("结束");
            return None
        response = requests.get(url)
        print(url, response.status_code)
        html = etree.HTML(response.content.decode('gbk'))
        ## 获取图片 并且保存
        imgs = html.xpath('.//div[@id="wrapper"]//div[@class="ui-module"]//img/@src')
        for img in imgs:
            file_name = img.split('/')[-1]
            first = img.split('/')[0]
            if first != 'http:' and first != 'https:':
                print("错误图片"+img)
            else:
                dir_path = "d:\\www\\spider\\images\\"
                urllib.request.urlretrieve(img, dir_path + file_name)
                print("保存图片" + dir_path + file_name + "成功")
        links = html.xpath('.//div[@class="page"]//a[contains(text(),"下一页")]/@href')
        print(links)
        if len(links) < 1:
            pass
        else:
            sleep(5)
            host = 'http://www.qiubaichengren.net/'
            new_url = host + links[0];
            all_links(new_url)
    all_links("http://www.qiubaichengren.net/8.html")
except Exception as e:
    print(str(e))

python 爬虫糗百成人的更多相关文章

Python爬虫实例：糗百
看了下python爬虫用法,正则匹配过滤对应字段,这里进行最强外功:copy大法实践一开始是直接从参考链接复制粘贴的,发现由于糗百改版导致失败,这里对新版html分析后进行了简单改进,把整理过程记录 ...
Python爬虫学习：四、headers和data的获取
之前在学习爬虫时,偶尔会遇到一些问题是有些网站需要登录后才能爬取内容,有的网站会识别是否是由浏览器发出的请求. 一.headers的获取就以博客园的首页为例:http://www.cnblogs.c ...
Python爬虫——Python 岗位分析报告
前两篇我们分别爬取了糗事百科和妹子图网站,学习了 Requests, Beautiful Soup 的基本使用.不过前两篇都是从静态 HTML 页面中来筛选出我们需要的信息.这一篇我们来学习下如何来获 ...
python 爬虫（转，我使用的python3）
原文地址:http://blog.csdn.net/pi9nc/article/details/9734437 [Python]网络爬虫(一):抓取网页的含义和URL基本构成分类: 爬虫 Pyt ...
Python爬虫(一)爬百度贴吧
简单的GET请求: # python2 import urllib2 response = urllib2.urlopen('http://www.baidu.com') html = respons ...
Python 爬虫模拟登陆知乎
在之前写过一篇使用python爬虫爬取电影天堂资源的博客,重点是如何解析页面和提高爬虫的效率.由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了 ...
python爬虫成长之路（一）：抓取证券之星的股票数据
获取数据是数据分析中必不可少的一部分,而网络爬虫是是获取数据的一个重要渠道之一.鉴于此,我拾起了Python这把利器,开启了网络爬虫之路. 本篇使用的版本为python3.5,意在抓取证券之星上当天所 ...
python爬虫学习(7) —— 爬取你的AC代码
上一篇文章中,我们介绍了python爬虫利器--requests,并且拿HDU做了小测试. 这篇文章,我们来爬取一下自己AC的代码. 1 确定ac代码对应的页面如下图所示,我们一般情况可以通过该顺序 ...
python爬虫学习(6) —— 神器 Requests
Requests 是使用 Apache2 Licensed 许可证的 HTTP 库.用 Python 编写,真正的为人类着想. Python 标准库中的 urllib2 模块提供了你所需要的大多数 H ...

随机推荐

Java核心技术36讲----------谈谈final、finally、finalize有什么不同
一.final 1.final修饰方法时,需要注意的点: #final修饰方法时,之前的第二个原因是效率.但是如果方法过于庞大,可能看不到内嵌调用带来的任何性能提升.在最近的Java版本中,不需要使用 ...
Spark运行模式_local（本地模式）
本地运行模式 (单机) 该模式被称为Local[N]模式,是用单机的多个线程来模拟Spark分布式计算,直接运行在本地,便于调试,通常用来验证开发出来的应用程序逻辑上有没有问题. 其中N代表可以使用N ...
JAVA8 Stream API的使用
/** * @auther hhh * @date 2018/12/31 12:48 * @description Stream流:用来处理数组.集合的API * 1.不是数据结构,没有内部存储(只是 ...
Maximum sum
描述 Given a set of n integers: A={a1, a2,-, an}, we define a function d(A) as below: t1 t2 d(A) = max ...
成都Uber优步司机奖励政策（2月16日）
滴快车单单2.5倍,注册地址:http://www.udache.com/ 如何注册Uber司机(全国版最新最详细注册流程)/月入2万/不用抢单:http://www.cnblogs.com/mfry ...
[Jmeter并发报错解决方案]org.apache.http.NoHttpResponseException: 10.0.4.147:8000 failed to respond
背景:公司模型框架是Nginx+uwsgi+Django+nginx,一开始使用Jmeter进行高并发请求测试,发现成功率只有50%,换用postman,成功率100%,代码进行高并发一样不会报错. ...
Android 模拟器下载、编译及调试
Android 模拟器源码下载 Android 模拟器源码的下载与 Android AOSP 源码库的下载过程类似,可以参考 Google 官方提供的 Android 源码下载文档来了解这个过程. ...
卸载Oracle 11g
卸载oracle只需要执行deinstall.ba即可运行.bat文件按照提示步骤进行卸载 .bat文件所在目录需要手动删除,需要在程序管理器里面关掉Oracle的进程,在删除当前文件夹
Ubuntu 14.04 登录界面添加 root账号
1打开终端输入:sudo gedit /usr/share/lightdm/lightdm.conf.d/50-ubuntu.conf 2在弹出的编辑框里加入:greeter-show-manual- ...
抓取Oracle数据快照
进入到oracle安装目录下的admin(找到这个目录)开启cmd键入sqlplus system/mima@实例名>@awrrpt.sql Would you like an HTML rep ...

python 爬虫 糗百成人

python 爬虫 糗百成人的更多相关文章

随机推荐

热门专题

python 爬虫糗百成人

python 爬虫糗百成人的更多相关文章