python爬虫获取下一页

from time import sleep

import faker

import requests

from lxml import etree

fake = faker.Faker()

base_url = "http://angelimg.spbeen.com"

def get_next_link(url):

    content = downloadHtml(url)

    html = etree.HTML(content)

    next_url = html.xpath("//a[@class='ch next']/@href")

    if next_url:

        return base_url + next_url[0]

    else:

        return False

def downloadHtml(ur):

    user_agent = fake.user_agent()

    headers = {'User-Agent': user_agent,"Referer":"http://angelimg.spbeen.com/"}

    response = requests.get(url, headers=headers)

    return response.text

def getImgUrl(content):

    html  = etree.HTML(content)

    img_url = html.xpath('//*[@id="content"]/a/img/@src')

    title = html.xpath(".//div['@class=article']/h2/text()")

    return img_url[0],title[0]

def saveImg(title,img_url):

    if img_url is not None and title is not None:

        with open("txt/"+str(title)+".jpg",'wb') as f:

            user_agent = fake.user_agent()

            headers = {'User-Agent': user_agent,"Referer":"http://angelimg.spbeen.com/"}

            content = requests.get(img_url, headers=headers)

            #request_view(content)

            f.write(content.content)

            f.close()

def request_view(response):

    import webbrowser

    request_url = response.url

    base_url = '<head><base href="%s">' %(request_url)

    base_url = base_url.encode()

    content = response.content.replace(b"<head>",base_url)

    tem_html = open('tmp.html','wb')

    tem_html.write(content)

    tem_html.close()

    webbrowser.open_new_tab('tmp.html')

def crawl_img(url):

    content = downloadHtml(url)

    res = getImgUrl(content)

    title = res[1]

    img_url = res[0]

    saveImg(title,img_url)

if __name__ == "__main__":

    url = "http://angelimg.spbeen.com/ang/4968/1"

    while url:

        print(url)

        crawl_img(url)

        url = get_next_link(url)

还有种方式，获取到总页数，再循环

python爬虫获取下一页的更多相关文章

xpath获取下一页,兄弟结点的妙用
第一页的情况: 第四页的情况 : 文章的链接: http://tech.huanqiu.com/science/2018-02/11605853_4.html 从上面我们可以看到,如果仅仅用xpat ...
[Python]爬虫获取知乎某个问题下所有图片并去除水印
获取URL 进入某个知乎问题的主页下,按F12打开开发者工具后查看network面板. network面板可以查看页面向服务器请求的资源.资源的大小.加载资源花费的时间以及哪些资源加载失败等信息.还可 ...
Android ListView上拉获取下一页
关于ListView上拉刷新的需求很多,实现方式也多种多样. 一般是简单的通过一个page变量来控制当前请求的页数,然后上拉的时候就发送请求. 实现出来后,经过测试哥的折腾,发现有诸多细节没有处理好, ...
如何科学地蹭热点：用python爬虫获取热门微博评论并进行情感分析
前言:本文主要涉及知识点包括新浪微博爬虫.python对数据库的简单读写.简单的列表数据去重.简单的自然语言处理(snowNLP模块.机器学习).适合有一定编程基础,并对python有所了解的盆友阅读 ...
Python爬虫获取知乎图片
前段时间想抓点知乎问题中的图片,了解了下爬虫,发现还是Python的简单方便,于是做了点尝试. #coding=utf-8 import urllib import re def getHtml(ur ...
Python爬虫获取异步加载站点pexels并下载图片(Python爬虫实战3)
1. 异步加载爬虫对于静态页面爬虫很容易获取到站点的数据内容,然而静态页面需要全量加载站点的所有数据,对于网站的访问和带宽是巨大的挑战,对于高并发和大访问访问量的站点来说,需要使用AJAX相关的技术 ...
python爬虫获取百度图片（没有精华，只为娱乐）
python3.7,爬虫技术,获取百度图片资源,msg为查询内容,cnt为查询的页数,大家快点来爬起来.注:现在只能爬取到百度的小图片,以后有大图片的方法,我会陆续发贴. #!/usr/bin/env ...
Python爬虫获取百度贴吧图片
#!/usr/bin/python# -*- coding: UTF-8 -*-import urllibimport re文章来源:https://www.cnblogs.com/Axi8/p/57 ...
Python爬虫获取迅雷会员帐号
代码如下: import re import urllib.request import urllib import time from collections import deque head = ...

随机推荐

CSS -- 盒子模型之边框、内边距、外边距
一.使用border为盒子添加边框盒子模型的边框就是围绕着内容及补白的线,这条线你可以设置它的粗细.样式和颜色(边框三个属性). 1.border-style(边框样式)常见样式有: dashed( ...
Node.js连接MongoDB数据库
首先要启动MongoDB服务器先找到你的mongoDb安装目录,我的如下:就在bin文件夹下创建一个data文件夹,data内包含两个空文件夹,如下: 接着回到bin文件夹处,按住shift键,右击 ...
Webservice报错客户端发现响应内容类型为“application/json;charset=UTF-8”，但应为“text/xml”。
控制台对接Webservice正常,同样的方法在Web项目上报错: 客户端发现响应内容类型为“application/json;charset=UTF-8”,但应为“text/xml”.请求失败,错误 ...
vue-router-next 通过hash模式访问页面不生效,直接刷新页面一直停留在根路由界面的解决办法
vue3中,配合的vueRouter版本更改为vue-router-next通过 npm i vue-router@next 的方式进行引入添加,随后创建 router.js,在main.js里面引入 ...
C# winform 打包成安装程序(exe)
C# 打包成安装程序 1.扩展-> 安装扩展联网搜索 install 2.新建安装程序项目 3.添加程序 4.添加打包需要的文件 5. 添加x86与x64文件夹,并添加s ...
Github 个人首页的 README，这样玩儿~
本文首发于 Ficow Shen's Blog,原文地址: Github 个人首页的 README,这样玩儿~. 内容概览前言创建仓库修改 README 的内容总结前言大家最近有没有发现这 ...
Redis散列(Hash)的相关命令
散列就像一个减配的Redis 内部及其类似Java的Map 内容就是key:value结构 hash类型在面向对象编程的运用中及其适合,因为它可以直接保存编程语言中的实体类关系增 hset hse ...
PHP绕过disable_function
PHP绕过disable_function 常规绕过 exec exec执行command命令,但是不会输出全部结果,而是返回结果的最后一行. 想得到全部的结果,可以使用第二个参数,让其输出到一个数组 ...
【CF1425A】 Arena of Greed题解
原题链接简要翻译: Mr.Chanek与另一个人玩一个取硬币游戏,他先手.玩家在自己的回合内可以取走硬币堆中的一个.如果硬币堆里有偶数个硬币,玩家也可以选择取走硬币总数的一半.两名玩家都是绝对聪明的 ...
实验 6:OpenDaylight 实验——OpenDaylight 及 Postman 实现流表下发
一.实验目的熟悉 Postman 的使用;熟悉如何使用 OpenDaylight 通过 Postman 下发流表. 二.实验任务流表有软超时和硬超时的概念,分别对应流表中的 idle_timeou ...

python爬虫获取下一页

python爬虫获取下一页的更多相关文章

随机推荐

热门专题