Scrapy 小技巧（一）：使用 scrapy 自带的函数（follow & follow

前言

如何优雅的获取同一个网站上下一次爬取的链接并放到生成一个 Scrapy Response 呢？

样例

from urllib import parse

import scrapy

class SitoiSpider(scrapy.Spider):

    name = "sitoi"

    start_urls = [

        'https://sitoi.cn',

    ]

    def parse(self, response):

        href_list = response.xpath("//div[@class='card']/a/@href").extract()

        for href in href_list:

            url = parse.urljoin(response.url, href)

            yield scrapy.Request(url=url, callback=self.parse_next)

    def parse_next(self, response):

        print(response.url)

方式一：使用 urllib 库来拼接 URL

这个方式是通过 urllib 库来对下一个 url 进行补全成完整的 url，再使用 scrapy.Request 的方式进行下一个页面的爬取。

优点

在处理每一个 href 的时候可以添加一些自定义的内容（例如记录一下当前第几页了等等）

缺点

需要引入其他的库

def parse(self, response):

    href_list = response.xpath("//div[@class='card']/a/@href").extract()

    for href in href_list:

        url = parse.urljoin(response.url, href)

        yield scrapy.Request(url=url, callback=self.parse_next)

方式二：使用 response 自带的 urljoin

这个方式是通过 Scrapy response 自带的 urljoin 对下一个 url 进行补全成完整的 url，再使用 scrapy.Request 的方式进行下一个页面的爬取。（和方式一基本相同）

优点

不再需要在 spider 文件中引入多的第三方库。

def parse(self, response):

    href_list = response.xpath("//div[@class='card']/a/@href").extract()

    for href in href_list:

        url = response.urljoin(href)

        yield scrapy.Request(url=url, callback=self.parse_next)

方式三：使用 response 自带的 follow

这个方式是通过 Scrapy response 自带的 follow 进行下一个页面的爬取。

优点

不再需要在 spider 文件中引入多的第三方库。
不需要写 extract() 来提取 href 字符串，只需要传入 href 这个 Selector（可选）
不需要写 url 拼接
xpath 只需要编写到 a 标签即可，可以省略掉 @href,即不需要获取 href 的 Selector，直接传递 a 的 Selector（可选）

def parse(self, response):

    href_list = response.xpath("//div[@class='card']/a/@href").extract()

    for href in href_list:

        yield response.follow(url=href, callback=self.parse_next)

变种一

不写 extract() 来提取 href 字符串，传入 href 这个 Selector

def parse(self, response):

    href_list = response.xpath("//div[@class='card']/a/@href")

    for href in href_list:

        yield response.follow(url=href, callback=self.parse_next)

变种二

不写 extract() 来提取 href 字符串，传入 href 这个 Selector
xpath 不写 @href，直接传递 a 的 Selector

def parse(self, response):

    href_list = response.xpath("//div[@class='card']/a/")

    for href in href_list:

        yield response.follow(url=href, callback=self.parse_next)

方式四：使用 response 自带的 follow_all

这个方式是通过 Scrapy response 自带的 follow_all 进行下一个页面的爬取。

优点

不再需要在 spider 文件中引入多的第三方库。
不需要写 extract() 来提取 href 字符串，只需要传入 href 这个 selector（可选）
不需要写 url 拼接
只需要编写到 a 标签即可，可以省略掉 @href，即不需要获取 href 的 SelectorList，直接传递 a 的 SelectorList（可选）
不需要编写遍历，直接把抓到的 url 的 SelectorList 放入即可

缺点

如果中间还有什么逻辑，就不太适用了（例如记录一下当前第几页了等等）

def parse(self, response):

    href_list = response.xpath("//div[@class='card']/a")

    yield from response.follow_all(urls=href_list, callback=self.parse_next)

变种

注：前方高能

一行代码搞定。

def parse(self, response):

    yield from response.follow_all(xpath="//div[@class='card']/a", callback=self.parse_next)

欢迎访问我的个人博客：https://sitoi.cn

Scrapy 小技巧（一）：使用 scrapy 自带的函数（follow & follow_all）优雅的生成下一个请求的更多相关文章

芝麻HTTP：Scrapy小技巧-MySQL存储
这两天上班接手,别人留下来的爬虫发现一个很好玩的 SQL脚本拼接. 只要你的Scrapy Field字段名字和数据库字段的名字一样.那么恭喜你你就可以拷贝这段SQL拼接脚本.进行MySQL入库处理 ...
芝麻HTTP： Scrapy小技巧-MySQL存储
这两天上班接手,别人留下来的爬虫发现一个很好玩的 SQL脚本拼接. 只要你的Scrapy Field字段名字和数据库字段的名字一样.那么恭喜你你就可以拷贝这段SQL拼接脚本.进行MySQL入库处理 ...
Scrapy小技巧-MySQL存储, MYSQL拼接
这两天上班接手,别人留下来的爬虫发现一个很好玩的 SQL脚本拼接. 只要你的Scrapy Field字段名字和数据库字段的名字一样.那么恭喜你你就可以拷贝这段SQL拼接脚本.进行MySQL入库处理 ...
【小技巧】只用css实现带小三角的对话框样式
一个小小的技巧: 如图所示,这种小三角,不用图片,只用css怎么实现呢? 直接上代码吧: <!DOCTYPE html> <html> <head> <tit ...
Extjs 项目中常用的小技巧，也许你用得着(5)--设置 Ext.data.Store 传参的请求方式
1.extjs 给怎么给panel设背景色设置bodyStyle:'background:#ffc;padding:10px;', var resultsPanel = Ext.create('Ex ...
10个提升MySQL性能的小技巧
从工作量分析到索引的三条规则,这些专家见解肯定会让您的MySQL服务器尖叫. 在所有的关系数据库中,MySQL已经被证明了完全是一头野兽,只要通知停止运行就绝对不会让你多等一秒钟,使你的应用置于困境之 ...
模仿也是提高，纯css小技巧实现头部进度条
刚开始的时候我也觉得不可能,但是就是这么神奇,总有大神给你意想不到的惊喜. 快来感受一下把.(仔细看看头部黄色条的变化) 思考一下啊,怎么出现的那,其实作者使用了一点小技巧,那就是背景色渐变和遮挡产生 ...
Python 中的一些小技巧
这里是本人收集的一些 Python 小技巧,目前主要是一些实用函数,适合有一定基础的童鞋观看(不会专门介绍使用到的标准库函数).. 一.函数式编程函数式编程用来处理数据,感觉很方便.(要是再配上管道 ...
【js】中的小技巧
本文主要介绍一些JS中用到的小技巧 1. 类型强制转换 1.1 string强制转换为数字可以用*1来转化为数字(实际上是调用.valueOf方法) 然后使用Number.isNaN来判断是否为 ...

随机推荐

vue element-ui el-form-item 循环渲染，验证表单内容
data里面如下图:
goland pojie
goland pojie 只适用于goland2019.1.3之前的版本,之后的版本没法支持. 1. 步骤修改vm启动参数激活正版 2. agent 网上有很多agent都是不能用的,我上传一个可 ...
zabbix配置主动式监控的步骤（原创）
步骤如下: 1.克隆模板.命名新的模板名,并点击"监控项",全选,批量更新时第一个“类型”打勾,客户端改为主动式: 2.添加客户端或更改原有的模板为新模板(服务器端添加客户端时的配 ...
js中获取 table节点各tr及td的内容方法
js中获取 table节点各tr及td的内容方法分类: java基础2013-10-12 17:54 1055人阅读评论(0) 收藏举报 <table id="tb1" ...
JS 如何获取自定义属性
<script>var testEle = document.getElementById("test"); testEle.setAttribute("de ...
走迷宫（三）：在XX限制条件下，是否走得出。
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=1010 题目前提条件:让你输入一个数组,包含一个起点S,一个终点D,一个时间T.(其中X代表墙,.代表此 ...
LoadBalancer在kubernetes架构下的实践
Backgound 借助于kubernetes优秀的弹性扩缩功能,运行其中的应用程序能够在流量突增的时候坦然应对,在流量低谷的时候无需担心成本.但于此同时,也带来了极大的挑战: 弹性扩缩导致容器IP动 ...
【Copy攻城狮日志】docker搭建jenkins拉取svn代码打包vue项目部署到nginx
↑开局一张图,故事全靠编↑ 前言打开搜索引擎输入『Copy攻城狮』,发现最新的一条记录已经是去年的4月,意味着我又有一年时间没有再总结成长了.习惯了“温水煮青蛙”的日子,无论是经验水平还是薪资收入, ...
Spring基础之AOP
一.AOP能解决什么问题业务层每个service都要管理事务,在每个service中单独写事务,就会产生很多重复性的代码,而且修改事务时,需要修改源码,不利于维护.为此,把横向重复的代码,纵向抽取形 ...
Unity 游戏框架搭建 2019 (五十、五十一) 消息机制小结&MonoBehaviourSimplify 是框架？
我们花了 5 篇文章学习了消息机制的方方面面.并且完成了一个简易消息机制,之后集成到了我们的 MonoBehaviourSimplify 里. 现在 MonoBehaviourSimplify 有一点 ...

Scrapy 小技巧（一）：使用 scrapy 自带的函数（follow & follow_all）优雅的生成下一个请求

前言