第三百五十五节，Python分布式爬虫打造搜索引擎Scrapy精讲

第三百五十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy信号详解

信号一般使用信号分发器dispatcher.connect()，来设置信号，和信号触发函数，当捕获到信号时执行一个函数

dispatcher.connect()信号分发器，第一个参数信号触发函数，第二个参数是触发信号，

以下是各种信号

signals.engine_started当Scrapy引擎启动爬取时发送该信号。该信号支持返回deferreds。
signals.engine_stopped当Scrapy引擎停止时发送该信号(例如，爬取结束)。该信号支持返回deferreds。

signals.item_scraped(item, response, spider)当item被爬取，并通过所有 Item Pipeline 后(没有被丢弃(dropped)，发送该信号。该信号支持返回deferreds。
　　参数:
　　item (Item 对象) – 爬取到的item
　　spider (Spider 对象) – 爬取item的spider
　　response (Response 对象) – 提取item的response

signals.item_dropped(item, exception, spider)当item通过 Item Pipeline ，有些pipeline抛出 DropItem 异常，丢弃item时，该信号被发送。该信号支持返回deferreds。
　　参数:
　　item (Item 对象) – Item Pipeline 丢弃的item
　　spider (Spider 对象) – 爬取item的spider
　　exception (DropItem 异常) – 导致item被丢弃的异常(必须是 DropItem 的子类)

signals.spider_closed(spider, reason)当某个spider被关闭时，该信号被发送。该信号可以用来释放每个spider在 spider_opened 时占用的资源。该信号支持返回deferreds。
　　参数:
　　spider (Spider 对象) – 关闭的spider
　　reason (str) – 描述spider被关闭的原因的字符串。如果spider是由于完成爬取而被关闭，则其为 'finished' 。否则，如果spider是被引擎的 close_spider 方法所关闭，则其为调用该方法时传入的　　reason 参数(默认为 'cancelled')。如果引擎被关闭(例如，输入Ctrl-C)，则其为 'shutdown' 。

signals.spider_opened(spider)当spider开始爬取时发送该信号。该信号一般用来分配spider的资源，不过其也能做任何事。该信号支持返回deferreds。
　　参数: spider (Spider 对象) – 开启的spider

signals.spider_idle(spider)当spider进入空闲(idle)状态时该信号被发送。空闲意味着:
　　requests正在等待被下载
　　requests被调度
　　items正在item pipeline中被处理
当该信号的所有处理器(handler)被调用后，如果spider仍然保持空闲状态，引擎将会关闭该spider。当spider被关闭后， spider_closed 信号将被发送。您可以，比如，在 spider_idle 处理器中调度某些请求来避免spider被关闭。该信号不支持返回deferreds。
　　参数: spider (Spider 对象) – 空闲的spider

signals.spider_error(failure, response, spider)当spider的回调函数产生错误时(例如，抛出异常)，该信号被发送
　　参数:
　　failure (Failure 对象) – 以Twisted Failure 对象抛出的异常
　　response (Response 对象) – 当异常被抛出时被处理的response
　　spider (Spider 对象) – 抛出异常的spider

signals.request_scheduled(request, spider)当引擎调度一个 Request 对象用于下载时，该信号被发送。该信号不支持返回deferreds。
　　参数:
　　request (Request 对象) – 到达调度器的request
　　spider (Spider 对象) – 产生该request的spider

signals.response_received(response, request, spider)当引擎从downloader获取到一个新的 Response 时发送该信号。该信号不支持返回deferreds。
　　参数:
　　response (Response 对象) – 接收到的response
　　request (Request 对象) – 生成response的request
　　spider (Spider 对象) – response所对应的spider

signals.response_downloaded(response, request, spider)当一个 HTTPResponse 被下载时，由downloader发送该信号。该信号不支持返回deferreds。
　　参数:
　　response (Response 对象) – 下载的response
　　request (Request 对象) – 生成response的request
　　spider (Spider 对象) – response所对应的spider

我们以signals.spider_closed(spider, reason)信号举例其他信号同理：

# -*- coding: utf-8 -*-

import scrapy

from scrapy.http import Request,FormRequest

from scrapy.xlib.pydispatch import dispatcher   # 信号分发器

from scrapy import signals                      # 信号

class PachSpider(scrapy.Spider):                            #定义爬虫类，必须继承scrapy.Spider

    name = 'pach'                                           #设置爬虫名称

    allowed_domains = ['www.dict.cn']                       #爬取域名

    def start_requests(self):    #起始url函数，会替换start_urls

        return [Request(

            url='http://www.dict.cn/9999998888',

            callback=self.parse

        )]

    # 利用数据收集器，收集所有404的url以及，404页面数量

    handle_httpstatus_list = [404]                                      # 设置不过滤404

    def __init__(self):

        self.fail_urls = []                                             # 创建一个变量来储存404URL

        dispatcher.connect(self.spider_closed, signals.spider_closed)   # dispatcher.connect()信号分发器，第一个参数信号触发函数，第二个参数是触发信号，signals.spider_closed是爬虫结束信号

    def spider_closed(self, spider, reason):  # 信号触发函数

        print('爬虫结束 停止爬虫')

        print(self.fail_urls)  # 打印404URL列表

        print(self.crawler.stats.get_value('failed_url'))  # 打印数据收集值

    def parse(self, response):                                          # 回调函数

        if response.status == 404:                                      # 判断返回状态码如果是404

            self.fail_urls.append(response.url)                         # 将URL追加到列表

            self.crawler.stats.inc_value('failed_url')                  # 设置一个数据收集，值为自增，每执行一次自增1

        else:

            title = response.css('title::text').extract()

            print(title)

第三百五十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy信号详解的更多相关文章

第三百六十八节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)用Django实现搜索的自动补全功能
第三百六十八节,Python分布式爬虫打造搜索引擎Scrapy精讲—用Django实现搜索的自动补全功能 elasticsearch(搜索引擎)提供了自动补全接口官方说明:https://www.e ...
第三百六十三节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)的mget和bulk批量操作
第三百六十三节,Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)的mget和bulk批量操作注意:前面讲到的各种操作都是一次http请求操作一条数据,如果想 ...
第三百五十八节，Python分布式爬虫打造搜索引擎Scrapy精讲—将bloomfilter(布隆过滤器)集成到scrapy-redis中
第三百五十八节,Python分布式爬虫打造搜索引擎Scrapy精讲—将bloomfilter(布隆过滤器)集成到scrapy-redis中,判断URL是否重复布隆过滤器(Bloom Filter)详 ...
第三百五十三节，Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy的暂停与重启
第三百五十三节,Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy的暂停与重启 scrapy的每一个爬虫,暂停时可以记录暂停状态以及爬取了哪些url,重启时可以从暂停状态开始爬取过的UR ...
第三百三十八节，Python分布式爬虫打造搜索引擎Scrapy精讲—深度优先与广度优先原理
第三百三十八节,Python分布式爬虫打造搜索引擎Scrapy精讲—深度优先与广度优先原理网站树形结构深度优先是从左到右深度进行爬取的,以深度为准则从左到右的执行(递归方式实现)Scrapy默认 ...
第三百四十八节，Python分布式爬虫打造搜索引擎Scrapy精讲—通过自定义中间件全局随机更换代理IP
第三百四十八节,Python分布式爬虫打造搜索引擎Scrapy精讲—通过自定义中间件全局随机更换代理IP 设置代理ip只需要,自定义一个中间件,重写process_request方法, request ...
第三百四十三节，Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy模拟登陆和知乎倒立文字验证码识别
第三百四十三节,Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy模拟登陆和知乎倒立文字验证码识别第一步.首先下载,大神者也的倒立文字验证码识别程序下载地址:https://gith ...
Python分布式爬虫打造搜索引擎完整版-基于Scrapy、Redis、elasticsearch和django打造一个完整的搜索引擎网站
Python分布式爬虫打造搜索引擎基于Scrapy.Redis.elasticsearch和django打造一个完整的搜索引擎网站 https://github.com/mtianyan/Artic ...
第三百六十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)的基本查询
第三百六十五节,Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)的基本查询 1.elasticsearch(搜索引擎)的查询 elasticsearch是功能 ...
第三百五十九节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)介绍以及安装
第三百五十九节,Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)介绍以及安装 elasticsearch(搜索引擎)介绍 ElasticSearch是一个基于 ...

随机推荐

银联在线支付B2C UnionPay.NET
新春即将来临,首先给大家拜个早年,祝攻城狮们新年快乐.万事如意.合家欢乐.团团圆圆.幸福健康.来年更能大展宏图实现各自的梦想! 同时预祝各大科技公司大佬们事业蒸蒸日上.公司转型突破创新.冲出突围带领 ...
XCode 7 运行 cocos2dx 2.2.6问题小节
终于磕磕绊绊的在模拟器上,成功运行了已有项目. 公司提供的Mac系统,版本炒鸡低.向同事拷贝了OS,和XCode. 安装完成后,将已有的可以在Windows上成功运行Android版本的项目,拷贝到了 ...
elementui常用知识点总结
1.淡入淡出效果: <transition name="el-fade-in-linear"> <div v-show="show" clas ...
Makefile常用万能模板（包括静态链接库、动态链接库、可执行文件）
本文把makefile 分成了三份:生成可执行文件的makefile,生成静态链接库的makefile,生成动态链接库的makefile. 这些makefile都很简单,一般都是一看就会用,用法也很容 ...
Testng生成的测试报告乱码解决办法
Testng生成的测试报告乱码解决办法 2017-06-16 1 问题描述乱码是程序编码不统一,比如Java源代码是utf-8,编译是gbk,这时会乱码. 代码如下: org.testng.Repo ...
HTTP请求与响应报文详解
如图所示,这是客户端往服务器发送请求时的报文: 一般来说,将报文分成三个部分,请求行.请求头.请求体如图,请求行包括三部分内容 1.请求方法,在HTTP里的请求方法种类较多,但就移动端开发来说,常用 ...
js 删除数组几种方法
var arr=['a','b','c']; 若要删除其中的'b',有两种方法: 1.delete方法:delete arr[1] 这种方式数组长度不变,此时arr[1]变为undefined了,但是 ...
[转]Oracle存储过程给变量赋值的方法
原文地址:http://blog.csdn.net/drbing/article/details/51821262 截止到目前我发现有三种方法可以在存储过程中给变量进行赋值:1.直接法 := ...
cas单点登录-CAS5.1.3 overlay服务器搭建(二)
前言本节主要讲解怎么搭建cas服务端,并且在浏览器中使用https访问cas服务端 1.通过cas代码生成工具(https://casinitializr.herokuapp.com/),生成 ...
window.print()局部打印三种方式
首先准备要打印的内容,也可以打印时再填充,html中定义如下:  <div id="printcontent" style=&q ...

第三百五十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy信号详解

第三百五十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—scrapy信号详解的更多相关文章

随机推荐

热门专题