scrapy extention实战

1. 空闲-关闭

使用扩展+spider_idle信号关闭爬虫。

启用扩展：settings.py

EXTENSIONS = {
#'scrapy.extensions.telnet.TelnetConsole':
None,
'extention_my.RedisSpiderSmartIdleClosedExensions': 300,
}

额外配置参数：conf.py

MYEXT_ENABLED = True
IDLE_NUMBER = 5

扩展类：

extention_my.py

#coding:utf-8

"""
----------------------------------------
description:

author: sss

date:
----------------------------------------
change:

----------------------------------------

"""
__author__ = 'sss'

import time
from scrapy import signals
from scrapy.exceptions import NotConfigured

from utils.mylogger import mylogger

logger_c = mylogger(__name__)
logger_m = logger_c.logger

class RedisSpiderSmartIdleClosedExensions(object):

def __init__(self,
idle_number, crawler):
        self.crawler
= crawler
        self.idle_number
= idle_number
        self.idle_list
= []
        self.idle_count
= 0

@classmethod
    def from_crawler(cls,
crawler):
        # 首先检查是否应该启用和提高扩展
        # 否则不配置
        from conf import MYEXT_ENABLED
        if not MYEXT_ENABLED:
            raise NotConfigured

# 获取配置中的时间片个数，默认为360个，30分钟
from conf import IDLE_NUMBER
as idle_number

# 实例化扩展对象
ext = cls(idle_number,
crawler)

# 将扩展对象连接到信号，将signals.spider_idle 与 spider_idle() 方法关联起来。
        crawler.signals.connect(ext.spider_opened,
signal=signals.spider_opened)

crawler.signals.connect(ext.spider_closed, signal=signals.spider_closed)
        crawler.signals.connect(ext.spider_idle,
signal=signals.spider_idle)

# return the
extension object
return ext

def spider_opened(self,
spider):
logger_m.info("opened
spider %s redis spider Idle, Continuous idle limit：
%d", spider.name, self.idle_number)

def spider_closed(self,
spider):
logger_m.info("closed
spider %s, idle count %d , Continuous idle count %d",
spider.name, self.idle_count,
len(self.idle_list))

def spider_idle(self,
spider):
        self.idle_count
+= 1 # 空闲计数
        self.idle_list.append(time.time()) # 每次触发 spider_idle时，记录下触发时间戳
        idle_list_len
= len(self.idle_list) # 获取当前已经连续触发的次数
        print(self.idle_number,
self.idle_count, self.idle_list)

# 判断当前触发时间与上次触发时间之间的间隔是否大于5秒，如果大于5秒，说明redis 中还有key
if idle_list_len
> 2 and self.idle_list[-1] - self.idle_list[-2] > 6:
self.idle_list
= [self.idle_list[-1]]

elif idle_list_len
> self.idle_number:
            # 连续触发的次数达到配置次数后关闭爬虫
            logger_m.info('\n continued
idle number exceed {} Times'
                        '\n meet the
idle shutdown conditions, will close the reptile operation'
                        '\n idle
start time: {}, close spider time: {}'.format(self.idle_number,
                                                                                self.idle_list[0], self.idle_list[0]))
            # 执行关闭爬虫操作
            self.crawler.engine.close_spider(spider,
'closespider_pagecount')

其它没有什么，主要是判断是否关闭条件的设计。

scrapy extention实战-空闲时关闭爬虫的更多相关文章

scrapy主动触发关闭爬虫
在spider中时在方法里直接写 self.crawler.engine.close_spider(self, 'cookie失效关闭爬虫') 在pipeline和downloaderMiddle ...
Scrapy框架实战-妹子图爬虫
Scrapy这个成熟的爬虫框架,用起来之后发现并没有想象中的那么难.即便是在一些小型的项目上,用scrapy甚至比用requests.urllib.urllib2更方便,简单,效率也更高.废话不多说, ...
执行时关闭标识位 FD_CLOEXEC 的作用
首先先回顾 apue 中对它的描述: ① 表示描述符在通过一个 exec 时仍保持有效(书P63,3.14节 fcntl 函数,在讲 F_DUPFD 时顺便提到) ② 对打开文件的处理与每个描述符的执 ...
Android退出时关闭所有Activity的方法
Android退出时,有的Activity可能没有被关闭.为了在Android退出时关闭所有的Activity,设计了以下的类: //关闭Activity的类 public class CloseAc ...
VS2015 调试中断点突然失效的解决办法、VS调试时关闭调试让浏览器继续保留页面
VS2010 调试中断点突然失效的解决办法问题描述:在调试前加了断点,但debug时红色的断点变成透明的圆圈加一个感叹号,执行到该处时也不会停止. 这个问题遇到过几次了,前几次都没怎么注意,有时候是 ...
VC被控制时关闭极域电子教室、破解联想硬盘保护系统密码（上）
<[原]关于VC运行时关闭极域电子教室的改进方法> 本文将讲资料和方法,具体实现和破解联想硬盘保护系统密码在(下)中,有关破解联想硬盘保护系统(删除它)的方法很简单,用硬盘保护卡克星就可以 ...
jq自定义下拉菜单，当用户点击非自身元素（下拉菜单）本身时关闭下拉菜单
jq自定义下拉菜单,当用户点击非自身元素(下拉菜单)本身时关闭下拉菜单截图: 代码如下: //关闭用户菜单 $(document).mousedown(function(e){ var _con = ...
CPU 空闲时在干嘛？
人在空闲时会发呆会无聊,计算机呢? 假设你正在用计算机浏览网页,当网页加载完成后你开始阅读,此时你没有移动鼠标,没有敲击键盘,也没有网络通信,那么你的计算机此时在干嘛? 有的同学可能会觉得这个问题很简 ...
scrapy使用response.body时编码问题
scrapy使用response.body时编码问题摘要:scrapy使用response.body时编码问题.如果在使用responses.body获取数据时,需要将其编码转换成unicode,即 ...

随机推荐

oracle创建、删除索引等操作
1.创建索引 create index 索引名 on 表名(列名); 2.删除索引 drop index 索引名; 3.创建组合索引 create index 索引名 on 表名(列名1,,列名2); ...
RedHat7 / CentOS 7 忘记root密码修改
摘自:https://blog.csdn.net/bubbleyang/article/details/91360856 进入互动式命令环境开机出现 grub boot loader 开机选项菜单时 ...
html - html5 audio 音乐自动播放，循环播放等
转自:http://blog.csdn.net/u012246458/article/details/50618759 audio播放音乐 <audio id="audio" ...
js的基本分类（0.1）
js分内嵌,内联,外部样式表三种, js的组成分,ES(变量,函数,对象,数组,判断,循环),BOM(浏览器对象模型),DOM(文档对象模型), js的五种输出语句,alert(警告框),confir ...
专题-集合-ConcurrentHashMap
本文介绍ConcurrentHashMap是线程安全的,但为什么却不用加锁的原因一.ConcurrentHashMap简介在jdk1.7中是采用Segment + HashEntry + Reen ...
JS高级---原型的引入，原型添加的方法解决数据共享
原型的引入:解决:通过构造函数创建对象带来的问题,即浪费内存(一个对象开一个内存,多个对象开多个内存) 通过原型来添加方法,解决数据共享,节省内存空间 <script> function ...
喵星之旅-狂奔的兔子-linux安装
一.前言本文演示虚拟机安装,和真机区别可能在网卡驱动上有差异. 真机环境:CentOS Linux release 7.6.1810 (Core) 虚拟机(虽然centos系统自带虚拟机软件,但是习 ...
opencv：opencv概述
opencv官方:www.opencv.org github:https://github.com/opencv OpenCV OpenCV是一个开放源代码的计算机视觉应用平台,由英特尔公司研发中心俄 ...
hybird怎么实现的（核心webview）
链接:https://blog.csdn.net/gongch0604/article/details/80510005
两个Beta函数类型的积分及其一般形式
\[\Large\displaystyle \int_{0}^{1}\frac{\sqrt[4]{x\left ( 1-x \right )^{3}}}{\left ( 1+x \right )^{3 ...

scrapy extention实战-空闲时关闭爬虫

scrapy extention实战

1. 空闲-关闭

scrapy extention实战-空闲时关闭爬虫的更多相关文章

随机推荐

热门专题