Scrapy架构(各组件的功能)及Scrapy引擎控制数据流的过程

　　1. Scrapy架构图(绿线是数据流向)：

　　□ Scrapy引擎(Engine)：引擎负责控制数据流在系统的所有组件中流动，并在相应动作发生时触发事件。
　　□ 调度器(Scheduler)：调度器从引擎接收Request并将它们入队，以便以后引擎请求reqeust提供给引擎。
　　□ 下载器(Downloader)：下载器负责获取页面数据提供给引擎，而后提供给Spider。
　　□ Spider：Spider负责处理所有Response，从中分析提取数据，获取Item字段所需要的数据，并将需要跟进的URL提交给引擎，再次进入调度器。
　　□ Item Pipeline：Item Pipeline负责处理被Spider提取出来的Item。并进行后期处理(详细分析、过滤、存储等)，典型的处理有：清理验证及持久化(例如存储到数据库中)。
　　□ 下载器中间件(Doenloader middlewares)：下载器中间件是在引擎及下载器之间的特定钩子(specific hook)，处理Downloader传递给引擎的Response。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。
　　□ Spider中间件(Spider middlewares)。Spider中间件是在引擎及Spider之间的特定钩子。处理Spdier的输入(response)和输出(Items及Reqeusts)。操作引擎和Spider之间的通信。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。

　　2. Scrapy引擎控制数据流过程：

　　　　⑴ 引擎打开一个网站(open a domain)，找到处理该网站的Spider并向给Spider请求第一个要爬取的URL。
　　　　⑵ 引擎从Spider中获取到第一个要爬取的URL，并通过调度器以Request进行调度。
　　　　⑶ 引擎向调度器请求下一个要爬取的URL。
　　　　⑷ 调度器返回下一个要爬取的URL给引擎，引擎将URL通过下载中间件（请求(request)方向）转发给下载器。
　　　　⑸ 一旦页面下载完毕，下载器生成该页面的Response，并将其通过下载中间件(返回(response)方向)发送给引擎。
　　　　⑹ 引擎从下载器中接收到Response，并通过Spider中间件(输入方向)发送给Spider处理。
　　　　⑺ Spider处理Response，并返回爬取到的Item及(跟进的)新的Request给引擎。
　　　　⑻ 引擎将(Spider返回的)爬取到的Item给Item Pipeline，将(Spider返回的)Request给调度器。
　　　　⑼ 重复( 从⑵ 开始 )直到调度器中没有更多的Request。引擎关闭该网站。

Scrapy-架构的更多相关文章

scrapy架构初探
scrapy架构初探引言 Python即时网络爬虫启动的目标是一起把互联网变成大数据库.单纯的开放源代码并不是开源的全部,开源的核心是"开放的思想",聚合最好的想法.技术.人员, ...
Scrapy架构概述
Scrapy架构概述 1, 从最初自己编写的spiders,获取到start_url,并且封装成Request对象. 2,通过engine(引擎)调度给SCHEDULER(Requests管理调度器) ...
scrapy架构简介
一.scrapy架构介绍 1.结构简图: 主要组成部分:Spider(产出request,处理response),Pipeline,Downloader,Scheduler,Scrapy Engine ...
第三百四十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫和反爬的对抗过程以及策略—scrapy架构源码分析图
第三百四十五节,Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫和反爬的对抗过程以及策略—scrapy架构源码分析图 1.基本概念 2.反爬虫的目的 3.爬虫和反爬的对抗过程以及策略 scra ...
Python -- Scrapy 架构概览
架构概览本文档介绍了Scrapy架构及其组件之间的交互. 概述接下来的图表展现了Scrapy的架构,包括组件及在系统中发生的数据流的概览(绿色箭头所示). 下面对每个组件都做了简单介绍,并给出了详 ...
二十四 Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫和反爬的对抗过程以及策略—scrapy架构源码分析图
1.基本概念 2.反爬虫的目的 3.爬虫和反爬的对抗过程以及策略 scrapy架构源码分析图
scrapy架构与目录介绍、scrapy解析数据、配置相关、全站爬取cnblogs数据、存储数据、爬虫中间件、加代理、加header、集成selenium
今日内容概要 scrapy架构和目录介绍 scrapy解析数据 setting中相关配置全站爬取cnblgos文章存储数据爬虫中间件和下载中间件加代理,加header,集成selenium 内 ...
Scrapy架构及其组件之间的交互
最近在学Python,同时也在学如何使用python抓取数据,于是就被我发现了这个非常受欢迎的Python抓取框架Scrapy,下面一起学习下Scrapy的架构,便于更好的使用这个工具. 一.概述下 ...
scrapy架构图与执行流程
概览本文描述了Scrapy的架构图.数据流动.以及个组件的相互作用架构图与数据流上图中各个数字与箭头代表数据的流动方向和流动顺序,具体执行流程如下: 0. Scrapy将会实例化一个Crawle ...
scrapy架构设计分析
scrapy是一个Python爬虫框架.我们自己用requests也能写爬虫(GET某个URL,然后Parse网页的内容),那么,问题来了,scrapy高明在哪些地方呢?下面就来讨论下这个话题,看看业 ...

随机推荐

20个Flutter实例视频教程-第02节: 底部导航栏制作-2
视频地址: https://www.bilibili.com/video/av39709290?p=2 博客地址: https://jspang.com/post/flutterDemo.html#t ...
洛谷 - P4450 - 双亲数 - 整除分块
https://www.luogu.org/fe/problem/P4450 应该不分块也可以. 求\(F(n,m,d)=\sum\limits_{i=1}^{n}\sum\limits_{j=1}^ ...
Inside Geometry Instancing（上）
Inside Geometry Instancing(上) http://blog.csdn.net/soilwork/article/details/598335 翻译:claymanclayman ...
Java常见设计模式学习（非原创）
文章大纲一.策略模式二.观察者模式三.工厂模式四.单例模式五.其他模式六.设计模式总结七.参考文章一.策略模式现在假设我们有个"鸭子项目",首先我们用OOP(面向对象)的 ...
C#连接Sybase数据库，Anywhere 8
数据库版本是Adaptive Server Anywhere 8 1.添加引用,程序集 iAnywhere.Data.AsaClient.dll文件在数据库的安装目录下,例如:C:\Program F ...
Python常用模块之hashlib(加密)
Python常用模块之hashlib(加密) Python里面的hashlib模块提供了很多加密的算法,这里介绍一下hashlib的简单使用事例,用hashlib的md5算法加密数据import ha ...
requests发送HTTPS请求(处理SSL证书验证)
1.SSL是什么,为什么发送HTTPS请求时需要证书验证? 1.1 SSL:安全套接字层.是为了解决HTTP协议是明文,避免传输的数据被窃取,篡改,劫持等. 1.2 TSL:Transport Lay ...
centOS+uwsgi+nginx 部署flask项目，问题记录
用flask做的项目想要部署到centOS系统上,填了一些坑,终于成功了,记录一下遇到的问题: 此次部署主要是按照这个博客进行的 https://www.cnblogs.com/Ray-liang/p ...
解决thymeleaf严格html5校验的方法
用的是springboot加thyemleaf做静态模板. 然后会有个很烦的东西,就这个静态模板对html的格式非常严格,导致很多框架的格式都用不了,然后这里有个解除的方法: 1.在pom中添加依赖: ...
c51中的bit,SBIT
在51单片机的0x20~0x2f,是bdata区既可以字节寻址又可以位寻址.用法: 1 先用bdata存储类型关键字定义变量,注意其值就是地址 .unsigned char bdata MYBITS ...

Scrapy-架构

Scrapy架构(各组件的功能)及Scrapy引擎控制数据流的过程

1. Scrapy架构图(绿线是数据流向)：

2. Scrapy引擎控制数据流过程：

Scrapy-架构的更多相关文章

随机推荐

热门专题

　　1. Scrapy架构图(绿线是数据流向)：

　　2. Scrapy引擎控制数据流过程：