scrapy是一个Python爬虫框架。我们自己用requests也能写爬虫（GET某个URL，然后Parse网页的内容），那么，问题来了，scrapy高明在哪些地方呢？下面就来讨论下这个话题，看看业界通用的爬虫是怎么设计的。

从[1]可得scrapy架构图。它由5个核心模块组成。

5个模块功能

(1) 最重要的模块是Engine：它是数据流的指挥官，负责控制数据流（控制各个模块之间的通信）；
(2) scheduler：负责将Engine提交的URL排成一个队列；
(3) spider：用户自己写的代码放在spider。主要负责HTTP response的解析，从回复的HTML中提取关键数据。
(4) downloader：负责跟URL对应的server通信，并获取返回的内容。
(5) item pipeline：负责处理spider提取出来的信息，一般用于做跟DB相关的操作。

2个中间件

中间件是处于两个模块之间的一种特殊hook，它的目的是提供一种简易的机制，通过插拔用户自己写的代码，来扩展新功能。

典型的数据流

(1) Engine启动，从spider中读出要爬的第一个URL
(2) Engine将读到的第一个URL送给scheduler
(3) Engine向scheduler请求下一个要爬的URL
(4) scheduler从队列中读出一个URL，送给Engine，Engine将这个URL送到downloader
(5) downloader去GET这个URL，并将HTTP response生成一个Response对象。downloader将生成的Response返回给Engine
(6) Engine将这个Response对象发给spider
(7) spider处理这个Response对象，提取其中的信息，生成item。还会生成新的请求。并将item和请求送给Engine
(8) Engine将收到的请求送给scheduler，将收到的item送给item pipline
(9) 重复步骤(2)，直到没有URL需要继续处理

所有的处理流程都需要经过 Scrapy Engine，然后到达下一个流程

源自 http://blog.csdn.net/ybdesire/article/details/51559255

scrapy架构设计分析的更多相关文章

Web API应用架构设计分析（2）
在上篇随笔<Web API应用架构设计分析(1)>,我对Web API的各种应用架构进行了概括性的分析和设计,Web API 是一种应用接口框架,它能够构建HTTP服务以支撑更广泛的客户端 ...
scrapy架构初探
scrapy架构初探引言 Python即时网络爬虫启动的目标是一起把互联网变成大数据库.单纯的开放源代码并不是开源的全部,开源的核心是"开放的思想",聚合最好的想法.技术.人员, ...
Scrapy架构概述
Scrapy架构概述 1, 从最初自己编写的spiders,获取到start_url,并且封装成Request对象. 2,通过engine(引擎)调度给SCHEDULER(Requests管理调度器) ...
scrapy架构简介
一.scrapy架构介绍 1.结构简图: 主要组成部分:Spider(产出request,处理response),Pipeline,Downloader,Scheduler,Scrapy Engine ...
第三百四十五节，Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫和反爬的对抗过程以及策略—scrapy架构源码分析图
第三百四十五节,Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫和反爬的对抗过程以及策略—scrapy架构源码分析图 1.基本概念 2.反爬虫的目的 3.爬虫和反爬的对抗过程以及策略 scra ...
Python -- Scrapy 架构概览
架构概览本文档介绍了Scrapy架构及其组件之间的交互. 概述接下来的图表展现了Scrapy的架构,包括组件及在系统中发生的数据流的概览(绿色箭头所示). 下面对每个组件都做了简单介绍,并给出了详 ...
二十四 Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫和反爬的对抗过程以及策略—scrapy架构源码分析图
1.基本概念 2.反爬虫的目的 3.爬虫和反爬的对抗过程以及策略 scrapy架构源码分析图
Saas系统架构的思考，多租户Saas架构设计分析
ToB Saas系统最近几年都很火.很多创业公司都在尝试创建企业级别的应用 cRM, HR,销售, Desk Saas系统.很多Saas创业公司也拿了大额风投.毕竟Saas相对传统软件的优势非常明显. ...
scrapy架构与目录介绍、scrapy解析数据、配置相关、全站爬取cnblogs数据、存储数据、爬虫中间件、加代理、加header、集成selenium
今日内容概要 scrapy架构和目录介绍 scrapy解析数据 setting中相关配置全站爬取cnblgos文章存储数据爬虫中间件和下载中间件加代理,加header,集成selenium 内 ...

随机推荐

【转载】android 常用开源框架
对于Android初学者以及对于我们菜鸟,这些大神们开发的轻量级框架非常有用(更别说开源的了). 下面转载这10个框架的介绍:(按顺序来吧没有什么排名). 一. Afinal 官方介绍: Afina ...
chameleon-Mini(迷你变色龙)
Chameleon Mini(迷你变色龙)是一个比一般信用卡稍大的小型开发板,是开源产品. 如图 Chameleon Mini可以完全复制许多商业非接触式智能卡包括UID卡,在内的全部内容,因此可以用 ...
【转】jQuery最佳实践
上周,我整理了<jQuery设计思想>. 那篇文章是一篇入门教程,从设计思想的角度,讲解"怎么使用jQuery".今天的文章则是更进一步,讲解"如何用好jQu ...
allocator类
一.动态数组 [new的局限性] new将内存分配和对象构造组合在一起,同样delete将对象析构和内存释放组合在一起我们分配单个对象时,通常希望将内存分配和对象初始化组合在一起(我们知道对象应有什 ...
A+B 输入输出练习I
while True: try: s=raw_input() a,b=s.split(' ') a,b=int(a),int(b) print a+b except EOFError: break A ...
第三章——供机器读取的数据（XML）
本书使用的文件.代码:https://github.com/huangtao36/data_wrangling 机器可读(machine readable)文件格式: 1.逗号分隔值(Comma-Se ...
ajax与servlet交互（通过JSON）,JAVA的arraylist传到前端的方法
所实现的效果:首先从前端(ajax)传参数给servlet,然后servlet经过处理,把arraylist类型的参数以JSON字符串的形式返回给前端(ajax),然后前端经过解析,把JSON字符串解 ...
phpmyadmin中缺少mysqli扩展的结解办法
修改 ;extension=php_mysqli.dll 去掉前面的 ; 以及调整 php文件夹的目录位置. 这个办法是不是好使,我不确定.这个方法只适合用win系统这个,貌似 ...
(转)Linux NUMA引发的性能问题
最近某客户的核心业务系统又出了翻译缓慢的情况.该问题在6月份也出现过,当时进行了一次调整. 我们首先来看下故障时间段的awr报告: 单纯的从TOP 5 event,基本上是看不出任何东西的,可能有人会 ...
python函数入门到高级
函数的定义: def test(x): "The function definitions" x+=1 return x def:定义函数的关键字 test:函数名 ():内可定义 ...

scrapy架构设计分析

5个模块功能

2个中间件

典型的数据流

scrapy架构设计分析的更多相关文章

随机推荐

热门专题