crawlspider

Scrapy中CrawSpider

回头看：

之前的代码中，我们有很大一部分时间在寻找下一页的url地址或者是内容的url地址或者是内容的url地址上面，这个过程能更简单一些么？

思路：

1. 从response中提取所有的a标签对应的url地址

2. 自动的构造自己requests请求，发送给引擎

上面的功能可以做的更好：

满足某个条件的url地址，我们才发送给引擎，同时能够指定callback函数

需求：爬取csdn上面所有的博客专家及其文章

url地址：http://blog.csdn.net/experts.html

生产crawlspider的命令：

scrapy genspider -t crawl csdn 'csdn.cn'

from scrapy.linkextractors import LinkExtractor

from scrapy.spiders import CrawlSpider, Rule

class CsdnspiderSpider(CrawlSpider):  # 继承自spiders的crawspider类

    name = 'csdnspider'

    allowed_domains = ['blog.csdn.net']

    start_urls = ['http://blog.csdn.net/peoplelist.html?channelid=0&page=1']  # 第一次请求的url，如果对这个url有特殊的需求，可以定义一个parse_start_url函数专门处理所有对应的响应

    rules = (

        Rule(LinkExtractor(allow=r"http://blog.csdn.net/\w+$"), fllow=True),  # 能够找到所有作者的博客地址并且请求，$符号加上表示已\w结尾，否则会匹配上\w+'/abc/def'等内容

        Rule(LinkExtractor(allow=r"peoplelist.html?channelid=\d+&page=\d+$), follow=True),  #找到所有的翻页地址并且请求，$符合同理

        Rule(LinkExtractor(allow=r'/article/details/\d+$'), callback="parse_article", follow=True),  # 找到所有的文章的url地址，并且请求，调用parase_article函数处理response

        Rule(LinkExtractor(allow=r'/article/list/\d+$'), follow=True)

    )

注意点：

用命令创建一个crawlspider模块：scrapy genspider -t crawl <爬虫名字> <all_domain>，也可以手动创建
CrawlSpider中不能再有以parse为名字的数据提取方法，这个方法被CrawlSpider用来实现基础url提取等功能
一个Rule对象接收很多参数，首先第一个是包含url规则的LinkExtractor对象，常用的还有callback(制定满足规则的url的解析函数的字符串)和follow(response中提取的链接是否需要跟进)
不指定callback函数的请求下，如果follow为True，满足该rule的url还会继续被请求
如果多个Rule都满足某一个url，会从rules中选择第一个满足的进行操作

CrawlSpider补充（了解）

LinkExtractor更多常见参数：

allow：满足括号中“正则表达式”的URL会被提取，如果为空，则全部匹配。

deny：满足括号中“正则表达式”的URL一定不提取（优先级高于allow）

allow_domains：会被提取的链接的domains。

deny_domains：一定不会被提取链接的domains。

restrict_xpaths：使用xpath表达式，和allow共同作用过滤链接，级xpath满足范围内的url地址会被提取

spiders.Rule常见参数：

link_extractor：是一个LinkExtractor对象，用于定义需要提取的链接。

callback：从linkExtractor中每获取链接时，参数所指定的值作为回调函数。

follow：是一个布尔（boolean）值，指定了根据该规则从response提取的链接是否需要跟进。如果callback为None，follow默认设置为True，否则默认为False。

process_links：指定该spider中哪个的函数将会被调用，从link_extractor中获取到链接列表时将会调用该函数，该方法主要用来过滤url。

process_request：指定该spider中哪个的函数将会被调用，该规则提取每个request时都会调用该函数，用来过滤request

crawlspider的更多相关文章

爬虫学习-使用CrawlSpider
使用scrapy中的CrawlSpider类来进行爬行一直用的是BaseSpider,回调函数的方式,有一个问题是title,date在一个页面,author,detail在另一个页面时,怎么把这些 ...
python爬虫入门（八）Scrapy框架之CrawlSpider类
CrawlSpider类通过下面的命令可以快速创建 CrawlSpider模板的代码: scrapy genspider -t crawl tencent tencent.com CrawSpid ...
爬虫框架之Scrapy（三 CrawlSpider）
如何爬取一个网站的全站数据? 可以使用Scrapy中基于Spider的递归方式进行爬取(Request模块回调parse方法) 还有一种更高效的方法,就是基于CrawlSpider的自动爬取实现简介 ...
Scrapy框架-Spider和CrawlSpider的区别
目录 1.目标 2.方法1:通过Spider爬取 3. 通过CrawlSpider爬取 1.目标 http://wz.sun0769.com/index.php/question/questionTy ...
Scrapy框架-CrawlSpider
目录 1.CrawlSpider介绍 2.CrawlSpider源代码 3. LinkExtractors:提取Response中的链接 4. Rules 5.重写Tencent爬虫 6. Spide ...
scrapy CrawlSpider解析
CrawlSpider继承自Spider, CrawlSpider主要用于有规则的url进行爬取. 先来说说它们的设计区别: SpiderSpider 类的设计原则是只爬取 start_urls 中的 ...
Scrapy框架之CrawlSpider
提问:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二:基 ...
爬虫系列---scrapy全栈数据爬取框架(Crawlspider)
一简介 crawlspider 是Spider的一个子类,除了继承spider的功能特性外,还派生了自己更加强大的功能. LinkExtractors链接提取器,Rule规则解析器. 二强大的链接 ...
scrapy 中crawlspider 爬虫
爬取目标网站: http://www.chinanews.com/rss/rss_2.html 获取url后进入另一个页面进行数据提取检查网页: 爬虫该页数据的逻辑: Crawlspider爬虫类: ...

随机推荐

python学习02
python的数据类型程序=数据类型+算法 1.数据类型:数据型,字符串,列表list,字典dict,set集合(),tuple元组() 1)数据型 int,整数型,理论上是无限大,不过受到机器内存 ...
出现Failed to get convolution algorithm的解决方法
当运行卷积神经时出现了问题:Failed to get convolution algorithm. This is probably because cuDNN failed to initiali ...
鼠标右键添加Sublime Text
鼠标右键添加Sublime Text 参考将sublime添加到鼠标右键实践 1. win+R 输入regedit 2. 输入路径: 计算机\HKEY_CLASSES_ROOT\*\shell\ ...
Spring注解@Configuration和Java Config
1.从Spring 3起,JavaConfig功能已经包含在Spring核心模块,它允许开发者将bean定义和在Spring配置XML文件到Java类中.但是,仍然允许使用经典的XML方式来定义bea ...
Python不能用于大型项目？关于Python的10大误解
语言多元化是PayPal编程文化中一个重要的组成部分.在C++和Java长期流行的同时,更多的团队选择了Jva和Scala.同时,Braintree的收购也引入了一个久经世故的Ruby社区.Pyt ...
jQuery ajaxForm和 ajaxSubmit注意
http://jquery.malsup.com/form/#file-upload 在使用jQuery异步上传时,需要注意在存在文件上传时,要将返回数据的contentType设置为text/htm ...
OpenCV3编程入门-读书笔记1
一.OpenCV概述 1.OpenCV全程Open Source Computer Vision Library,即开源计算机视觉库.它是一个跨平台的开源计算机视觉库,可以运行在windows.lin ...
eclipse打开工作空间(workspace)没有任务反应
删除workspace下的.metadata文件夹,重新打开Eclipse就OK了.
20172328 2018-2019《Java软件结构与数据结构》第五周学习总结
20172328 2018-2019<Java软件结构与数据结构>第五周学习总结概述 Generalization 本周学习了第九章:排序与查找,主要包括线性查找和二分查找算法和几种排序 ...
sqlalchemy.exc.ProgrammingError: (pymysql.err.ProgrammingError)
在我学习flask建立网站时间碰到了一个棘手的问题,就是在我进行操作日志的更新时间,发现表格建立有点错误,导致表缺失,从而报了下面的错误 sqlalchemy.exc.ProgrammingError ...

crawlspider

Scrapy中CrawSpider

CrawlSpider补充（了解）

crawlspider的更多相关文章

随机推荐

热门专题