scrapy递归抓取网页数据

scrapy spider的parse方法能够返回两种值：BaseItem。或者Request。通过Request能够实现递归抓取。

假设要抓取的数据在当前页，能够直接解析返回item（代码中带**凝视的行直接改为yield item）；

假设要抓取的数据在当前页指向的页面，则返回Request并指定parse_item作为callback。

假设要抓取的数据当前页有一部分，指向的页面有一部分（比方博客或论坛，当前页有标题、摘要和url，详情页面有完整内容）这样的情况须要用Request的meta參数把当前页面解析到的数据传到parse_item，后者继续解析item剩下的数据。

要抓完当前页再抓其他页面（比方下一页），能够返回Request，callback为parse。

有点奇怪的是：parse不能返回item列表，但作为callback的parse_item却能够。不知道为啥。

另外。直接extract()得到的文字不包括<a>等子标签的内容。可改为d.xpath('node()').extract()。得到的是包括html的文本。再过滤掉标签就是纯文本了。

没找到直接得到html的方法。

from scrapy.spider import Spider

from scrapy.selector import Selector

from dirbot.items import Article

import json

import re

import string

from scrapy.http import Request

class YouyousuiyueSpider(Spider):

    name = "youyousuiyue2"

    allowed_domains = ["youyousuiyue.sinaapp.com"]

    start_urls = [

        'http://youyousuiyue.sinaapp.com',

    ]

    def load_item(self, d):

        item = Article()

        title = d.xpath('header/h1/a')

        item['title'] = title.xpath('text()').extract()

        print item['title'][0]

        item['url'] = title.xpath('@href').extract()

        return item

    def parse_item(self, response):

        item = response.meta['item']

        sel = Selector(response)

        d = sel.xpath('//div[@class="entry-content"]/div')

        item['content'] = d.xpath('text()').extract()

        return item

    def parse(self, response):

        """

        The lines below is a spider contract. For more info see:

        http://doc.scrapy.org/en/latest/topics/contracts.html

        @url http://youyousuiyue.sinaapp.com

        @scrapes name

        """

        print 'parsing ', response.url

        sel = Selector(response)

        articles = sel.xpath('//div[@id="content"]/article')

        for d in articles:

            item = self.load_item(d)

            yield Request(item['url'][0], meta={'item':item}, callback=self.parse_item) # ** or yield item

        sel = Selector(response)

        link = sel.xpath('//div[@class="nav-previous"]/a/@href').extract()[0]

        if link[-1] == '4':

            return

        else:

            print 'yielding ', link

            yield Request(link, callback=self.parse)

具体代码见：https://github.com/junglezax/dirbot

參考：

http://doc.scrapy.org/en/latest/intro/tutorial.html

http://www.icultivator.com/p/3166.html

scrapy递归抓取网页数据的更多相关文章

java抓取网页数据，登录之后抓取数据。
最近做了一个从网络上抓取数据的一个小程序.主要关于信贷方面,收集的一些黑名单网站,从该网站上抓取到自己系统中. 也找了一些资料,觉得没有一个很好的,全面的例子.因此在这里做个笔记提醒自己. 首先需要一 ...
Asp.net 使用正则和网络编程抓取网页数据(有用)
Asp.net 使用正则和网络编程抓取网页数据(有用) Asp.net 使用正则和网络编程抓取网页数据(有用) /// <summary> /// 抓取网页对应内容 /// </su ...
使用HtmlAgilityPack批量抓取网页数据
原文:使用HtmlAgilityPack批量抓取网页数据相关软件点击下载登录的处理.因为有些网页数据需要登陆后才能提取.这里要使用ieHTTPHeaders来提取登录时的提交信息.抓取网页 Htm ...
web scraper 抓取网页数据的几个常见问题
如果你想抓取数据,又懒得写代码了,可以试试 web scraper 抓取数据. 相关文章: 最简单的数据抓取教程,人人都用得上 web scraper 进阶教程,人人都用得上如果你在使用 web s ...
c#抓取网页数据
写了一个简单的抓取网页数据的小例子,代码如下: //根据Url地址得到网页的html源码 private string GetWebContent(string Url) { string strRe ...
使用JAVA抓取网页数据
一.使用 HttpClient 抓取网页数据 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 ...
【iOS】正則表達式抓取网页数据制作小词典
版权声明:本文为博主原创文章,未经博主同意不得转载. https://blog.csdn.net/xn4545945/article/details/37684127 应用程序不一定要自己去提供数据. ...
01 UIPath抓取网页数据并导出Excel（非Table表单）
上次转载了一篇<UIPath抓取网页数据并导出Excel>的文章,因为那个导出的是table标签中的数据,所以相对比较简单.现实的网页中,有许多不是通过table标签展示的,那又该如何处理 ...
Node.js的学习--使用cheerio抓取网页数据
打算要写一个公开课网站,缺少数据,就决定去网易公开课去抓取一些数据. 前一阵子看过一段时间的Node.js,而且Node.js也比较适合做这个事情,就打算用Node.js去抓取数据. 关键是抓取到网页 ...

随机推荐

UOJ Goodbye Bingshen
在叶子童鞋的推荐下打了这场比赛... 感觉被虐爆了... 怎么这么多构造题... 我还没写过呢... 交互题是毛线...看了好久没看懂...就放弃了...(我语文好差QAQ...) 最后只会T1... ...
【HDOJ5956】The Elder（树形DP，斜率优化）
题意:有一棵n个点的有根树,每条边上有一个边权.给定P,从i跳到它的祖先j的费用是距离的平方+P,问所有点中到根节点1的总花费最大值 n<=1e5,p<=1e6,w<=1e2 思路: ...
Java抽象类，接口，抽象方法
创建Animal抽象类 public abstract class Animal { public abstract void eat(); public abstract void sleep(); ...
ubuntu php编译安装配置
安装参考:http://ilanni.blog.51cto.com/526870/1569322/ 加载扩展的一些参数参考:http://java-er.com/blog/nginx-php-fpm/
CentOS下Yum使用
1. 介绍 Yum,即Yellow dog Updater Modified,是一个基于 RPM 包管理的字符前端软件包管理器:能够从指定的服务器自动下载 RPM 包并且安装,可以处理依赖性关系,并且 ...
mdev详解【转】
转自:http://blog.chinaunix.net/uid-29401328-id-5019678.html 一.概述 mdev是busybox提供的一个工具,用在嵌入式系统中,相当于简化版的u ...
使用dvajs+webpack构建react开发环境
之前我有写过博文介绍过dva.js及其用法,dva.js固然是个非常优秀的框架,但是如果用dev-cli来创建的话就会默认绑定使用roadhog而不是webpack.鉴于roadhog的文档要明显少于 ...
atom 默认的换行符设置成LF
如何把atom 默认的换行符设置成LF Select File->Settings Select ‘Packages’ Under Core Packages->line-ending-s ...
NOI模拟题4 Problem A: 生成树(mst)
Solution 我们考虑答案的表达式: \[ ans = \sqrt{\frac{\sum_{i = 1}^{n - 1} (w_i - \overline{w})^2}{n - 1}} \] 其中 ...
Android下设置ListView数据加载完成后执行layoutanimation
今天使用android的volley框架写了一个简单的网络天气获取的demo. 承载数据的空间是ListView 因为是网络加载,必然先要设置ListView的默认数据,我设置的就是那个Loading ...

scrapy递归抓取网页数据

scrapy递归抓取网页数据的更多相关文章

随机推荐

热门专题