改写pipeline

为什么要改写方法：get_media_requests，他们的区别在哪里

def get_media_requests(self, item, info):#原始的

        return [Request(x) for x in item.get(self.images_urls_field, [])]

def get_media_requests(self, item, info):#修改的

    for file_url in item['file_urls']:

        yield scrapy.Request(file_url)

refer： https://www.imooc.com/article/21840 这篇文章介绍了多种实例

def get_media_requests(self, item, info):

        request_objects = super(AudiImagesPipeline, self).get_media_requests(item, info)  # super()直接调用父类对象

        for request_object in request_objects:

            request_object.item = item

        return request_objects
#这个是网易云课堂的写法，网上很多也都是这个写法，但是不理解request_object.item 为什么会有一个item，super().get_media_requests(item, info)返回的是request请求，
并没有item，后来找到了下面的例子

class RefererImagePipeline(ImagesPipeline):

    def get_media_requests(self, item, info):

        requests = super().get_media_requests(item, info)

        for req in requests:

            req.headers.appendlist("referer", item['referer'])

        return requests

#这个是修改返回的request的headers，这个就比较容易接受了，仔细看博主的文章，又发现了下面的例子

如果文件名生成规则更加复杂，可以参考znns项目中的pipeline编写。他这里要根据路径生成多级文件夹保存图片，所以他的图片Item需要额外几个属性设置图片分类等。这时候就需要重写get_media_requests方法，从image_urls获取图片地址请求的时候用Request的meta属性将对应的图片Item也传进去，这样在生成文件名的时候就可以读取meta属性来确定图片的分类等信息了。

class ZnnsPipeline(ImagesPipeline):

    def get_media_requests(self, item, info):

        for image_url in item['image_urls']:

            yield Request(image_url, meta={'item': item}, headers=headers)  #

            # 这里把item传过去，因为后面需要用item里面的书名和章节作为文件名 ##@@#这里就是他传item的用法，用meta传参数
*****************************************************************************************************

 def item_completed(self, results, item, info):

        image_paths = [x['path'] for ok, x in results if ok]

        if not image_paths:

            raise DropItem("Item contains no images")

        return item

    def file_path(self, request, response=None, info=None):

        item = request.meta['item']

        image_guid = request.url.split('/')[-1]

        filename = u'full/{0[name]}/{0[albumname]}/{1}'.format(item, image_guid)  #这个file_path的写法比较优雅

        return filename

        #另：通过列表索引设置参数 
        my_list = ['菜鸟教程', 'www.runoob.com']
        print("网站名：{0[0]}, 地址 {0[1]}".format(my_list)) # "0" 是必须的
        网站名：菜鸟教程, 地址 www.runoob.com

改写pipeline的更多相关文章

基于Python,scrapy,redis的分布式爬虫实现框架
原文 http://www.xgezhang.com/python_scrapy_redis_crawler.html 爬虫技术,无论是在学术领域,还是在工程领域,都扮演者非常重要的角色.相比于其他 ...
OpenVINO 目标检测底层C++代码改写实现（待优化）
System: Centos7.4 I:OpenVINO 的安装 refer:https://docs.openvinotoolkit.org/latest/_docs_install_guides_ ...
Ruby Rails学习中：Sass 和 Asset Pipeline，布局中的链接（Rails路由，具名路由），用户注册: 第一步
接上篇: 一.Sass 和 Asset Pipeline Rails 中最有用的功能之一是 Asset Pipeline, 它极大地简化了静态资源文件(CSS.JavaScript 和图像)的生成和管 ...
redis大幅性能提升之使用管道（PipeLine）和批量（Batch）操作
前段时间在做用户画像的时候,遇到了这样的一个问题,记录某一个商品的用户购买群,刚好这种需求就可以用到Redis中的Set,key作为productID,value 就是具体的customerid集合, ...
为Xamarin更好的开发而改写的库
欢迎大家加入以下开源社区 Xamarin-Cn:https://github.com/Xamarin-Cn Mvvmcross-Cn:https://github.com/Mvvmcross-Cn ...
Building the Testing Pipeline
This essay is a part of my knowledge sharing session slides which are shared for development and qua ...
Scrapy:为spider指定pipeline
当一个Scrapy项目中有多个spider去爬取多个网站时,往往需要多个pipeline,这时就需要为每个spider指定其对应的pipeline. [通过程序来运行spider],可以通过修改配置s ...
.NET跨平台之旅：基于.NET Core改写EnyimMemcached，实现Linux上访问memcached缓存
注:支持 .NET Core 的 memcached 客户端 EnyimMemcachedCore 的 NuGet 包下载地址:https://www.nuget.org/packages/Enyim ...
图解Netty之Pipeline、channel、Context之间的数据流向。
声明:本文为原创博文,禁止转载. 以下所绘制图形均基于Netty4.0.28版本. 一.connect(outbound类型事件) 当用户调用channel的connect时,会发起一个 ...

随机推荐

DirectX using C++_error X3539:ps1_x is no longer supported...解决方案
问题来源在研究HLSL时编译一个demo出现了error X3539的问题解决方案将代码中的ps_1_1 改为ps_2_0 PixelShader = compile ps_1_1 PS(); ...
Matrix 高斯消元Gaussian elimination 中的complete pivoting和partial pivoting
首先科普下Pivoting的含义一般翻译为“主元”,在对矩阵做某种算法时,首先进行的部分元素.在线性规划的单纯形法中常见.wiki的解释如下:Pivot element(the first elem ...
python rabbitmq的库，rabbitpy代替pika
之前看网上都是清一色pika包的例子,就用的pika包,最大问题是非多线程安全,改为使用rabbitpy.大幅改善了pika多线程需要加锁,和外网推送延迟又不能开多线程导致推送慢的问题. rabbit ...
react项目使用bootstrap
曾经对于react项目怎么使用bootstrap纠结了很久,网上也查了好多的资料,有的用react-bootstrap,只要npm install 以后,import就可以使用里面的css了.但是这个 ...
Kafka 2.1.0压缩算法性能测试
Apache Kafka 2.1.0正式支持ZStandard —— ZStandard是Facebook开源的压缩算法,旨在提供超高的压缩比(compression ratio),具体细节参见htt ...
Golang 笔记 3 if、switch、for、select语句
一.if语句 Go的流程控制主要包括条件分支.循环和并发. if语句一般由if关键字.条件表达式和由花括号包裹的代码块组成.在Go中,代码块必须由花括号包裹.这里的条件表达式是结果类型为bool的表 ...
【Static Program Analysis - Chapter 3】Type Analysis
类型分析,个人理解就是(通过静态分析技术)分析出代码中,哪些地方只能是某种或某几种数据类型,这是一种约束. 例如,给定一个程序: 其中,我们可以很直接地得到一些约束: 最后,经过简化可以得到: 对 ...
JAVA课程课后作业之使用递归完成回文
一.思路 1.我的想法是利用数组的做法来进行,先是用scanner录入一个String类 2.然后就是将String转化成char数组 3.递归的就是第一个和最后一个对比,然后第一个加一,最后一个减一 ...
【C++/类与对象总结】
1.以上是对本章知识的大致梳理,下面通过我自己在编程中遇到的问题再次总结. 私有成员必须通过get()函数访问吗?能不能直接调用? 私有成员必须通过公共函数接口去访问,比如设置set()修改成员内容, ...
Python学习之旅（十三）
Python基础知识(12):函数(Ⅲ) 高阶函数 1.map map()函数接收两个参数,一个是函数,一个是Iterable,map将传入的函数依次作用到序列的每个元素,并把结果作为新的Iterat ...

改写pipeline

改写pipeline的更多相关文章

随机推荐

热门专题