转 Scrapy笔记(5)- Item详解
Item是保存结构数据的地方,Scrapy可以将解析结果以字典形式返回,但是Python中字典缺少结构,在大型爬虫系统中很不方便。
Item提供了类字典的API,并且可以很方便的声明字段,很多Scrapy组件可以利用Item的其他信息。
定义Item
定义Item非常简单,只需要继承scrapy.Item
类,并将所有字段都定义为scrapy.Field
类型即可
- import scrapy
- class Product(scrapy.Item):
- name = scrapy.Field()
- price = scrapy.Field()
- stock = scrapy.Field()
- last_updated = scrapy.Field(serializer=str)
Item Fields
Field
对象可用来对每个字段指定元数据。例如上面last_updated
的序列化函数指定为str
,可任意指定元数据,不过每种元数据对于不同的组件意义不一样。
Item使用示例
你会看到Item的使用跟Python中的字典API非常类似
创建Item
- >>> product = Product(name='Desktop PC', price=1000)
- >>> print product
- Product(name='Desktop PC', price=1000)
获取值
- >>> product['name']
- Desktop PC
- >>> product.get('name')
- Desktop PC
- >>> product['price']
- 1000
- >>> product['last_updated']
- Traceback (most recent call last):
- ...
- KeyError: 'last_updated'
- >>> product.get('last_updated', 'not set')
- not set
- >>> product['lala'] # getting unknown field
- Traceback (most recent call last):
- ...
- KeyError: 'lala'
- >>> product.get('lala', 'unknown field')
- 'unknown field'
- >>> 'name' in product # is name field populated?
- True
- >>> 'last_updated' in product # is last_updated populated?
- False
- >>> 'last_updated' in product.fields # is last_updated a declared field?
- True
- >>> 'lala' in product.fields # is lala a declared field?
- False
设置值
- >>> product['last_updated'] = 'today'
- >>> product['last_updated']
- today
- >>> product['lala'] = 'test' # setting unknown field
- Traceback (most recent call last):
- ...
- KeyError: 'Product does not support field: lala'
访问所有的值
- >>> product.keys()
- ['price', 'name']
- >>> product.items()
- [('price', 1000), ('name', 'Desktop PC')]
Item Loader
Item Loader为我们提供了生成Item的相当便利的方法。Item为抓取的数据提供了容器,而Item Loader可以让我们非常方便的将输入填充到容器中。
下面我们通过一个例子来展示一般使用方法:
- from scrapy.loader import ItemLoader
- from myproject.items import Product
- def parse(self, response):
- l = ItemLoader(item=Product(), response=response)
- l.add_xpath('name', '//div[@class="product_name"]')
- l.add_xpath('name', '//div[@class="product_title"]')
- l.add_xpath('price', '//p[@id="price"]')
- l.add_css('stock', 'p#stock]')
- l.add_value('last_updated', 'today') # you can also use literal values
- return l.load_item()
注意上面的name
字段是从两个xpath路径添累加后得到。
输入/输出处理器
每个Item Loader对每个Field
都有一个输入处理器和一个输出处理器。输入处理器在数据被接受到时执行,当数据收集完后调用ItemLoader.load_item()
时再执行输出处理器,返回最终结果。
- l = ItemLoader(Product(), some_selector)
- l.add_xpath('name', xpath1) # (1)
- l.add_xpath('name', xpath2) # (2)
- l.add_css('name', css) # (3)
- l.add_value('name', 'test') # (4)
- return l.load_item() # (5)
执行流程是这样的:
xpath1
中的数据被提取出来,然后传输到name
字段的输入处理器中,在输入处理器处理完后生成结果放在Item Loader里面(这时候没有赋值给item)xpath2
数据被提取出来,然后传输给(1)中同样的输入处理器,因为它们都是name
字段的处理器,然后处理结果被附加到(1)的结果后面- 跟2一样
- 跟3一样,不过这次是直接的字面字符串值,先转换成一个单元素的可迭代对象再传给输入处理器
- 上面4步的数据被传输给
name
的输出处理器,将最终的结果赋值给name
字段
自定义Item Loader
使用类定义语法,下面是一个例子
- from scrapy.loader import ItemLoader
- from scrapy.loader.processors import TakeFirst, MapCompose, Join
- class ProductLoader(ItemLoader):
- default_output_processor = TakeFirst()
- name_in = MapCompose(unicode.title)
- name_out = Join()
- price_in = MapCompose(unicode.strip)
- # ...
通过_in
和_out
后缀来定义输入和输出处理器,并且还可以定义默认的ItemLoader.default_input_processor
和ItemLoader.default_input_processor
.
在Field定义中声明输入/输出处理器
还有个地方可以非常方便的添加输入/输出处理器,那就是直接在Field定义中
- import scrapy
- from scrapy.loader.processors import Join, MapCompose, TakeFirst
- from w3lib.html import remove_tags
- def filter_price(value):
- if value.isdigit():
- return value
- class Product(scrapy.Item):
- name = scrapy.Field(
- input_processor=MapCompose(remove_tags),
- output_processor=Join(),
- )
- price = scrapy.Field(
- input_processor=MapCompose(remove_tags, filter_price),
- output_processor=TakeFirst(),
- )
优先级:
- 在Item Loader中定义的
field_in
和field_out
- Filed元数据(
input_processor
和output_processor
关键字) - Item Loader中的默认的
Tips:一般来讲,将输入处理器定义在Item Loader的定义中field_in
,然后将输出处理器定义在Field元数据中
Item Loader上下文
Item Loader上下文被所有输入/输出处理器共享,比如你有一个解析长度的函数
- def parse_length(text, loader_context):
- unit = loader_context.get('unit', 'm')
- # ... length parsing code goes here ...
- return parsed_length
初始化和修改上下文的值
- loader = ItemLoader(product)
- loader.context['unit'] = 'cm'
- loader = ItemLoader(product, unit='cm')
- class ProductLoader(ItemLoader):
- length_out = MapCompose(parse_length, unit='cm')
内置的处理器
Identity
啥也不做TakeFirst
返回第一个非空值,通常用作输出处理器Join
将结果连起来,默认使用空格’ ‘Compose
将函数链接起来形成管道流,产生最后的输出MapCompose
跟上面的Compose
类似,区别在于内部结果在函数中的传递方式.它的输入值是可迭代的,首先将第一个函数依次作用于所有值,产生新的可迭代输入,作为第二个函数的输入,最后生成的结果连起来返回最终值,一般用在输入处理器中。SelectJmes
使用json路径来查询值并返回结果转
Scrapy笔记(5)- Item详解
转 Scrapy笔记(5)- Item详解的更多相关文章
- qml学习笔记(二):可视化元素基类Item详解(上半场anchors等等)
原博主博客地址:http://blog.csdn.net/qq21497936本文章博客地址:http://blog.csdn.net/qq21497936/article/details/78516 ...
- 自学Zabbix4.2 web监控项创建+item详解
自学Zabbix4.2 web监控项创建+item详解 1. web监控项创建 1.1 Scenario 选项卡 Name: 监控项的名称 Application: 放到哪个应用中 Authenti ...
- expect学习笔记及实例详解【转】
1. expect是基于tcl演变而来的,所以很多语法和tcl类似,基本的语法如下所示:1.1 首行加上/usr/bin/expect1.2 spawn: 后面加上需要执行的shell命令,比如说sp ...
- Scrapy的Item_loader机制详解
一.ItemLoader与Item的区别 ItemLoader是负责数据的收集.处理.填充,item仅仅是承载了数据本身 数据的收集.处理.填充归功于item loader中两个重要组件: 输入处理i ...
- Hive笔记--sql语法详解及JavaAPI
Hive SQL 语法详解:http://blog.csdn.net/hguisu/article/details/7256833Hive SQL 学习笔记(常用):http://blog.sina. ...
- 算法笔记--sg函数详解及其模板
算法笔记 参考资料:https://wenku.baidu.com/view/25540742a8956bec0975e3a8.html sg函数大神详解:http://blog.csdn.net/l ...
- Android笔记——四大组件详解与总结
android四大组件分别为activity.service.content provider.broadcast receiver. ------------------------------- ...
- Struts2学习笔记(二)——配置详解
1.Struts2配置文件加载顺序: default.properties(默认常量配置) struts-default.xml(默认配置文件,主要配置bean和拦截器) struts-plugin. ...
- Struts2学习笔记二 配置详解
Struts2执行流程 1.简单执行流程,如下所示: 在浏览器输入请求地址,首先会被过滤器处理,然后查找主配置文件,然后根据地址栏中输入的/hello去每个package中查找为/hello的name ...
随机推荐
- Android stadio 工具使用
android staido 有logcat窗口,她可以显示log信息.还有run窗口. 我以前一直忽略了run窗口,其实蛮重要,蛮好用的.他只会显示你当前运行的进程的log,不用你再去设置filld ...
- BF算法(蛮力匹配算法)
将主串M指定位置和目标串S开始位置进行对比,如果相同将M的下一个字符和S的下一个字符对比,如果不同则M的下一个字符和S的开始位置对比,直到S中每一个字符和M中的连续字符串相等,否则不匹配. C#代码- ...
- 《Java程序员由笨鸟到菜鸟》
<Java程序员由笨鸟到菜鸟> 在众多朋友的支持和鼓励下,<Java程序员由菜鸟到笨鸟>电子版终于和大家见面了.本电子书涵盖了从java基础到javaweb开放框架的大部分内容 ...
- js对数组去重的完整版
数组去重是很常见的一个需求,而各种各样的姿势也很多,常见的如indexOf,或者hash,但是他们还是有缺陷,这里我查了一些资料做补充. 一般方式 //一般方法->使用indexOf Array ...
- 【Linux命令】删除大文件后磁盘空间未释放问题
前言 工作中经常遇到Linux系统磁盘空间不足,但是删除后较大的日志文件后,发现磁盘空间仍没有被释放,有点摸不着头脑,今天博主带大家解决这个问题. 思路 1.工作发现磁盘空间不足: 2.找到占用磁盘空 ...
- docker搭建jira-7.11.1 + 破解
几行命令教你搭建一个jira最新版.所有步骤必不可少.破解补丁需要的请在下面留言. pull docker 镜像: jira:7.11.1(目前的最新版本) mysql:5.7 docker ...
- intellij idea导入不了java.util.Date解决办法
可以在Settings -> Editor -> General -> Auto Import,将Exclude中的java.util.Date删除.
- NIO--1
1.为什么不直接用jdk NIO(1) API繁杂(2) 原始NIO可靠性不是很高.可靠性包括:断开重连,网络闪断,半包读写,失败缓存(3) NIO 的epoll BUG会导致多路复用器Selecto ...
- nodejs & docker
nodejs & docker https://github.com/xgqfrms-GitHub/Node.js/blob/master/Docker-Nodejs/translation. ...
- P2029 跳舞
题目描述 小明今天得到一个跳舞毯游戏程序Dance.游戏每次连续出N个移动的“箭头”,箭头依次标号为1到N,并且的相应的分数S[1..N].如果你能“踏中”第i号箭头,你将获得相应的分数S[i]:否则 ...