scrapy之Selectors

练习url：https://doc.scrapy.org/en/latest/_static/selectors-sample1.html

一获取文本值

　　xpath

In []: response.selector.xpath('//title/text()').extract_first(default='')

Out[]: 'Example website'

　　css

In []: response.selector.css('title::text').extract_first(default='')

Out[]: 'Example website'

　　注：可以省略写成:response.xpath()

二获取属性值

　　xpath

In []: response.selector.xpath('//base/@href').extract_first()

Out[]: 'http://example.com/'

　　css　

In []: response.selector.css('base::attr(href)').extract_first()

Out[]: 'http://example.com/'

　　注: 可以省略写成：response.css

三 xpath,css嵌套使用

　　因为css，xpath返回的是 SelectorList 实例，所有可以嵌套便捷的使用。

　　ps：获取属性，xpath，@已经实现，并不需要 /text()

In []: response.selector.css('img').xpath('@src').extract()

Out[]:

['image1_thumb.jpg',

 'image2_thumb.jpg',

 'image3_thumb.jpg',

 'image4_thumb.jpg',

 'image5_thumb.jpg']

四 .re()

　　.re()

　　.re_first()

　　ps :返回的是unicode构成的列表，所以，不能嵌套使用 .re()

In []: response.selector.css('div > p:nth-of-type(2)::text').extract()

Out[]: ['333xxx']

In []: response.selector.css('div > p:nth-of-type(2)::text').extract_first()

Out[]: '333xxx'

In []: response.selector.css('div > p:nth-of-type(2)::text').re_first('\w+')

Out[]: '333xxx'

In []: response.selector.css('div > p:nth-of-type(2)::text').re_first('[A-Za-z]+')

Out[]: 'xxx'

In []: response.selector.css('div > p:nth-of-type(2)::text').re('[A-Za-z]+')

Out[]: ['xxx']

五关于Xpath的相对路径查找的注意

　　查找div标签下p标签

<html lang="zh-CN">

<head>

</head>

<body>

    <p></p>

    <div>

        <p></p>

        <p></p>

    </div>

</body>

</html>

　　错误做法：

In []: divs = response.selector.xpath('//div')

In []: for p in divs.xpath('//p'):

   ...:     print(p.extract())

   ...:

<p></p>

<p></p>

<p></p>

　　正确做法 1：

In []: divs = response.selector.css('div')

In []: for p in divs.xpath('.//p'):

   ...:     print(p.extract())

   ...:

   ...:

<p></p>

<p></p>

　　正确做法 2：

In []: divs = response.selector.css('div')

In []: for p in divs.xpath('p'):

   ...:     print(p.extract())

   ...:

   ...:

   ...:

<p></p>

<p></p>

scrapy之Selectors的更多相关文章

python爬虫scrapy的Selectors参考文档
http://doc.scrapy.org/en/1.0/topics/selectors.html#topics-selectors-htmlcode
Scrapy里Selectors 四种基础的方法
在Scrapy里面,Selectors 有四种基础的方法xpath():返回一系列的selectors,每一个select表示一个xpath参数表达式选择的节点css():返回一系列的selector ...
scrapy的selectors
from scrapy import Selector >>> doc = """ ... <div> ... <ul> ...
【Scrapy】Selectors
Constructing selectors For convenience,response objects exposes a selector on .selector attribute,it ...
Scrapy Selectors 选择器
0. 1.参考 <用Python写网络爬虫>——2.2 三种网页抓取方法 re / lxml / BeautifulSoup 需要注意的是,lxml在内部实现中,实际上是将CSS选择器转 ...
Scrapy进阶知识点总结（二）——选择器Selectors
1. Selectors选择器在抓取网页时,您需要执行的最常见任务是从HTML源提取数据.有几个库可用于实现此目的,例如: BeautifulSoup是Python程序员中非常流行的Web抓取库,它 ...
Scrapy框架——介绍、安装、命令行创建，启动、项目目录结构介绍、Spiders文件夹详解（包括去重规则）、Selectors解析页面、Items、pipelines（自定义pipeline）、下载中间件（Downloader Middleware）、爬虫中间件、信号
一介绍 Scrapy一个开源和协作的框架,其最初是为了页面抓取 (更确切来说, 网络抓取 )所设计的,使用它可以以快速.简单.可扩展的方式从网站中提取所需的数据.但目前Scrapy的用途十分广泛,可 ...
scrapy框架之Selectors选择器
Selectors(选择器) 当您抓取网页时,您需要执行的最常见任务是从HTML源中提取数据.有几个库可以实现这一点: BeautifulSoup是Python程序员中非常流行的网络抓取库,它基于HT ...
Scrapy 爬虫使用指南完全教程
scrapy note command 全局命令: startproject :在 project_name 文件夹下创建一个名为 project_name 的Scrapy项目. scrapy sta ...

随机推荐

centos7-httpd服务器
Apache WEB服务器入门简介: Apache HTTP Server是Apache软件基金会的一个开源的网页服务器,可以运行在几乎所有广泛使用的计算机平台上,由于其跨平台和安全性被广泛使用,是目 ...
WINDOWS-API：关于线程 GetCurrentThread、GetCurrentThreadId、GetCurrentProcess、GetCurrentProcessId
{返回当前线程的虚拟句柄} GetCurrentThread: THandle; {返回当前线程 ID} GetCurrentThreadId: DWORD; {返回当前进程的虚拟句柄} GetCur ...
C#4.0中的dynamic关键字和ExpandoObject对象
dynamic最大的特点我想莫过于在它的类型在运行时才确定,这也是它与往静态类型关键字的最大区别.如果你在你的代码操作中用到了dynamic关键字去定义一个变量时,那么这个变量在编译的时候编译器不会对 ...
Bootstrap 下拉菜单(dropdown)插件
使用下拉菜单的插件,您可以向任何组件(比如:导航栏,标签页,胶囊式导航,按钮)添加下拉菜单用法您可以切换下拉菜单(dropdown)插件隐藏内容 1.通过data属性,向链接或按钮添加data-t ...
Typescript学习（一）----准备篇（vscode编译ts文件）
什么是typescript? typescript是微软开发的一个脚本语言.他是JavaScript的超级,他遵循es6语法规范,他扩展了JavaScript的语法. 理解es5,es6,javasc ...
gradle更换国内镜像、配置本地仓库地址
gradle更换国内镜像,安装包解压后init.d文件夹下面创建init.gradle文件,内容如下 allprojects{ repositories { def REPOSITORY_URL = ...
【MySql】Mysql ERROR 1067: Invalid default value for ‘date’ 解决
在给一个表添加字段的时候,忽然发现会报一个date类型的字段的默认值错误,郁闷~ 经过排查,原来是MySQL的配置问题,在wamp下,MySQL 5.7里是没有设置 SQL_MODE 的. 1.my. ...
pre-commit钩子，代码质量检查
目前基本使用三款js代码质量检查工具: jslint, jshint, eslint.许多IDE里面也有对应的检查插件,在每次ctrl + s 保存文件的时候,检查当前文件是否符合规范,保证代码质量. ...
Ubuntu 15 下 Qt 配置mysql链接及基本操作
序最近需要在Linux下做一个unix网络编程项目,选择了Ubuntu 最新版本15.04 : 开发环境:Qt 5 数据库: MySQL 安装Qt 和 MySQL 简要介绍一下软件的安装! 安装Qt ...
ZOJ 2314 (sgu 194) Reactor Cooling (无源汇有上下界最大流)
题意: 给定n个点和m条边, 每条边有流量上下限[b,c], 求是否存在一种流动方法使得每条边流量在范围内, 而且每个点的流入 = 流出分析: 无源汇有上下界最大流模板, 记录每个点流的 in 和 ...

scrapy之Selectors

scrapy之Selectors的更多相关文章

随机推荐

热门专题