原文标题：《Python网络爬虫—Scrapy的选择器Xpath》 对原文有所修改和演绎

优势

XPath相较于CSS选择器，可以更方便的选取

没有id class name属性的标签
属性或文本特征不显著的标签
嵌套层次极其复杂的标签

XPath路径

定位方式

/ 绝对路径 表示从根节点开始选取

// 相对路径 表示从任意节点开始

基本的节点定位

#查找html下的body下的form下的所有input节点

/html/body/form/input

#查找所有input节点

//input

使用通配符`*`定位

#查找form节点下的所有节点

//form/*#查找所有节点//*

#查找所有input节点（input至少有爷爷辈亲戚节点）

//*/input

使用索引定位

#定位 第8个td下的 第2个a节点

//*/td[7]/a[1]

#定位 第8个td下的 第3个span节点

//*/td[7]/span[2]

#定位 最后一个td下的  最后一个a节点

//*/td[last()]/a[last()]

使用属性

#定位所有包含name属性的input节点

//input[@name]

#定位含有属性的所有的input节点

//input[@*]

#定位所有value=2的input节点

//input[@value='2']

#使用多个属性定位

//input[@value='2'][@id='3']

//input[@value='2' and @id='3']

使用函数定位

函数	含义
contains(,)	前者中包含后者
text()	获取节点中的字符串
starts-with()	匹配起始位置的字符串

<a class="menu_hot" href="/ads/auth/promote.html">应用推广</a>

#定位href属性中包含“promote.html”的所有a节点

//a[contains(@href,'promote.html')]

#元素内的文本为“应用推广”的所有a节点

//a[text()='应用推广']

#href属性值是以“/ads”开头的所有a节点

//a[starts-with(@href,'/ads')]

使用XPath轴

这部分类似BeautifulSoup中的sibling、parents、children方法。

轴名称	含义
ancestor	选取当前节点的所有先辈节点
ancestor-or-self	选取当前节点的所有先辈节点及当前节点自己
attribute	选取当前节点的所有属性
child	选取当前节点的所有子节点
descendant	选取当前节点的所有后代节点
descendant-or-self	选取当前节点的所有后代节点及当前节点自己
following	选取党建节点结束后的所有节点
parent	选取当前节点的父节点
preceding-sibling	选取当前节点之前的所有同辈节点
self	选取当前节点自己

原文地址：http://mp.weixin.qq.com/s/UT4UFDpgo2ER300zq_uqsQ

Python中Scrapy框架元素选择器XPath的简单实例的更多相关文章

python爬虫中scrapy框架是否安装成功及简单创建
判断框架是否安装成功,在新建的爬虫文件夹下打开盘符中框输入cmd,在命令中输入scrapy,若显示如下图所示,则说明成功安装爬虫框架: 查看当前版本:在刚刚打开的命令框内输入scrapy versio ...
python爬虫scrapy框架——人工识别登录知乎倒立文字验证码和数字英文验证码(2)
操作环境:python3 在上一文中python爬虫scrapy框架--人工识别知乎登录知乎倒立文字验证码和数字英文验证码(1)我们已经介绍了用Requests库来登录知乎,本文如果看不懂可以先看之前 ...
python的scrapy框架的使用和xpath的使用 && scrapy中request和response的函数参数 && parse()函数运行机制
这篇博客主要是讲一下scrapy框架的使用,对于糗事百科爬取数据并未去专门处理最后爬取的数据保存为json格式一.先说一下pyharm怎么去看一些函数在源码中的代码实现按着ctrl然后点击函数就 ...
python爬虫scrapy框架
Scrapy 框架关注公众号"轻松学编程"了解更多. 一.简介 Scrapy是用纯Python实现一个为了爬取网站数据.提取结构性数据而编写的应用框架,用途非常广泛. 框架的力量 ...
Python爬虫Scrapy框架入门（2）
本文是跟着大神博客,尝试从网站上爬一堆东西,一堆你懂得的东西附上原创链接: http://www.cnblogs.com/qiyeboy/p/5428240.html 基本思路是,查看网页元素,填写 ...
Python使用Scrapy框架爬取数据存入CSV文件(Python爬虫实战4)
1. Scrapy框架 Scrapy是python下实现爬虫功能的框架,能够将数据解析.数据处理.数据存储合为一体功能的爬虫框架. 2. Scrapy安装 1. 安装依赖包 yum install g ...
基于python的scrapy框架爬取豆瓣电影及其可视化
1.Scrapy框架介绍主要介绍,spiders,engine,scheduler,downloader,Item pipeline scrapy常见命令如下: 对应在scrapy文件中有,自己增加 ...
Python爬虫 ---scrapy框架初探及实战
目录 Scrapy框架安装操作环境介绍安装scrapy框架(linux系统下) 检测安装是否成功 Scrapy框架爬取原理 Scrapy框架的主体结构分为五个部分: 它还有两个可以自定义下载功能的 ...
Python爬虫Scrapy框架入门（1）
也许是很少接触python的原因,我觉得是Scrapy框架和以往Java框架很不一样:它真的是个框架. 从表层来看,与Java框架引入jar包.配置xml或.property文件不同,Scrapy的模 ...

随机推荐

Docker以及K8S学习总结----From各位大神...
Docker的安装使用. 1. 修改yum源到境内站点: wget -O /etc/yum.repos.d/CentOS-Base.repo http://mirrors.aliyun.com/re ...
Docker操作删除所有容器镜像
借鉴博客:https://www.cnblogs.com/yanyouqiang/p/8301856.html https://blog.csdn.net/wy_97/article/details/ ...
在linux上安装Scala详细步骤
scala在linux安装很简单,就是下载,解压,配置环境变量,source一下成功. 提君博客原创 >>提君博客原创 http://www.cnblogs.com/tijun/ < ...
python数学第七天【期望的性质】
Yii2上传图片插件使用
例子: 1.在表单中: <?php $form = \yii\widgets\ActiveForm::begin([ 'options'=>[ 'class' => 'form-ho ...
使用Windows任务计划程序运行Windows PowerShell脚本
创建计划任务以运行PowerShell脚本我需要创建一个计划任务来运行Windows PowerShell脚本的第一件事是我将执行的命令行.找到这个的简单方法是使用Run 命令.有时,我需要知道什么 ...
name设置id的方式解决多个单选域冲突现象同时有利于从动态网页取值
Android View相关知识问答
Android View相关核心知识问答 Activity Window View之间的三角关系你真的了解View的坐标吗? 在渲染前获取 View 的宽高 5种手势工具类浅析Android的窗口
前端使用Javascrip实现图片轮播
Javascript实现网页图片自动轮播 1.创建一个img标签设置默认图片,以及图片的高度和宽度,为了大家方便,我将CSS样式和JS语句都写在一个html文件中,演示用的图片来自小明官网:'htt ...
BZOJ3724PA2014Final Krolestwo——欧拉回路+构造
题目描述你有一个无向连通图,边的总数为偶数.设图中有k个奇点(度数为奇数的点),你需要把它们配成k/2个点对(显然k被2整除).对于每个点对(u,v),你需要用一条长度为偶数(假设每条边长度为1)的 ...

Python中Scrapy框架元素选择器XPath的简单实例

优势

XPath路径

基本的节点定位

使用通配符*定位

使用索引定位

使用属性

使用函数定位

使用XPath轴

原文地址：http://mp.weixin.qq.com/s/UT4UFDpgo2ER300zq_uqsQ

Python中Scrapy框架元素选择器XPath的简单实例的更多相关文章

随机推荐

热门专题

使用通配符`*`定位