【转】XPath的学习

xpath的作用就是两个字“定位”，运用各种方法进行快速准确的定位，推荐两个非常有用的的firefox工具：firebug和xpath checker

定位

1.依靠自己属性，文本定位

//td[text()='xxx']

//div[contains(@class,'xxx')]

//div[@class='xxx' and @type='xxx']

2.依靠父节点定位

//div[@class='xxx']/div

//div[@id='xxx']/div

3.依靠子节点定位

//div[div[@id='xxx']]

//div[div[@name='xxx']]

4.混合型

//div[div[@name='xxx']]/img

//td[a/font[contains(text(),'xxx')]]//input[@type='xxx']

xpath的学习-拓展

1.following-sibling

following-sibling即为“选择当前节点之后的所有同级节点”，那么没有加上“sibling”关键字的，搜索的就是之上/之下的所有节点，忽略同级概念，例如：

<div>

<input>

</div>

要定位第二个input：//input[@id='123']/following-sibling::input

2.preceding-sibling

preceding-sibling的解释是“选取当前节点之前的所有同级节点”，那么没有加上“sibling”关键字的，搜索的就是之上/之下的所有节点，忽略同级概念， preceding-sibling和following-sibling是刚好相反的

<div>

</div>

要定位第二个input：//input[@id='123']/preceding-sibling::span

3.contains

和字面意思一样就是包含，例如：//div[contains(@class,'xxx')]

4.starts-with

和字面意思一样就是以某某开头，例如：//input[starts-with(@class,'xxx')]

5.not

就是否定的意思

比如找一个id不为123的input：input[not[id='123']]

又如找一个文本中不包含xxx字段的span：//span[not(contains(text(),'xxx'))]

xpath的学习-补充

绝对路径 html/body/div/span[2]/input[2] 中间结构变化，就失效

相对路径 //开始，在整个html source里找，不管在什么位置

索引[x] //div/input[2] div下面第二个input

position()=2position()>3position()<3

例如html：<div id="positions">

<input>

<span>test position()1</span>

<span>test position()2</span>

<span>test position()3</span>

<span>test position()4</span>

<span>test position()5</span>

</input>

</div>

获取第一个span，可以是//div[@id='positions']/span[1]，也可以是//div[@id='positions']/span[position()=1]

//div[@id='positions']/span[position()>3]就是定位了test position()4和test position()5

//div[@id='positions']/span[position()<3]就是定位了test position()1和test position()2

last()last()-1

以上面的html为例子，获取最后一个span：//div[@id='positions']/span[last()]

以上面的html为例子，获取倒数第二个span：//div[@id='positions']/span[last()-1]

属性定位@class //div[@class] 有class属性的div

属性值定位，前面已经讲过了 //div[@class='xxx']

功能关键字

1.常用

and/[][]，比如://span[@name='xxx' and text()='xxx']也是可以写成//span[@name='xxx'][text()='xxx']

or，比如以上面html为例子，定位文本为test position()5和test position()4的span：//div[@id='positions']/span[text()='test position()5' or text()='test position()4']

not,contains,starts-with

ends-with 在xpath中是没有这个的

2.不常用的

substring,substring-before,substing-after

sbustring(str,start-position,length) 比如html：

</div>

定位上面html中span：//div[@id='xxx']/span[substring(@name,3,5)='xxxxx']

substring-before的用法，比如html

</div>

定位上面html中span：//div[@id="xxx"]/span[sbustring-before(@class,"-")="spanclass1"]

substring-after的用法，比如html

</div>

定位上面html中span：//div[@id="xxx"]/span[sbustring-after(@class,"-")="spanclass22"]

通配符 *

比如//span[@*="xxx"]指定位span中任意属性包含xxx的

比如//*[@*="xxx"]指定位页面中任意属性保护xxx的标签

Axes 轴使用 XPath 的轴（axis）进行元素定位

轴：
XPath轴(XPath Axes)可定义某个相对于当前节点的节点集：
1、child 选取当前节点的所有子元素
2、parent 选取当前节点的父节点
3、descendant 选取当前节点的所有后代元素（子、孙等）
4、ancestor 选取当前节点的所有先辈（父、祖父等）
5、descendant-or-self 选取当前节点的所有后代元素（子、孙等）以及当前节点本身
6、ancestor-or-self 选取当前节点的所有先辈（父、祖父等）以及当前节点本身
7、preceding-sibling 选取当前节点的开始标签之前的所有同级节点
8、following-sibling 选取当前节点的结束标签之后的所有同级节点
9、preceding 选取文档中当前节点的开始标签之前的所有节点
10、following 选取文档中当前节点的结束标签之后的所有节点
11、self 选取当前节点
12、attribute 选取当前节点的所有属性
13、namespace 选取当前节点的所有命名空间节点

使用的时候注意加上::


XPath轴关键字	轴的含义说明	定位表达式示例	表达式解释
ancestor	选择当前节点上层的所有节点	//img[@alt='div2-img2']/ancestor::div	查找到alt属性值为div2-img的图片，并基于图片位置找到他上级的div页面元素
descendant	选择当前节点下层的所有节点注：不能超出当前节点的结束标签	//div[@name='div2']/descendant::img	查找到name属性值的div页面元素，并基于div的位置找到他下级所有节点中的img页面元素
following	选取当前节点的结束标签之后的所有节点注：仔细体会与descendant的区别	//div[@id='div1']/following::img	超找到id 属性值为div1的div页面元素，并基于div的位置找到它后面(结束标签之后)节点中的img页面元素
following-sibling	选取当前节点的结束标签之后的所有平级节点	//a[@href='http://www.sogou.com']/follo wing-sibling::input	查找到链接地址为http://www.sogou.com的链接页面元素，并基于链接的位置找到它后续节点中input页面元素
preceding	选择当前节点开始标签之前的所有节点	//img[@alt='div2-img2']/preceding::div	查找到alt属性值为div2-img2的图片页面元素，并基于图片的位置找到它前面节点中的div页面元素
preceding-sibling	选择当前节点开始标签之前的所有同级节点	//img[@alt='div2-img2']/preceding-sibling ::a[1]	查找到alt属性值为div2-img2的图片页面元素，并基于图片的位置找到它前面同级节点中的第二个链接页面元素

XPath 使用页面元素的属性值定位

预期定位的页面元素	定位表达式示例	使用的属性值
定位页面的第一个图片	//img[@href='http://www.sogou.com']	使用img标签的href属性值
定位第二个div中第一个Input输入框	//div[@name='div2']/input[@name='div2input']	使用div标签的name属性值使用 input标签的name 属性值
定位第一个div中的第一个链接	//div[@id='div1']/a[@href='http://www.sogou.com']	使用的div标签的id 属性值使用了a标签的href属性值
定位页面的查询按钮	//input[@type='button']	使用了type属性值

参考：http://www.cnblogs.com/xxyBlogs/p/4244073.html

　　　http://www.cnblogs.com/testlife007/p/4263745.html

【转】XPath的学习的更多相关文章

xpath的学习
xpath的作用就是两个字“定位”,运用各种方法进行快速准确的定位,推荐两个非常有用的的firefox工具:firebug和xpath checker 定位 1.依靠自己属性,文本定位 //td[ ...
Xpath语法学习
贴几个我学习Xpath的参考 1 基本使用的参考 XPath学习:基本语法(一) 2 较为详细且清晰例子参考,推荐 XPath 详解,总结 3 详细语法参考 Xpath语法格式整理 4 官方参考 XP ...
JAVA与DOM解析器提高（DOM/SAX/JDOM/DOM4j/XPath）学习笔记二
要求必备知识 JAVA基础知识.XML基础知识. 开发环境 MyEclipse10 资料下载源码下载 sax.dom是两种对xml文档进行解析的方法(没有具体实现,只是接口),所以只有它们是无 ...
Xpath注入学习
xpath简介: 提到xpath就要先说下xml,xml意为可扩展标记语言,简单来说就是一种存储数据的标准格式,可以把他视为一个小型的数据库,他可以解决数据在网上传输的标准问题.是一种比数据库更具通用 ...
爬虫学习（十三）——xpath基础学习
lxml的作用 lxml是HTML.xml的解析器,主要的功能是如何解析和提取HTML和xml数据 lxml和正则一样,也是使用C来实现的,是一款高性能的python HTML/xml解析器,我们可以 ...
XmlDocument.selectNodes() and selectSingleNode()的xpath的学习资料
Xpath网页: http://www.w3school.com.cn/xpath/xpath_syntax.asp XDocument.parse(string)类似于XmlDocument.loa ...
xpath库学习
xpath解析是我们在爬虫中最常用也是最通用的一种数据解析方式. 环境安装 pip install lxml 解析原理使用通用爬虫爬取网页数据实例化etree对象,且将页面数据加载到该对象中使用 ...
Xpath基础学习
方法获取文本 a/text() 获取a标签下的文本 a//text() 获取a标签下所有标签的文本 a[text()='xxx']获取文本为xxx的a标签 @符号 a/@href 获取a标签的hre ...
Xpath语法学习记录
高级参考:https://blog.csdn.net/wudaoshihun/article/details/82226122 举例: 1 <!DOCTYPE html> 2 <ht ...

随机推荐

System.load(String filename)和System.loadLibrary(String libname)的区别
前言之前一篇文章在写Native方法的时候,第一个步骤里面有这么一段代码 static { System.load("D:" + File.separator + "H ...
Github注册账户
这是注册页面: 注册完后应该会受到邮件,但我一直没有收到,换了邮箱也没有用 ± 账户可以登上去却没办法创建仓库.
判断当前日期是否在[startDate, endDate]区间
/** * 判断当前日期是否在[startDate, endDate]区间 * * @param startDate 开始日期 * @param endDate 结束日期 * @author jqli ...
Linux网络编程系列-TCP编程实例
实例: client #include <stdio.h> #include <sys/socket.h> #include <netinet/in.h> #inc ...
java内存管理总结
编译好的java程序需要运行在jvm中. 程序,无论是代码还是数据,都需要存储在内存中.JVM为java提供并管理所需要的内存空间. JVM内存分为堆.栈.方法区. 对象存储在堆中. This liv ...
一则JVM memory leak解决的过程
起因是我们的集群应用(3台机器)新版本测试过程中,一般的JVM内存占用都在1G左右, 但在运行了一段时间后,慢慢升到了4G, 这是一个明显不正常的现象. 定位过程: 1.先在该机器上按照步骤尝试重 ...
List.Foreach与C#的foreach的区别
几年前参加面试时就被提问过,现在面试别人时也经常提到这个问题. 今天小试了一下.得出如下几点: 1. 首先,mscorlib里System.Collections.Generic. List<T ...
批处理集锦——(5)使用dir查找文件
eg dir /a-d /s /b *.bat -d表示不显示.bat结尾的文件夹
java 线程协作 wait（等待）与 notiy（通知）
一.wait().notify()和notifyAll() 为了更好的支持多线程之间的协作,JDK提供了三个重要的本地方法 //调用某个对象的wait()方法能让当前线程阻塞,并且当前线程必须拥有此对 ...
Tomcat源码解读系列（一）——server.xml文件的配置
Tomcat是J2EE开发人员最常用到的开发工具,在Java Web应用的调试开发和实际部署中,我们都可以看到Tomcat的影子.大多数时候,我们可以将Tomcat当做一个黑盒来看待,只需要将编写的J ...

【转】XPath的学习

【转】XPath的学习的更多相关文章

随机推荐

热门专题