xpath解析

xpath在Python的爬虫学习中，起着举足轻重的地位，对比正则表达式 re两者可以完成同样的工作，实现的功能也差不多，但xpath明显比re具有优势，在网页分析上使re退居二线。

xpath 全称为XML Path Language 一种小型的查询语言

xpath的优点：

可在XML中查找信息
支持HTML的查找
通过元素和属性进行导航

python开发使用XPath条件： 由于XPath属于lxml库模块，所以首先要安装库lxml。

from lxml import etree

selector=etree.HTML(源码) #将源码转化为能被XPath匹配的格式

selector.xpath(表达式) #返回为一列表

【1】路径表达式

表达式	描述	实例	解析
/	从根节点选取	`/body/div[1]`	选取根结点下的body下的第一个div标签
//	从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置	`//a`	选取文档中所有的a标签
./	当前节点再次进行xpath	`./a`	选取当前节点下的所有a标签
@	选取属性	`//@calss`	选取所有的class属性

from lxml import etree

html_doc = """

<html><head><title>The Dormouse's story</title></head>

<body>

<p class="title"><b>The Dormouse's story</b></p>

<p class="story">Once upon a time there were three little sisters; and their names were

<a href="http://example.com/elsie" class="sister" id="link1">Elsie</a>,

<a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and

<a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>;

and they lived at the bottom of a well.</p>

<p class="story">...</p>

"""

selector = etree.HTML(html_doc)

print(type(selector)) #<class 'lxml.etree._Element'>

results = selector.xpath("//a")

print(results) # [<Element a at 0x2155de71640>, <Element a at 0x2155e3976c0>, <Element a at 0x2155e397800>]

for result in results:

    href = result.xpath('./@href')

    href1 = result.xpath('./@href')[0] #获取标签里的href值

    href2 = result.xpath('./text()')[0] #获取标签里的文本值

    print(href)#['http://example.com/elsie'] ['http://example.com/lacie'] ['http://example.com/tillie']

    print(href1)#http://example.com/elsie http://example.com/lacie http://example.com/tillie

    print(href2) #Elsie Lacie Tillie

【2】谓语（Predicates）

谓语用来查找某个特定的节点或者包含某个指定的值的节点。

谓语被嵌在方括号中。

在下面的表格中，我们列出了带有谓语的一些路径表达式，以及表达式的结果：

路径表达式	结果
/ul/li[1]	选取属于 ul子元素的第一个 li元素。
/ul/li[last()]	选取属于 ul子元素的最后一个 li元素。
/ul/li[last()-1]	选取属于 ul子元素的倒数第二个 li元素。
//ul/li[position()️]	选取最前面的两个属于 ul元素的子元素的 li元素。
//a[@title]	选取所有拥有名为 title的属性的 a元素。
//a[@title='xx']	选取所有 a元素，且这些元素拥有值为 xx的 title属性。
//a[@title>10] `> < >= <= !=`	选取 a元素的所有 title元素，且其中的 title元素的值须大于 10。
/body/div[@price>35.00]	选取body下price元素值大于35的div节点

【3】选取未知节点

XPath 通配符可用来选取未知的 XML 元素。

通配符	描述
*	匹配任何元素节点。
@*	匹配任何属性节点。
node()	匹配任何类型的节点。

实例

在下面的表格中，我们列出了一些路径表达式，以及这些表达式的结果：

路径表达式	结果
/ul/*	选取 bookstore 元素的所有子元素。
//*	选取文档中的所有元素。
//title[@*]	选取所有带有属性的 title 元素。
//node()	获取所有节点

【4】选取若干路径

通过在路径表达式中使用“|”运算符，您可以选取若干个路径。

实例

在下面的表格中，我们列出了一些路径表达式，以及这些表达式的结果：

路径表达式	结果
//book/title \| //book/price	选取 book 元素的所有 title 和 price 元素。
//title \| //price	选取文档中的所有 title 和 price 元素。
/bookstore/book/title \| //price	选取属于 bookstore 元素的 book 元素的所有 title 元素，以及文档中所有的 price 元素。

逻辑运算

//div[@id="head" and @class="s_down"] # 查找所有id属性等于head并且class属性等于s_down的div标签

//title | //price # 选取文档中的所有 title 和 price 元素,“|”两边必须是完整的xpath路径

属性查询

//div[@id] # 找所有包含id属性的div节点

//div[@id="maincontent"]  # 查找所有id属性等于maincontent的div标签

//@class

//li[@name="xx"]//text()  # 获取li标签name为xx的里面的文本内容

获取第几个标签索引从1开始

tree.xpath('//li[1]/a/text()')  # 获取第一个

tree.xpath('//li[last()]/a/text()')  # 获取最后一个

tree.xpath('//li[last()-1]/a/text()')  # 获取倒数第二个

模糊查询

//div[contains(@id, "he")]  # 查询所有id属性中包含he的div标签

//div[starts-with(@id, "he")] # 查询所有id属性中包以he开头的div标签

//div/h1/text()  # 查找所有div标签下的直接子节点h1的内容

//div/a/@href   # 获取a里面的href属性值

//*  #获取所有

//*[@class="xx"]  #获取所有class为xx的标签

# 获取节点内容转换成字符串

c = tree.xpath('//li/a')[0]

result=etree.tostring(c, encoding='utf-8')

print(result.decode('UTF-8'))

【5】案例

豆瓣Top250基于xpath解析：

import requests

from lxml import etree

url = "https://movie.douban.com/top250?start=0"

headers = {

    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/99.0.4844.82 Safari/537.36"

}

resp = requests.get(url, headers=headers)

tree = etree.HTML(resp.text)  # 加载页面源代码

items = tree.xpath('//li/div[@class="item"]/div[@class="info"]')

for item in items:

    title = item.xpath('./div[@class="hd"]/a/span[1]/text()')[0]

    rating_num = item.xpath('./div[@class="bd"]/div[@class="star"]/span[@class="rating_num"]/text()')[0]

    comment_num = item.xpath('./div[@class="bd"]/div[@class="star"]/span[4]/text()')[0]

    print(title, rating_num, comment_num)

练习：基于xpath完成解析练习

import requests

from lxml import etree

res = requests.get("https://top.baidu.com/board?platform=pc&sa=pcindex_entry", )

selector = etree.HTML(res.text)

rets = selector.xpath('//div[@theme="car"]//div[contains(@class,"item-wrap_Z0BrP ")]')

info = {}

for i in rets:

    name = i.xpath('./div[@class="normal_1glFU"]/a/text()')

    link = i.xpath('./div[@class="normal_1glFU"]/a/@href')

    info[name[0]] = link[0]

print(info)

print(len(info))

Day 11 11.1 Xpath解析的更多相关文章

JAVA通过XPath解析XML性能比较
转自[http://www.cnblogs.com/mouse-coder/p/3451243.html] 最近在做一个小项目,使用到XML文件解析技术,通过对该技术的了解和使用,总结了以下内容. 1 ...
BeautifulSoup与Xpath解析库总结
一.BeautifulSoup解析库 1.快速开始 html_doc = """ <html><head><title>The Dor ...
Xpath解析库的使用
### Xpath常用规则 ## nodename 选取此节点的所有子节点 ## / 从当前节点选取直接子节点 ## // 从当前节点选取子孙节点 ## . 选取当前节点 ## .. 选取当前节点的父 ...
NOIp 11.11/12
最后一场比较正式的NOIp模拟赛,写一发小总结.题目没什么好说的,大部分很简单,先贴一下代码. 1111 T1 //string //by Cydiater //2016.11.11 #include ...
11.11光棍节工作心得——github/MVP
11.11光棍节工作心得 1.根据scrum meeting thirdday中前辈的指导进行学习我在博客中贴了链接,竟然TrackBack引来了原博主,
JAVA通过XPath解析XML性能比较（原创）
(转载请标明原文地址) 最近在做一个小项目,使用到XML文件解析技术,通过对该技术的了解和使用,总结了以下内容. 1 XML文件解析的4种方法通常解析XML文件有四种经典的方法.基本的解析方式有两种 ...
利用XPath解析带有xmlns的XML文件
在.net中,编写读取xml 的程序中提示"未将对象引用设置到对象的实例",当时一看觉得有点奇怪.为什么在读取xml数据的时候也要实例化一个对象.google了才知道,xml文件中 ...
爬虫系列二(数据清洗--->xpath解析数据)
一 xpath介绍 XPath 是一门在 XML 文档中查找信息的语言.XPath 用于在 XML 文档中通过元素和属性进行导航. XPath 使用路径表达式在 XML 文档中进行导航 XPath 包 ...
python开发遇到的坑(1)xpath解析ValueError: Unicode strings with encoding declaration are not supported
Traceback (most recent call last): File "/Users/*******.py", line 37, in <module> Bt ...
xpath解析数据
xpath解析数据 """ xpath 也是一种用于解析xml文档数据的方式 xml path w3c xpath搜索用法在 XPath 中,有七种类型的节点:元素.属 ...

随机推荐

SAP 开具发票的抬头文本带到会计凭证上
#需求将开具发票的抬头文本带到会计凭证上.方便财务处理凭证,不然需要再去编辑凭证,容易遗忘. 达到的效果如图所示: #二代增强SDVFX001 事务码cmod分配增强编写增强出口代码如下: DA ...
通过url跳转到页面锚点
在需要跳到的页面加: function GetQueryString(name) { var reg = new RegExp("(^|&)" + name ...
js实现大转盘抽奖（vue举例）
在开发项目得时候遇到这样一个需求,在移动端项目有个支付抽奖页面,大概效果图如下: 简单介绍一下需求,点击抽奖按钮转盘转动,转盘里边黄色块块是个整张背景图,里边的商品是从接口获取得,包括奖品名称和图片, ...
SVN检出未响应，版本库浏览打不开卡死。
今天遇到一个奇葩问题. 1.换了新电脑,首先SVN地址没问题.检出就未响应,不弹出输入用户名,密码. 2.发现装了讯软加密软件,后安装的SVN.(未告知管理员,对新机加密软件配置).配置完可以正常用了 ...
GPS网络授时仪（网络授时服务器）成功投运攀枝花市中西医结合医院
GPS网络授时仪(网络授时服务器)成功投运攀枝花市中西医结合医院 GPS网络授时仪(网络授时服务器)成功投运攀枝花市中西医结合医院北京华人开创科技发展有限公司技术交流15901092122岳峰概 ...
二、chaosblade实现k8s集群操作
1.执行 Kubernetes 实验场景,需要提前部署 ChaosBlade Operator,Helm 安装包下载地址 https://github.com/chaosblade-io/chaosb ...
pl/sql导出表结构的方法步骤
转载:pl/sql怎么导出表结构-pl/sql导出表结构的方法步骤-下载吧 (xiazaiba.com) PL/SQL Developer是一个专为Oracle数据库开发存储程序单元的集成开发环境,用 ...
(0617 ) centos7运行脚本提示: 没有那个文件或目录 :No such file or directory
https://blog.csdn.net/hehuihh/article/details/88174007 之前也遇到: https://www.cnblogs.com/fancy2333/p/1 ...
UI工具
sketch figma Adobe Photoshop Adobe Illustrator adobe xd
Jenkins安装和自动化部署
1.Jenkins安装机器安装要求可以参考官网 https://www.jenkins.io 2.下载jenkins的war包上传到linux上部署 3.安装jdk.git.maven 3.1.安装j ...

Day 11 11.1 Xpath解析