如何使用lxml的XPath功能

　　用python写爬虫呢，最常见的过滤方式有BeautifulSoup, css selector, XPath，如果使用前两个，BeautifulSoup包就能解决，然而使用XPath，就要引入lxml包了。

接下来我以我的博客为例，教大家怎么使用XPath。

我们要做什么：

关于XPath，网上有诸多语法教程，我不再详细介绍。

我们要抓取的是 http://www.cnblogs.com/chenyansu/ 中第三篇文章，7月15日的文章的简介，它在网页中显示为这样的：

　　在chrome浏览器中右键点击相关正文，选择最后的检查选项：将在右边出现一个文档树，相关位置已被选定，右键，copy -> copy XPath

　得到结果：'//*[@id="main"]/div[3]/div[2]'

实践代码：

import requests
from lxml import etree

# requests包
testurl = "http://www.cnblogs.com/chenyansu/"
session = requests.Session()
s = session.get(testurl)

# lxml无法处理响应文件，用.content输出正文
s = s.content

# lxml包
# 将对象转化为html
s = etree.HTML(s)

# html拥有xpath方法
x = s.xpath('//*[@id="main"]/div[3]/div[2]')
print(x)

# 循环输出x内容
for child in x:
    print(child.text)

总体思路是：

用requests包获得全部网页内容 -> 用.contente选取正文 -> 用lxml转换为html -> 使用XPath -> 将结果循环输出

注意：

利用XPath对table的绝对定位有些问题, 比如说

'//*[@id="main"]/section/div/table/tbody/tr[8]/td/text()'

这样定位到的会是一个空的list.

建议使用'//td'这样的相对定位，这样将得到所有的表格内容的list，再利用下标或者切片输出。

如何使用lxml的XPath功能的更多相关文章

lxml etree xpath
from lxml import etree #####################基本用法: ##################### html = ''' <h1 class=&quo ...
爬虫之lxml - etree - xpath的使用
# 解析原理: # - 获取页面源码数据 # - 实例化一个etree对象,并且将页面源码数据加载到该对象中 # - 调用该对象的xpath方法进行指定标签定位 # - xpath函数必须结合着xpa ...
lxml的XPath解析
BeautifulSoup 可以将lxml作为默认的解析器使用,同样lxml可以单独使用.下面比较这两者之间优缺点: BeautifulSoup和lxml原理不一样,BeautifulSoup是基于D ...
在selenium测试中使用XPATH功能函数starts-with、contains、descendant、ancestor、text()定位网页元素
项目中一些使用xpath函数的复杂例子,记录于此 1. 使用starts-with //div[starts-with(@id,'res')]//table//tr//td[2]//table//tr ...
Xpath语法与lxml库的用法
BeautifulSoup 已经是非常强大的库了,不过还有一些比较流行的解析库,例如 lxml,使用的是 Xpath 语法,同样是效率比较高的解析方法. 1.安装 pip install lxml 2 ...
网络爬虫之Selenium模块和Xpath表达式+Lxml解析库的使用
实际生产环境下,我们一般使用lxml的xpath来解析出我们想要的数据,本篇博客将重点整理Selenium和Xpath表达式,关于CSS选择器,将另外再整理一篇! 一.介绍: selenium最初是一 ...
XPath简介、功能及使用方法
html = '''<html><head><title>The Dormouse's story</title></head><bo ...
python爬微信公众号前10篇历史文章（3）-lxml&xpath初探
理解lxml以及xpath 什么是lxml? python中用来处理XML和HTML的library.与其他相比,它能提供很好的性能, 并且它支持XPath. 具体可以查看官方文档->http: ...
【Python】Python加lxml实现图片解析下载功能
1.下载网页:OpenHtml.py import urllib.request from urllib.parse import quote class HtmlLoader(object): de ...

随机推荐

深入理解JavaScript中的闭包
闭包没有想象的那么简单闭包的概念在JavaScript中占据了十分重要的地位,有不少开发者分不清匿名函数和闭包的概念,把它们混为一谈,我希望借这篇文章能够让大家对闭包有一个清晰的认识. 大家都知道变 ...
w3c编程挑战-初级脚本算法
之前偶然看到了w3c上的编程挑战题,就像拿来试试手,先做的是初级脚本算法,总体不难,如果有更好的方法,希望能一起交流! 1.翻转字符串先把字符串转化成数组,再借助数组的reverse方法翻转数组顺序 ...
Visual Studio 中指定自定义生成事件
自定义生成事件打开方式通过指定自定义生成事件,可以在生成开始之前或在它完成之后自动运行命令.在Visual Studio中通过右键项目->属性进入项目属性菜单. 自定义生成事件的语法生成事 ...
[LeetCode] Friend Circles 朋友圈
There are N students in a class. Some of them are friends, while some are not. Their friendship is t ...
[leetcode-582-Kill Process]
Given n processes, each process has a unique PID (process id) and its PPID (parent process id). Each ...
逻辑性最强的React Native环境搭建与调试
React Native(以下简称RN),已经“火”了好一段时间了,网上的资料相对也很丰富,只是一直迟迟没有发布1.0,不过出身豪门(Facebook)的RN和国内顶级互联网公司对于RN的实践与应用, ...
asp.net中怎样调用存储过程和存储过程的写法(转载，留着自己看)
asp.net中怎样调用存储过程和存储过程的写法创建一个只有输入参数的存储过程 create procedure proc_user@name varchar(20),@Password varch ...
kbengine所有的demo源代码
回复才可见的内容https://github.com/kbengine/kbengine_ue4_demo回复才可见的内容https://github.com/kbengine/kbengine_og ...
React Image加载图片过大导致ListView滑动卡顿
今天莫名的发现ListView加载Item很卡,一顿一顿的... ListView Item 中只加载一张图片,小编从百度爸爸上随便复制的链接,这张图片很大,以致埋下如此大坑... Image的Sty ...
H3CNE实验：通过Console端口本地访问H3C设备
连接好Console线后,将交换机开机,在SecureCRT上会显示如下信息: Starting...... RAMLine.....OK System is booting............. ...

如何使用lxml的XPath功能

如何使用lxml的XPath功能的更多相关文章

随机推荐

热门专题