python之lxml(xpath)

bs4确实没这个好用，bs4的树太复杂

lxml很好

定位非常好

详细解说在注释里面有了

 #!/usr/bin/python3.4

 # -*- coding: utf-8 -*-

 from lxml import etree

 import urllib.request

 # 目标网址的html可以看一下

 url = "http://www.1kkk.com/manhua589/"

 # 解析网址

 data = urllib.request.urlopen(url).read()

 # 解码

 html = data.decode('UTF-8','ignore')

 page = etree.HTML(html.lower())

 # 查找的目标样式如下

 """

 ...

 <ul class="sy_nr1 cplist_ullg">

     <li>

       <a href="/vol1-6871/" class="tg">第1卷</a>（96页）</li>

     <li>

       <a href="/vol2-6872/" class="tg">第2卷</a>（90页）</li>

     <li>

       <a href="/vol3-6873/" class="tg">第3卷</a>（95页）</li>

     <li>

       <a href="/vol4-6874/" class="tg">第4卷</a>（94页）</li>

     <li>

       <a href="/vol5-6875/" class="tg">第5卷</a>（95页）</li>

     ...

 """

 # 找到ul下li下的a中的href

 hrefs = page.xpath('//ul[@class="sy_nr1 cplist_ullg"][2]/li/a/@href')

 # 找到<a>...</a>之间的文字

 hrefnames = page.xpath('//ul[@class="sy_nr1 cplist_ullg"][2]/li/a/text()')

 # 找到页数

 hrefpages = page.xpath('//ul[@class="sy_nr1 cplist_ullg"][2]/li/text()')

 for href in hrefs:

     # 打印出来

     print(href)

打印结果：

 /vol1-6871/

 /vol2-6872/

 /vol3-6873/

 /vol4-6874/

 /vol5-6875/

 /vol6-6876/

 /vol7-6877/

 /vol8-6878/

 /vol9-6879/

 /vol10-6880/

 /vol11-23456/

 /vol12-23457/

 /vol13-23695/

 /vol14-28326/

 /vol15-31740/

 /ch145-149-33558/

 /ch150-33559/

 /ch151-197255/

 /ch152-33560/

 /ch153-33561/

 /ch154-33562/

 /ch155-33563/

 /ch156-33564/

 /ch157-33565/

 ...

python之lxml(xpath)的更多相关文章

python中使用XPath
XPath在Python的爬虫学习中,起着举足轻重的地位,对比正则表达式 re两者可以完成同样的工作,实现的功能也差不多,但XPath明显比re具有优势,在网页分析上使re退居二线. XPath介绍: ...
python中使用XPath笔记
XPath在Python的爬虫学习中,起着举足轻重的地位,对比正则表达式 re两者可以完成同样的工作,实现的功能也差不多,但XPath明显比re具有优势,在网页分析上使re退居二线. XPath介绍: ...
python爬虫：XPath语法和使用示例
python爬虫:XPath语法和使用示例 XPath(XML Path Language)是一门在XML文档中查找信息的语言,可以用来在XML文档中对元素和属性进行遍历. 选取节点 XPath使用路 ...
Python爬虫之xpath语法及案例使用
Python爬虫之xpath语法及案例使用 ---- 钢铁侠的知识库 2022.08.15 我们在写Python爬虫时,经常需要对网页提取信息,如果用传统正则表达去写会增加很多工作量,此时需要一种对数 ...
非常全的一份Python爬虫的Xpath博文
非常全的一份Python爬虫的Xpath博文 Xpath 是 python 爬虫过程中非常重要的一个用来定位的一种语法. 一.开始使用首先我们需要得到一个 HTML 源代码,用来模拟爬取网页中的源代 ...
Windows下Python安装lxml
1.下载easy_install的安装包,下载地址:https://pypi.Python.org/pypi/setuptools 我是Windows7,所以直接下载Windows(Simplify) ...
requests+lxml+xpath爬取豆瓣电影
(1)lxml解析html from lxml import etree #创建一个html对象 html=stree.HTML(text) result=etree.tostring(html,en ...
python爬微信公众号前10篇历史文章（3）-lxml&xpath初探
理解lxml以及xpath 什么是lxml? python中用来处理XML和HTML的library.与其他相比,它能提供很好的性能, 并且它支持XPath. 具体可以查看官方文档->http: ...
Python 通过lxml遍历html xpath
#coding:utf-8 ''' Created on 2017年10月9日 @author: li.liu ''' from selenium import webdriver from lxml ...

随机推荐

Unix command 积累
UNIX is a multi-user multitasking-optimized operating system that can run on various hardware platfo ...
C#_控件——CheckBox，TextBox，RequiredFieldValidator
1. <asp:CheckBox ID="CheckBox2" runat="server" Text="你大爷" AutoPostB ...
WCF服务端行为的一些设置
[ServiceBehavior( InstanceContextMode = InstanceContextMode.Single, //表示所有的请求都用一个服务实例来处理 Concurren ...
cmake在实际复杂项目中的使用
在实际复杂的项目之中,会有很多的源文件,以及对于库的依赖,如果直接使用makefile会比较的繁琐,而且makefile的推导规则也非常多,对多目录的支持也比较复杂. 最近看了一下cmake,发现配置 ...
LK 光流法简介
前言若假定一个局部区域的像素运动是一致的,则可以用这个新的约束条件替代前文中提到的全局速度平滑约束条件.这种光流算法就叫做 LK 光流法. LK 光流法的推导首先,需要推导出光流约束方程. 这一步 ...
MyEclipse 10 和 2014 两个版本共存破解 - imsoft.cnblogs
第一步:运行 (run.bat)文件, 输入任意用户名第二步:点击Systemid... 按钮,自动生成本机器的systemid. 第三步: 点菜单Tools->RebuildKey 第四 ...
240. Search a 2D Matrix II
Write an efficient algorithm that searches for a value in an m x n matrix. This matrix has the follo ...
用Python对excel文件的简单操作
#-*-coding:utf8-*- import xlrd #代开excel文件读取数据 data = xlrd.open_workbook("C:\\Users\\hyl\\Deskto ...
html5之我見
大多數知道html5的國人,不限於IT業內人員,對Html5存在較大誤解. 幾天前在新浪微博看到一個ID為"黑客師"的微博發佈了一張照片,名為"小白與高手的差別" ...
小tip: 使用CSS将图片转换成模糊(毛玻璃)效果
去年盛夏之时,曾写过“小tip: 使用CSS将图片转换成黑白”一文,本文的模式以及内容其实走得是类似路线.CSS3 → SVG → IE filter → canvas. 前段时间,iOS7不是瓜未熟 ...

python之lxml(xpath)

python之lxml(xpath)的更多相关文章

随机推荐

热门专题