Python3编写网络爬虫07-基本解析库pyquery的使用
三、pyquery
简介:同样是一个强大的网页解析工具 它提供了和jQuery类似的语法来解析HTML文档,支持CSS选择器,使用非常方便
安装:
pip install pyquery
验证:
import pyquery
初始化时 也需要传入HTML文本 初始化一个PyQuery对象 初始化方式有多种 例如直接传入字符串,传入URL,传入文件名等等。
1. 字符串初始化
示例:
html = '''
<div>
<ul>
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul>
</div>
''' from pyquery import PyQuery as pq #引入PyQuery对象 取别名pq
doc = pq(html)#将html当作参数 传递给PyQuery类
print(doc('li'))#传入li节点 选择所有li节点
2. URL初始化
doc = pq(url='https://www.huawei.com/cn/?',encoding='utf-8')
print(doc('title'))
pyquery对象首先请求url 得到HTML内容完成初始化 相当于用网页源代码 字符串的形式传递给pyquery类来初始化
与下面的功能是一样的
from pyquery import PyQuery as pq
import requests
doc = pq(requests.get('https://www.huawei.com').text)
print(doc('title'))
3.文件初始化
doc = pq(filename='01.txt')
print(doc('li'))
最常见的还是字符串形式
4.基本CSS选择器
实例:
html = '''
<div id="container">
<ul class="list">
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul>
</div>
''' from pyquery import PyQuery as pq
doc = pq(html)
print(doc('#container .list li'))#先选取 id 为container的节点 class为list的节点 所有li节点
print(type(doc('#container .list li')))#pyquery类型
5.查找节点
# 常用的查询函数 与jQuery中函数用法完全相同
5.1 find() 方法 查找所有子孙节点
doc = pq(html)
items = doc('.list')
print(type(items))#pyquery类型
print(items)#ul节点内容
lis = items.find('li')#调用find()方法 参数必选
print(type(lis))#类型为pyquery
print(lis)#所有的li节点内容
5.2 children() 查找子节点
lis = items.children()#参数可选 例如 .active li等 进行元素过滤
print(type(lis))#类型为pyquery
print(lis)#子节点li
5.3 parent() 获取某个节点的父节点
示例:
html = '''
<div class="wrap">
<div id="container">
<ul class="list">
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul>
</div>
''' from pyquery import PyQuery as pq
doc = pq(html)
items = doc('.list')
container = items.parent()
print(type(container))
print(container)#返回id 为container的节点内容
5.4 parents() 获取某个节点的所有祖先节点
items = doc('.list')
parents = items.parents()
print(parents)#没有给参数 所以会遍历上一层级 传递css参数 可筛选
5.5 siblings() 获取所有兄弟节点
li = doc('.list .item-0.active')
print(li.siblings())#返回四个兄弟节点
#筛选的话 在方法中加入参数
print(li.siblings('.active'))#返回一个兄弟节点
6. 遍历
pyquery 选择结果可能是多个节点 也可能是单个节点 类型都是pyquery类型 没有返回向BS那样的列表
对于单个节点 可以直接打印输出 也可以转化成字符串
li = doc('.item-0.active')
print(li)
print(str(li))
多个节点 遍历 需要调用 items()方法
lis = doc('li').items()
print(type(lis))#结果是生成器
for li in lis:
print(li,type(li))
7. 获取信息
attr() 获取属性值
a = doc('.item-0.active a')
print(a,type(a))
print(a.attr('href'))#属性值为link3.html
简写 print(a.attr.href)
调用多个节点
a = doc('a')
print(a,type(a))
print(a.attr('href'))
print(a.attr.href)
#返回结果只有第一个
获取所有的a节点属性 遍历
a = doc('a')
for item in a.items():
print(item.attr.href)
text() 获取文本
a = doc('.item-0.active a')
print(a)
print(a.text())#首先选中a节点 text()方法 获取其内部文本信息 忽略掉节点内部包含的HTML 只返回纯文本内容
获取节点内部的HTML文本 html()方法
li = doc('.item-0.active')
print(li)#查找到第三个li节点
print(li.html())#a节点内容
选择到的是多个节点
li = doc('li')
print(li.html())#返回第一个节点的内部HTML文本
print(li.text())#返回所有的li节点内部纯文本
print(type(li.text()))#str 类型
8. 节点操作
pyquery提供了一系列方法对节点进行动态修改 例如给某个节点添加一个class 移除某个节点等
列举几个典型方法
8.1 addClass() 和 removeClass()
html = '''
<div class="wrap">
<div id="container">
<ul class="list">
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul>
</div>
</div>
'''
from pyquery import PyQuery as pq
doc = pq(html) li = doc('.item-0.active')
print(li)
li.removeClass('active')#移除active属性
print(li)
li.addClass('active')#添加active属性
print(li)
8.2 attr()、text()、html()
li = doc('.item-0.active')
print(li)
li.attr('name','link')#修改属性 第一个参数为属性名
print(li)
li.text('changed item')#传入文本
print(li)
li.html('<span>changed item</span>')#传入html文本
print(li)
attr() 传入一个参数的属性名 获取这个属性值 传入两个参数 修改属性值
text() 获取节点内纯文本 传入参数进行赋值
html() 获取节点内部的HTML文本 传入参数进行赋值
8.3 remove() 移除
示例: 提取 Hello,World 文本
html = '''
<div class="wrap">
Hello,World
<p>This is a paragraph.</p>
</div>
'''
from pyquery import PyQuery as pq
doc = pq(html) wrap = doc('.wrap')
print(wrap.text()) wrap.find('p').remove()
print(wrap.text())
更多节点操作方法 http://pyquery.readthedocs.io/en/latest/api.html
9.伪类选择器
示例:
html = '''
<div class="wrap">
<div id="container">
<ul class="list">
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul>
</div>
</div>
'''
from pyquery import PyQuery as pq
doc = pq(html) li = doc('li:first-child')#第一个li节点
print(li) li = doc('li:last-child')#最后一个li节点
print(li) li = doc('li:nth-child(2)')#第二个li节点
print(li) li = doc('li:gt(2)')#第三个li之后的li节点
print(li) li = doc('li:nth-child(2n)')#偶数位置的li节点
print(li) li = doc('li:contains(second)')#包含second文本的li节点
print(li)
更多常用用法 参考官方文档 http://pyquery.readthedocs.io
Python3编写网络爬虫07-基本解析库pyquery的使用的更多相关文章
- Python3编写网络爬虫06-基本解析库Beautiful Soup的使用
二.Beautiful Soup 简介 就是python的一个HTML或XML的解析库 可以用它来很方便的从网页中提取数据 0.1 提供一些简单的 python式的函数来处理导航,搜索,修改分析树等功 ...
- Python3编写网络爬虫05-基本解析库XPath的使用
一.XPath 全称 XML Path Language 是一门在XML文档中 查找信息的语言 最初是用来搜寻XML文档的 但是它同样适用于HTML文档的搜索 XPath 的选择功能十分强大,它提供了 ...
- Python3编写网络爬虫02-基本请求库requests的使用
一.requests 库使用 需要安装 pip install requests import requests #导入requests库 request = requests.get("h ...
- Python3编写网络爬虫01-基本请求库urllib的使用
安装python后 自带urllib库 模块篇 分为几个模块如下: 1. urllib.request 请求模块 2. urllib.parse 分析模块 3. urllib.error 异常处理模块 ...
- python3编写网络爬虫20-pyspider框架的使用
二.pyspider框架的使用 简介 pyspider是由国人binux 编写的强大的网络爬虫系统 github地址 : https://github.com/binux/pyspider 官方文档 ...
- python3编写网络爬虫21-scrapy框架的使用
一.scrapy框架的使用 前面我们讲了pyspider 它可以快速的完成爬虫的编写 不过pyspider也有一些缺点 例如可配置化不高 异常处理能力有限对于一些反爬虫程度非常强的网站 爬取显得力不从 ...
- Python3编写网络爬虫08-数据存储方式一-文件存储
数据存储 用解析器解析出数据之后,就是存储数据了.保存的形式可以多种多样,最简单的形式是直接保存为文本文件,如TXT JSON CSV等.另外还可以保存到数据库中,如关系型数据库MySQL 非关系型数 ...
- Python3编写网络爬虫04-爬取猫眼电影排行实例
利用requests库和正则表达式 抓取猫眼电影TOP100 (requests比urllib使用更方便,由于没有学习HTML系统解析库 选用re) 1.目标 抓取电影名称 时间 评分 图片等 url ...
- python3编写网络爬虫18-代理池的维护
一.代理池的维护 上面我们利用代理可以解决目标网站封IP的问题 在网上有大量公开的免费代理 或者我们也可以购买付费的代理IP但是无论是免费的还是付费的,都不能保证都是可用的 因为可能此IP被其他人使用 ...
随机推荐
- Java第三方支付接入案例(支付宝)
开源项目链接 Kitty 开源权限管理系统 项目地址:https://gitee.com/liuge1988/kitty 演示地址:http://139.196.87.48:9002/kitty 用户 ...
- SpringBoot集成Mybatis(0配置注解版)
Mybatis初期使用比较麻烦,需要各种配置文件.实体类.dao层映射关联.还有一大推其它配置.当然Mybatis也发现了这种弊端,初期开发了generator可以根据表结构自动生成实体类.配置文件和 ...
- PostgreSQL 使用小点
1.timestamp 有分时区和无时区(减少使用),8个字节,包含日期和时间,范围是:公元前4713 - 公元294276.底层存储的是时间戳,这对任何地区的都一样,而具体时间显示则可从数据库层面设 ...
- Docker入门记1
Docker是一个部署容器技术,它出现的目的主要解决开发人员在本机开发的时候安装的各类类库等一系列运行程序的包啊库啊,然后把这些引用的第三方类库和操作系统需要的配置打包起来,形成一个原子环境,然后部署 ...
- 最小化安装centos5.5
安装LINUX的办法: 使用光盘 通过网络批量安装LINUX系统 先搭建一个LINUX做为安装的数据源(DHCP服务器,kickat) 设置所有其他要安装LINUX服务器的电脑以NET的方式启动,然后 ...
- netty源码解解析(4.0)-2 Chanel的接口设计
全名: io.netty.channel.Channel Channel内部定义了一个Unsafe类型,Channel定义了对外提供的方法,Unsafe定义了具体实现.我把Channel定义的的方法分 ...
- 内置函数二(lambda函数,sorted(),filter(),map(),递归函数,二分法查找)
一,匿名函数 lambda表⽰示的是匿名函数. 不需要⽤用def来声明, ⼀一句句话就可以声明出⼀一个函数 语法: 函数名 = lambda 参数: 返回值 注意: 1. 函数的参数可以有多个. ...
- Qt使用正则表达式去掉小数位多余的0
QRegExp rx; rx.setPattern("(\\.){0,1}0+$"); double double01 = 15648.120000; double double0 ...
- LInux Crontab及命令
定时任务(cron job)被用于安排那些需要被周期性执行的命令.利用它,你可以配置某些命令或者脚本,让它们在某个设定的时间内周期性地运行.cron 是 Linux 或者类 Unix 系统中最为实用的 ...
- c# 数组协变
class a{} class b:a{} a[] arr=new a[3]; a[] arr2=new a[3]; 给arr 数组赋值 arr[0]=new a(); arr2[0]=new b() ...