利用python脚本（xpath）抓取数据

有人会问re和xpath是什么关系？如果你了解js与jquery，那么这个就很好理解了。

# -*- coding:utf-8 -*-

from lxml import etree

html = """

    <!DOCTYPE html>

    <html>

        <head lang="en">

        <title>我的文档</title>

        <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />

        </head>

        <body>

            <div id="cctv">

                <div class="content">

                    <ul id="ul">

                        <li>NO.1</li>

                        <li>NO.2</li>

                        <li>NO.3</li>

                    </ul>

                    <ul id="ul2">

                        <li><span class="ctv">one</span></li>

                        <li><span class="ctv">two</span></li>

                    </ul>

                </div>

                <div id="url">

                    <a href="http://www.jd.com" title="jd">jd</a>

                    <a href="http://www.360buy.com" title="360buy">360buy</a>

                </div>

            </div>

        </body>

    </html>

"""

selector = etree.HTML(html)

# ########### example 1 ############

# 这里使用id属性来定位哪个div和ul被匹配 使用text()获取文本内容

# 这里注意要层层匹配

# content = selector.xpath('//div[@id="cctv"]/div[@class="content"]/ul[@id="ul"]/li/text()')

# content = selector.xpath('//div[@id="cctv"]/div[@class="content"]/ul[@id="ul2"]/li/span[@class="ctv"]/text()')

content = selector.xpath('//a/@href')

for i in content:

    print(i)

print(u"************ 华丽分割符1 ************")

# ########### example 2 ############

# 使用绝对路径定位a标签的title

con = selector.xpath('/html/body/div/a/@title')

# 使用相对路径定位 两者效果是一样的

con = selector.xpath('//a/@title')

print(len(con))

print(con[0], con[1])

print(u"************ 华丽分割符2 ************")

# ########### example 3 ############

# starts-with 解决标签属性值以相同字符串开头的情况

con2 = selector.xpath('//span[starts-with(@class,"c")]/text()')  # 这里使用starts-with方法提取div的id标签属性值开头为a的div标签

for i in con2:

    print(i)

print(u"************ 华丽分割符3 ************")

# string(.) 标签套标签

html2 = '''

   <div id="a">

       left

        <span id="b">

           right

            <ul>

               up

                <li>down</li>

            </ul>

           east

        </span>

        west

    </div>

'''

# 下面是没有用string方法的输出

selector2 = etree.HTML(html2)

con3 = selector2.xpath('//div[@id="a"]/text()')

for i in con3:

    print(i)

print(u"************ 华丽分割符4 ************")

# 下面使用string方法的输出

data = selector2.xpath('//div[@id="a"]')

# info = data[0].xpath('string(.)').extract()[0]

info = data[0].xpath('string(.)')

con4 = info.replace('\n', '').replace(' ', '')

for i in con4:

    # python 输出结果默认是\n，换行，将结尾替换掉即可实现不换行。

    print(i, end='')

print("\r")

print(u"************ 华丽分割符5 ************")

# ########### example 4 ############

html3 = """

    <div>hello

        <p>H</p>

    </div>

    <div>hehe</div>

"""

selector3 = etree.HTML(html3)

# 使用text()的方法来判别是哪个div标签

con5 = selector3.xpath('//div[text()="hehe"]/text()')

print(con5[0])

print(u"************ 华丽分割符6 ************")

# ########### example 5 ############

html4 = """

    <div id="utv">hello

        <p>H</p>

        <p>J</p>

        <p>I</p>

    </div>

    <div>hehe</div>

"""

selector4 = etree.HTML(html4)

# 在XPath中可以使用多重过滤方法寻找标签，例如ul[3][@id=”a”] 这里使用【3】来寻找第三个ul标签 并且它的id属性值为a

con6 = selector4.xpath('//div/p[position()>=2]/text()')

for i in con6:

    print(i)

print(u"************ 华丽分割符7 ************")

利用python脚本（xpath）抓取数据的更多相关文章

爬虫学习笔记（1）-- 利用Python从网页抓取数据
最近想从一个网站上下载资源,懒得一个个的点击下载了,想写一个爬虫把程序全部下载下来,在这里做一个简单的记录 Python的基础语法在这里就不多做叙述了,黑马程序员上有一个基础的视频教学,可以跟着学习一 ...
如何利用Python网络爬虫抓取微信朋友圈的动态（上）
今天小编给大家分享一下如何利用Python网络爬虫抓取微信朋友圈的动态信息,实际上如果单独的去爬取朋友圈的话,难度会非常大,因为微信没有提供向网易云音乐这样的API接口,所以很容易找不到门.不过不要慌 ...
利用Python网络爬虫抓取微信好友的签名及其可视化展示
前几天给大家分享了如何利用Python词云和wordart可视化工具对朋友圈数据进行可视化,利用Python网络爬虫抓取微信好友数量以及微信好友的男女比例,以及利用Python网络爬虫抓取微信好友的所 ...
如何利用Python网络爬虫抓取微信好友数量以及微信好友的男女比例
前几天给大家分享了利用Python网络爬虫抓取微信朋友圈的动态(上)和利用Python网络爬虫爬取微信朋友圈动态——附代码(下),并且对抓取到的数据进行了Python词云和wordart可视化,感兴趣 ...
利用Python网络爬虫抓取微信好友的所在省位和城市分布及其可视化
前几天给大家分享了如何利用Python网络爬虫抓取微信好友数量以及微信好友的男女比例,感兴趣的小伙伴可以点击链接进行查看.今天小编给大家介绍如何利用Python网络爬虫抓取微信好友的省位和城市,并且将 ...
利用python scrapy 框架抓取豆瓣小组数据
因为最近在找房子在豆瓣小组-上海租房上找,发现搜索困难,于是想利用爬虫将数据抓取. 顺便熟悉一下Python. 这边有scrapy 入门教程出处:http://www.cnblogs.com/txw1 ...
Python爬虫处理抓取数据中文乱码问题
乱码原因:因为你的文件声明为utf-8,并且也应该是用utf-8的编码保存的源文件.但是windows的本地默认编码是cp936,也就是gbk编码,所以在控制台直接打印utf-8的字符串当然是乱码了. ...
怎么用Python写爬虫抓取网页数据
机器学习首先面临的一个问题就是准备数据,数据的来源大概有这么几种:公司积累数据,购买,交换,政府机构及企业公开的数据,通过爬虫从网上抓取.本篇介绍怎么写一个爬虫从网上抓取公开的数据. 很多语言都可以写 ...
Python 3.6 抓取微博m站数据
Python 3.6 抓取微博m站数据 2019.05.01 更新内容 containerid 可以通过 "107603" + user_id 组装得到,无需请求个人信息获取: 优 ...

随机推荐

ETF计划Q&A
ETF计划Q&A 2018-07-16 参考:详解ETF计划.ETF计划Q&A(2017版) 目录问1:ETF计划是什么?问2:ETF计划适合什么人参加?问3:我想参考你的计划,但告 ...
MATLAB 显示输出数据的三种方式
MATLAB 显示输出数据的三种方式 ,转载 https://blog.csdn.net/qq_35318838/article/details/78780412 1.改变数据格式当数据重复再命令行 ...
SAP Parallel Accounting（平行分类账）业务配置及操作手册
目录 SAP Parallel Accounting(平行分类账业务)配置及操作手册 SAP Parallel Accounting(平行分类账业务)配置及操作手册 Overview 业务说明为了适 ...
VMware vCenter Server 6.5安装
实验环境: 数据中心操作系统 : Windows server 2008 R2(建议配置8G内存) 数据中心安装包版本: VMware vCenter Server 6.5 数据中心数据库: ...
Houdini 过程化地形系统（二）：基于UE4的FC5植被系统（1）
背景通过之前的几篇分析实践,已经基本打通了UE4的Houdini植被管线部分,并对Far Cry5(简称FC5)的植被系统的需求做了整理,在接下来的几节中,会关注于如何使用Houdini基于UE4来 ...
BarTender中如何为称重设备设置秤显示？
有关BarTender 2016表单中的称显示,前面都给大家介绍过了,包括秤显示属性设置,链接数据源属性设置等等.本文,将以图文并茂的方式,教大家如何为称重设备设置秤显示控件. 我们打开BarTend ...
Java & PHP & Javascript 通用 RSA 加密解密 (长字符串)
系统与系统的数据交互中,有些敏感数据是不能直接明文传输的,所以在发送数据之前要进行加密,在接收到数据时进行解密处理:然而由于系统与系统之间的开发语言不同. 本次需求是生成二维码是通过java生成,由p ...
Thread类的join()方法
public class Demo { /** * Thread类的join()方法 * -------------------------------- * 1)join() * 2)join(lo ...
Java编程常见缺陷汇总(一)
[案例1] public boolean equalNode(JudgeNode a, JudgeNode b) { return a.getId() == b.getId(); } [点评] 应在 ...
Logistic 最大熵朴素贝叶斯 HMM MEMM CRF 几个模型的总结
朴素贝叶斯(NB) , 最大熵(MaxEnt) (逻辑回归, LR), 因马尔科夫模型(HMM), 最大熵马尔科夫模型(MEMM), 条件随机场(CRF) 这几个模型之间有千丝万缕的联系,本文首先会 ...

利用python脚本（xpath）抓取数据

利用python脚本（xpath）抓取数据的更多相关文章

随机推荐

热门专题