python爬虫----XPath

1.知道本节点元素，如何定位到兄弟元素

详情见博客

XML代码见下

bt1在文档中只出现一次，所以很容易获取到bt1中内容，那怎么根据<td class='bt1'>来获取bt2中的内容

                content_title = driver.find_element_by_xpath("//td[@class='bt1']").text

                # 获取content_title的父节点的哥哥节点

                content_subtitle = driver.find_element_by_xpath("//td[@class='bt1']/../following-sibling::tr[1]").text
                # 获取第二个tr下面td的父节点的弟弟节点
                conten_subtitle = driver.find_element_by_xpath("//td[@class='bt1']/../preceding-sibling::tr[1]").text

　返回的内容为：高起点高水平推进福州新区建设

尤权于伟国赴福州新区调研

‘’

2.元素替换，查找元素位置可以用变量替换字符串

>>> driver.find_element_by_xpath("//*[@id='mp1057136']").click()

>>> a='mp1057136'

>>> driver.find_element_by_xpath("//*[@id='%s']"% a).click()

>>>

3.用webdriver获取网页上影藏的文字

网页格式和源码如下所示，网页上的内容被隐藏了，需要点击一下才会完全显示。右边是没有点击前页面的源码，可以看到完整的内容其实已经在页面上了，于是我通过下面方式获取

>>> driver.find_element_by_xpath(".//*[@id='company_base_info_detail']").text

''

>>> driver.find_element_by_xpath("//script[@id='company_base_info_detail']").text

''

　通过定位获取到的竟然为空，并不想通过模拟点击生成新页面再来获取内容，看到网上博主有提到另一种获取隐藏信息的方式

driver.execute_script("return arguments[0].textContent",c)获取文字或者

driver.execute_script("return arguments[0].innerHTML",c)获取源码

>>> c=driver.find_element_by_xpath("//div[@class='sec-c2 over-hide']")

>>> driver.execute_script("return arguments[0].textContent",c)

'简介：淘宝（中国）软件有限公司成立于2004年12月07日，主要经营范围为研究、开发计算机软、硬...\n                  淘宝（中国）软件有限公司成立于2004年12月07日，主要经营范围为研究、开发计算机软、硬件，网络技术产品，多媒体产品等。\n                详情'

>>> driver.execute_script("return arguments[0].innerHTML",c)

'<span><span class="sec-c3">简介：</span>淘宝（中国）软件有限公司成立于2004年12月07日，主要经营范围为研究、开发计算机软、硬...</span><script type="text/html" id="company_base_info_detail">\n                  淘宝（中国）软件有限公司成立于2004年12月07日，主要经营范围为研究、开发计算机软、硬件，网络技术产品，多媒体产品等。\n                </script><span class="c9 point hover_underline" onclick="companyDetail()">详情</span>'

>>> c=driver.find_element_by_xpath("//div[@class='sec-c2 over-hide']//script")

>>> driver.execute_script("return arguments[0].textContent",c)

'\n                  淘宝（中国）软件有限公司成立于2004年12月07日，主要经营范围为研究、开发计算机软、硬件，网络技术产品，多媒体产品等。\n                '

>>>

　　后面我重新定义了c使得最终得到我想要的企业完整简介

3.查找所有id都包含相同字符串的元素

tables = driver.find_elements_by_xpath("//div[contains(@id,'_container_')]")

4、查找标签

tag = driver.find_elements_by_xpath("//div[@class='search_right_item']")

tag[0].find_element_by_tag_name('a').click()

base = driver.find_element_by_xpath("//div[@class='company_header_width ie9Style']/div")

查找div标签中class属性等于’company_header_width ie9Style‘的子div

python爬虫----XPath的更多相关文章

python爬虫xpath的语法
有朋友问我正则,,okey,其实我的正则也不好,但是python下xpath是相对较简单的简单了解一下xpath: XPath 是一门在 XML 文档中查找信息的语言.XPath 可用来在 XML ...
python爬虫xpath
又是一个大晴天,因为马上要召开十九大,北京地铁就额外的拥挤,人贴人到爆炸,还好我常年挤地铁早已练成了轻功水上漂,挤地铁早已经不在话下. 励志成为一名高级测试工程师的我,目前还只是个菜鸟,难得有机会,公 ...
Python爬虫 XPath语法和lxml模块
XPath语法和lxml模块什么是XPath? xpath(XML Path Language)是一门在XML和HTML文档中查找信息的语言,可用来在XML和HTML文档中对元素和属性进行遍历. X ...
Python爬虫 | xpath的安装
错误信息:程序包无效.详细信息:“Cannot load extension with file or directory name . Filenames starting with "& ...
python爬虫前提技术
1.BeautifulSoup 解析html如何使用转自:http://blog.csdn.net/u013372487/article/details/51734047 #!/usr/bin/py ...
Python爬虫与数据分析之爬虫技能：urlib库、xpath选择器、正则表达式
专栏目录: Python爬虫与数据分析之python教学视频.python源码分享,python Python爬虫与数据分析之基础教程:Python的语法.字典.元组.列表 Python爬虫与数据分析 ...
python爬虫的页面数据解析和提取/xpath/bs4/jsonpath/正则(1)
一.数据类型及解析方式一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值.内容一般分为两部分,非结构化的数据和结构化的数据. 非结构化数据:先有数据,再有结构, 结构化数 ...
Python爬虫教程-22-lxml-etree和xpath配合使用
Python爬虫教程-22-lxml-etree和xpath配合使用 lxml:python 的HTML/XML的解析器官网文档:https://lxml.de/ 使用前,需要安装安 lxml 包 ...
小白学 Python 爬虫（19）：Xpath 基操
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...

随机推荐

vue.js实战(文摘)
---------------第1篇基础篇第1章初始vue.js 第2章数据绑定和第一个vue应用第3章计算属性第4章 v-bind及class与style绑定第5章内置命令第6章 ...
POSTMAN 数据关联
概述在使用postman测试接口是,我们可能需要先获取一个token,然后再将这个token发送到第二个请求.这个需要做postman的关联,一次性完成这两个测试. 实现方法 1.编写两个控制器方法 ...
Docker学习以及镜像制作流程
一.何为Docker Docker 是一个开源的应用容器引擎,基于 Go 语言并遵从Apache2.0协议开源. Docker 可以让开发者打包他们的应用以及依赖包到一个轻量级.可移植的容器中,然后 ...
IntelliJ IDEA 2017版 Spring5最基本的bean例子创建
一.简述 SpringBoot是基于spring框架之上的快速开发的框架.Spring4核心就是容器,容器提供了对bean的装配和管理. spring依赖加载: ...
用jquery实现复选框全选全不选问题（完整版），在网络上怎么也找不到完整的解决方案，重要搞全了
首先准备jsp页面控件: 请选择您的爱好:<br> <input type="checkbox" id="all" name="se ...
innodb mvcc多版本实现
出自:http://hedengcheng.com/?p=148 基本知识假设对于多版本(MVCC)的基础知识,有所了解.InnoDB为了实现多版本的一致读,采用的是基于回滚段的协议. 行结构 In ...
阿里云 oss实时日志查询
实时日志查询更新时间:2019-01-29 10:31:49 编辑 · 本页目录开启实时日志查询查询实时日志参考文档用户在访问 OSS 的过程中,会产生大量的访问日志.实时日志查询功能将 O ...
（线段树区间运算求点）Flowers -- hdu -- 4325
http://acm.hdu.edu.cn/showproblem.php?pid=4325 Flowers Time Limit: 4000/2000 MS (Java/Others) Mem ...
Java技术----Java泛型详解
1．为什么需要泛型泛型在Java中有很重要的地位,网上很多文章罗列各种理论,不便于理解,本篇将立足于代码介绍.总结了关于泛型的知识.希望能给你带来一些帮助. 先看下面的代码: List list = ...
3、利用GDB进行程序调试
本文将用一个实际例子讲解如何通过GDB进行程序调试. 首先,我们需要理解的是GDB是GNU开源组织发布的一个强大的UNIX下的程序调试工具,其产生和调试的目的是让调试者知道,程序在执行时内部发生了什么 ...

python爬虫----XPath

python爬虫----XPath的更多相关文章

随机推荐

热门专题