python爬虫selenium相关

首先上很好用的selenium中文文档，基本上所有问题都能通过阅读此文档解决。可惜好像没找到翻译者名称。

https://python-selenium-zh.readthedocs.io/zh_CN/latest/

安装selenium库以及配置环境

安装就是正常的pip install selenium即可，重点在于配置浏览器驱动。

selenium支持控制chrome，firefox，ie等浏览器，当然也可以反过来说这些浏览器支持被selenium控制。但需要各自配套的浏览器驱动，并且浏览器驱动版本必须和自己安装的浏览器版本同代（比如76.2和76.0.1都是76这样子）。

个人推荐使用chrome，因为文档中给出了chrome的各版本驱动下载链接不用麻烦去找了（https://python-selenium-zh.readthedocs.io/zh_CN/latest/7.6%20%E6%B5%8F%E8%A7%88%E5%99%A8%E9%A9%B1%E5%8A%A8/）。

不过如果真用chrome的话，最好还是翻到官网下推荐的稳定驱动版本（https://sites.google.com/a/chromium.org/chromedriver/downloads）

下载前先在chrome的设置-关于Chrome里找到chrome版本，如图中就是80.0.3987.163：

之后就是在那个链接里找到最接近的版本，浏览器版本对浏览器驱动版本向下兼容（也就是说选择80.0.3987.106的稳定驱动版本是可以运行的）

使用selenium

虽然有开头那个文档就够了，不过大概写一些吧。

1.基本

用browser=webdriver.chrome()就能获得一个chrome浏览器的控制柄类似的实例，其它浏览器同理。

之后用browser.get("website")就能真正地打开一个浏览器窗口，也可以不开，同样只需要对browser设置一下即可。

比较好用的是selenium可以执行javascript代码，实现上滑页面下拉页面之类的。大致用法就是browser.execute_script("js代码")。

用于控制鼠标位置的控制链最开始用起来有点玄学，但基本上按照：定义控制链-定位元素位置-移动鼠标到目标位置-执行点击-perform这个步骤来就不会出错了。代码上的话就类似如下：

# action为行为控制链对象实例

actions=ActionChains(browser)

target=browser.find_element_by_xpath("XPath")

actions.move_to_element(target)

actions.click()

actions.perform()

2.一定要注意驱动版本和浏览器版本对应。如果报错“Unknown Error:call function result missing 'value' ”，就很有可能是因为版本不匹配导致的！

3.如果进行某种操作过后，比如控制鼠标点击了某button，页面的各元素会发生变化的话，这时候就不能再使用同一个actions继续操作页面了，要新定义一个控制链实例。如果报错“stale element reference: element is not attached to the page document”，就要考虑可能是这个原因导致了问题。

4.很多时候光是selenium无法完成所有工作，还是要自己写一些工具类脚本配合使用。又以及和其它库，如BeautifulSoup，urljoin(用来合并相对路径和绝对路径！究极好用！)的联合使用。

python爬虫selenium相关的更多相关文章

python爬虫---selenium库的用法
python爬虫---selenium库的用法 selenium是一个自动化测试工具,支持Firefox,Chrome等众多浏览器在爬虫中的应用主要是用来解决JS渲染的问题. 1.使用前需要安装这个 ...
[Python爬虫] Selenium实现自动登录163邮箱和Locating Elements介绍
前三篇文章介绍了安装过程和通过Selenium实现访问Firefox浏览器并自动搜索"Eastmount"关键字及截图的功能.而这篇文章主要简单介绍如何实现自动登录163邮箱,同时 ...
[Python爬虫] Selenium+Phantomjs动态获取CSDN下载资源信息和评论
前面几篇文章介绍了Selenium.PhantomJS的基础知识及安装过程,这篇文章是一篇应用.通过Selenium调用Phantomjs获取CSDN下载资源的信息,最重要的是动态获取资源的评论,它是 ...
[Python爬虫] Selenium获取百度百科旅游景点的InfoBox消息盒
前面我讲述过如何通过BeautifulSoup获取维基百科的消息盒,同样可以通过Spider获取网站内容,最近学习了Selenium+Phantomjs后,准备利用它们获取百度百科的旅游景点消息盒(I ...
[Python爬虫] Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上)
转载自:http://blog.csdn.net/eastmount/article/details/51231852 一. 文章介绍源码下载地址:http://download.csdn.net/ ...
[python爬虫] Selenium常见元素定位方法和操作的学习介绍
这篇文章主要Selenium+Python自动测试或爬虫中的常见定位方法.鼠标操作.键盘操作介绍,希望该篇基础性文章对你有所帮助,如果有错误或不足之处,请海涵~同时CSDN总是屏蔽这篇文章,再加上最近 ...
[python爬虫] Selenium常见元素定位方法和操作的学习介绍(转载)
转载地址:[python爬虫] Selenium常见元素定位方法和操作的学习介绍一. 定位元素方法官网地址:http://selenium-python.readthedocs.org/locat ...
Python爬虫-selenium的使用（2）
使用selenium打开chrome浏览器百度进行搜索 12345678910111213141516171819202122232425 from selenium import webdriver ...
[python爬虫] Selenium定向爬取海量精美图片及搜索引擎杂谈
我自认为这是自己写过博客中一篇比较优秀的文章,同时也是在深夜凌晨2点满怀着激情和愉悦之心完成的.首先通过这篇文章,你能学到以下几点: 1.可以了解Python简单爬取图片的一些思路和方法 ...

随机推荐

java的多线程:线程安全问题
什么是线程安全? 为什么有线程安全问题? 当多个线程同时共享,同一个全局变量或静态变量,做写的操作时,可能会发生数据冲突问题,也就是线程安全问题.但是做读操作是不会发生数据冲突问题. 抢火车的例子: ...
mysql The used table type doesn’t support FULLTEXT indexes 解决方案（phpstudy 会出现），coten不会
mysql The used table type doesn't support FULLTEXT indexes 是不支持全文索引,解决方案: 1.停掉mysql服务2.打开my.ini,搜索de ...
【模拟】P1143进制转换
题目相关题目描述请你编一程序实现两种不同进制之间的数据转换. 输入格式共三行,第一行是一个正整数,表示需要转换的数的进制n(2≤n≤16),第二行是一个n进制数,若n>10则用大写字母A- ...
LeetCode557 反转字符串中的单词 III
给定一个字符串,你需要反转字符串中每个单词的字符顺序,同时仍保留空格和单词的初始顺序. 示例 1: 输入: "Let's take LeetCode contest" 输出: &q ...
虚拟机Linux安装Oracle容器并实现局域网其他主机访问查询
该文涉及Docker下Oracle容器的安装,主机端口的设置实现局域网内终端均能连接上Oracle数据库,图解如下: 一.关于Docker安装oracle容器可以参考下面博文: https://blo ...
explain extended；show warnings
mysql> explain extended select count(*) from xuehao;+----+-------------+-------+------+---------- ...
更改mysql的密码
mysql> set password for 'root'@'localhost' =PASSWORD('');Query OK, 0 rows affected (0.17 sec) mys ...
【Mysql】[Err] 1153 - Got a packet bigger than 'max_allowed_packet' bytes
今天用Navicat导入的时候报错 [Err] 1153 - Got a packet bigger than 'max_allowed_packet' bytes 原因是数据库默认是16M的数据,这 ...
ctfhub技能树—RCE—过滤cat
打开靶机查看页面信息构造payload 127.0.0.1 || ls 题目提示过滤了cat,但我还是想试试果然不行网页访问没有结果,应该和上题一样被注释了,使用和同样的方法进行解题利用命令 ...
Redis中哈希分布不均匀该怎么办
前言 Redis 是一个键值对数据库,其键是通过哈希进行存储的.整个 Redis 可以认为是一个外层哈希,之所以称为外层哈希,是因为 Redis 内部也提供了一种哈希类型,这个可以称之为内部哈希.当我 ...

python爬虫selenium相关

python爬虫selenium相关的更多相关文章

随机推荐

热门专题