Selenium工具爬取商品

selenium是一个优秀的自动化测试工具，支持多种语言，具体介绍参考官方文档：https://www.seleniumhq.org/docs/。

下面我们使用selenium工具模拟用户点击商品详情页，在详情页中获取商品预览图。

一、安装selenium

pip install selenium

二、测试安装

python

>> from selenium import webdriver

>> browser = webdriver.Chrome()

若没有报错，则可进行后面的步骤。若有错误提示未找到chromedriver，需要下载chromedriver

三、下载chromedriver

下载与本地浏览器版本相同的chromedriver，下载后，需将该驱动包放入PATH中，我的浏览器版本 75.0.3770.142

wget http://npm.taobao.org/mirrors/chromedriver/74.0.3729.6/chromedriver_linux64.zip

tar zxvf chromedriver_linux64.zip

cd chromedriver_linux64

export PATH=$PATH:~/Downloads/chromedriver_linux64

四、使用举例

url = "http://www.baidu.com"

browser = webdriver.Chrome()

browser.get(url)

ele = browser.find_element_by_class_name('')

print(ele)

其中，find_element_by_class_name根据标签class样式来获取元素，类似的方法还有很多，比如：

find_element_by_id

find_element_by_xpath

find_element_by_tag_name

....

五、实战

下面我们以抓取www.layuva.com中商品信息为例，该站点的商品详情页链接是动态生成的，现在很多站点内容都是动态生成，这类站点很适合selenium工具抓取数据。具体demo参见附件

1、新建driver实例

url = "https://www.layuva.com/pc/index.html#/home/searchDetail?category_id=1060730203664142336"

browser = webdriver.Chrome()

browser.get(url)

2、获取商品列表

list_box = browser.find_elements_by_xpath('//*[@id="app"]//div[5]/div[2]/div/div')

3、模拟用户查看商品详情

for box in list_box:

     box.click()

     browser.switch_to.window(browser.window_handles[-1])

4、获取详情页中的商品信息

image_src = wait.until(EC.presence_of_element_located((By.XPATH, '//*[@id="app"]/div[5]/div/div[1]/div[1]/img'))).get_attribute('data-src')

5、退出详情页

browser.close()

browser.switch_to.window(browser.window_handles[0])

6、获取下一页

target = browser.find_element_by_css_selector(

    '#app > div.searchDetail > div.width-base > div.common-page > ul > li.ivu-page-next')

if target.get_attribute('class').find('ivu-page-disabled') >= 0:  // 判断是否有下一页

    break

ActionChains(browser).move_to_element(target).click(target).perform()  # 模拟点击《下一页》按钮

欢迎拍砖

Selenium工具爬取商品的更多相关文章

selenium+phantomjs爬取京东商品信息
selenium+phantomjs爬取京东商品信息今天自己实战写了个爬取京东商品信息,和上一篇的思路一样,附上链接:https://www.cnblogs.com/cany/p/10897618. ...
Python post请求模拟登录淘宝并爬取商品列表
一.前言大概是一个月前就开始做淘宝的爬虫了,从最开始的用selenium用户配置到selenium模拟登录,再到这次的post请求模拟登录.一共是三篇博客,记录了我爬取淘宝网的经历.期间也有朋友向我 ...
Python3.x：Selenium+PhantomJS爬取带Ajax、Js的网页
Python3.x:Selenium+PhantomJS爬取带Ajax.Js的网页前言现在很多网站的都大量使用JavaScript,或者使用了Ajax技术.这样在网页加载完成后,url虽然不改变但 ...
selenium异步爬取（selenium+Chromedriver）
在我们进行数据爬去的过程中,我们有时候会遇到异步加载信息的情况,以豆瓣电影分来排行榜为例,当我们在查看数据的过程中,会发现网页源码中并不包含我们想要的全部数据,但是当我们在进行向下滚动的时候,数据会一 ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
selenium+phantomjs爬取bilibili
selenium+phantomjs爬取bilibili 首先我们要下载phantomjs 你可以到 http://phantomjs.org/download.html 这里去下载下载完之后解压到 ...
selenium登录爬取知乎出现：请求异常请升级客户端后重试的问题(用Python中的selenium接管chrome)
一.问题使用selenium自动化测试爬取知乎的时候出现了:错误代码10001:请求异常请升级客户端后重新尝试,这个错误的产生是由于知乎可以检测selenium自动化测试的脚本,因此可以阻止selen ...
使用selenium 多线程爬取爱奇艺电影信息
使用selenium 多线程爬取爱奇艺电影信息转载请注明出处. 爬取目标:每个电影的评分.名称.时长.主演.和类型爬取思路: 源文件:(有注释) from selenium import webd ...
scrapy中使用selenium来爬取页面
scrapy中使用selenium来爬取页面 from selenium import webdriver from scrapy.http.response.html import HtmlResp ...

随机推荐

windows环境rabbitmq安装步骤
windows环境rabbitmq安装步骤: 1 提前安装erl; 2 rabbitmq安装后自动启动; 3 从开始菜单进入rabbit命令窗,启用插件; 下面是命令: 启用插件 rabbitmq ...
一句话题解&&总结
CF79D Password: 差分.两点取反,本质是匹配!最短路+状压DP 取反是套路,匹配是发现可以把操作进行目的化和阶段化,从而第二次转化问题. 且匹配不会影响别的位置答案 sequence 计 ...
2018-2019-2 20165210《网络对抗技术》Exp7 网络欺诈防范
2018-2019-2 20165210<网络对抗技术>Exp7 网络欺诈防范一.实验目标:本实践的目标理解常用网络欺诈背后的原理,以提高防范意识,并提出具体防范方法. 二.实验内容: ...
FreeMarker学习（springmvc配置）
springMvc配置 <bean id="freemarkerConfig" class="org.springframework.web.servlet.vie ...
arcgis python 参数验证
import arcpy class ToolValidator(object): """Class for validating a tool's parameter ...
分组背包---P1757 通天之分组背包
P1757 通天之分组背包题解分组背包板子题 k组物品,每组之间相互矛盾,也就是一组里面只能选一个或者不选分组背包其实和01背包差不多,就是多加一维枚举组数 f[k][j] 前k组中,体积不超过 ...
在Vue文件中引用模块的相对路径“@“符号表示什么意思？
@ 的作用是在你引入模块时,可以使用 @ 代替 /src 目录,避免书写麻烦又易错的相对路径. import model from "@/common/model"; // 默认路 ...
在调试linux的休眠功能时如何打开调试信息开关？
答:在bootargs中添加参数no_console_suspend即可进行调试
kafka----简单的脚本命令重点
kafka命令如下: kafka-shell基本命令在节点hadoop-2,hadoop-3,hadoop-5,启动kafka 启动命令如下 kafka-server-start.sh /usr/l ...
golang web框架设计1：框架规划
GO WEB 编程13节,如何设计一个web框架学习谢大的web框架设计总体介绍实现一个简易的web框架,我们采用mvc模式来进行开发. model:模型,代表数据结构.通常来说,模型类时包含查 ...