python3编写网络爬虫16-使用selenium 爬取淘宝商品信息

一、使用selenium 模拟浏览器操作爬取淘宝商品信息

之前我们已经成功尝试分析Ajax来抓取相关数据，但是并不是所有页面都可以通过分析Ajax来完成抓取。
比如，淘宝，它的整个页面数据确实也是通过Ajax获取的，但是这些Ajax接口参数比较复杂，可能会包含加密密钥等，
所以如果想自己构造Ajax参数，还是比较困难的。
对于这种页面，最方便快捷的抓取方法就是通过Selenium

目标：利用Selenium抓取淘宝商品并用pyquery解析得到商品的图片、名称、价格、购买人数、店铺名称和店铺所在地信息

完整代码

#-*-coding:utf-8-*-

#抓取淘宝商品信息

from selenium import webdriver

from selenium.common.exceptions import TimeoutException

from selenium.webdriver.common.by import By

from selenium.webdriver.support import expected_conditions as EC

from selenium.webdriver.support.wait import WebDriverWait

from urllib.parse import quote

from pyquery import PyQuery as pq

import pymongo

import time

browser = webdriver.Chrome()

wait = WebDriverWait(browser,15)

KEYWORD = 'iPad'

#抓取索引页

def index_page(page):

　　print('正在爬取第',page,'页')

　　try:

　　　　url = 'https://s.taobao.com/search?q='+ quote(KEYWORD)

　　　　browser.get(url)

　　　　if page > 1:

　　　　　　input = wait.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#mainsrp-pager div.form > input')))

　　　　　　submit = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR,'#mainsrp-pager div.form > span.btn.J_Submit')))

　　　　　　input.clear()

　　　　　　input.send_keys(page)

　　　　　　submit.click()

　　　　wait.until(EC.text_to_be_present_in_element((By.CSS_SELECTOR,'#mainsrp-pager li.item.active > span'),str(page)))

　　　　wait.until(EC.presence_of_element_located((By.CSS_SELECTOR,'.m-itemlist .items .item')))

　　　　get_products()

　　except TimeoutException:

　　　　index_page(page)

#解析商品列表

def get_products():

　　html = browser.page_source

　　doc = pq(html)

　　items = doc('#mainsrp-itemlist .items .item').items()

　　for item in items:

　　　　product = {

　　　　　　'image' : item.find('.pic .img').attr('data-src'),

　　　　　　'price' : item.find('.price').text(),

　　　　　　'deal' : item.find('.dral-cnt').text(),

　　　　　　'title' : item.find('.title').text(),

　　　　　　'shop' : item.find('.shop').text(),

　　　　　　'location' : item.find('.localtion').text()

　　　　}

　　　　print(product)

　　　　save_to_mongo(product)

#保存到MongoDB

MONGO_URL = 'localhost'

MONGO_DB = 'taobao'

MONGO_COLLECTION = 'products'

client = pymongo.MongoClient(host=MONGO_URL,port=27017)

db = client[MONGO_DB]

def save_to_mongo(result):

　　try:

　　　　if db[MONGO_COLLECTION.insert(result)]:

　　　　print('存储成功')

　　except Exception:

　　　　print('存储失败')

#main函数

MAX_PAGE = 5

def main():

　　url = 'https://s.taobao.com/search?q=' + quote(KEYWORD)

　　browser.get(url)

　　wait.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#J_QRCodeImg')))

　　time.sleep(10)

　　for i in range(1,MAX_PAGE+1):

　　　　index_page(i)

main()

python3编写网络爬虫16-使用selenium 爬取淘宝商品信息的更多相关文章

利用Selenium爬取淘宝商品信息
一. Selenium和PhantomJS介绍 Selenium是一个用于Web应用程序测试的工具,Selenium直接运行在浏览器中,就像真正的用户在操作一样.由于这个性质,Selenium也是一 ...
Selenium+Chrome/phantomJS模拟浏览器爬取淘宝商品信息
#使用selenium+Carome/phantomJS模拟浏览器爬取淘宝商品信息 # 思路: # 第一步:利用selenium驱动浏览器,搜索商品信息,得到商品列表 # 第二步:分析商品页数,驱动浏 ...
<day003>登录+爬取淘宝商品信息+字典用json存储
任务1:利用cookie可以免去登录的烦恼(验证码) ''' 只需要有登录后的cookie,就可以绕过验证码登录后的cookie可以通过Selenium用第三方(微博)进行登录,不需要进行淘宝的滑动 ...
爬取淘宝商品信息，放到html页面展示
爬取淘宝商品信息 import pymysql import requests import re def getHTMLText(url): kv = {'cookie':'thw=cn; hng= ...
使用Selenium爬取淘宝商品
import pymongo from selenium import webdriver from selenium.common.exceptions import TimeoutExceptio ...
Python网络爬虫（6）--爬取淘宝模特图片
经过前面的一些基础学习,我们大致知道了如何爬取并解析一个网页中的信息,这里我们来做一个更有意思的事情,爬取MM图片并保存.网址为https://mm.taobao.com/json/request_t ...
Selenium爬取淘宝商品概要入mongodb
准备: 1.安装Selenium:终端输入 pip install selenium 2.安装下载Chromedriver:解压后放在…\Google\Chrome\Application\:如果是M ...
selenium＋pyquery爬取淘宝商品信息
import re from selenium import webdriver from selenium.common.exceptions import TimeoutException fro ...
使用Pyquery+selenium抓取淘宝商品信息
配置文件,配置好数据库名称,表名称,要搜索的产品类目,要爬取的页数 MONGO_URL = 'localhost' MONGO_DB = 'taobao' MONGO_TABLE = 'phone' ...

随机推荐

c# 画布验证码
using System; using System.Collections.Generic; using System.ComponentModel; using System.Data; usin ...
spring2.0：The server time zone value 'ÃÃÂ¹ÃºÂ±ÃªÃÂ¼ÃÂ±Â¼Ã¤' is unrecognized or represents more than one time zone. You must configure either th
提示系统时区出现错误,可以在mysql中执行命令: set global time_zone='+8:00' 或者在数据库驱动的url后加上serverTimezone=UTC参数 jdbc:mysq ...
python特色_字典，元组，列表
一.前言: 1.许多编程语言的基本数据类型都大同小异,而字典,元组,列表是python编程语言的一大特色,能够非常简单的完成很多功能,学习好字典,元组,列表能够为以后大数据,批处理......提供很多 ...
Spring Bean的生命周期相关博客
最近得面试题一直问 Spring 得生命周期,鉴于自己还未阅读过源码所以只能是自己背一波了.属实不懂硬背得作用,但是无奈被各位面试官打败了.等以后有时间了一定要阅读几遍spring的源码有 ...
详解bootstrap-fileinput文件上传控件的亲身实践
经理让我帮服务器开发人员开发一个上传文件功能界面,我就想着以前使用过bootstrap-fileinput插件进行文件上传,很不错.赶紧就撸起来了. 1.下载压缩包.插件地址https://githu ...
AI在汽车中的应用：实用深度学习
https://mp.weixin.qq.com/s/NIza8E5clC18eMF_4GMwDw 深度学习的“深度”层面源于输入层和输出层之间实现的隐含层数目,隐含层利用数学方法处理(筛选/卷积)各 ...
concrrent类下ReentrantReadWriteLock类的原理以及使用
1.ReentrantreadWriteLock 类的介绍 Lock接口下的子类存在 ReentrantLock子类,该子类是一个线程同步处理类:ReentrantLock类的介绍详见XXX: Loc ...
Android中Ijkplayer最简单的使用
先添加依赖: compile 'com.dou361.ijkplayer:jjdxm-ijkplayer:1.0.5' MainActivity里面: public class MainActivit ...
快速开发跨平台应用之Xamarin技术
Xamarin 介绍 Xamarin 是一个允许开发人员有效创建可跨 iOS.Android.Windows 应用程序的开发工具集.Xamarin是免费且开源的,遵循 MIT (麻省理工学院许可证)协 ...
【Spring源码解读】bean标签中的属性（二）你可能还不够了解的 abstract 属性和 parent 属性
abstract 属性说明 abstract 在java的语义里是代表抽象的意思,用来说明被修饰的类是抽象类.在Spring中bean标签里的 abstract 的含义其实也差不多,表示当前bean是 ...

python3编写网络爬虫16-使用selenium 爬取淘宝商品信息

python3编写网络爬虫16-使用selenium 爬取淘宝商品信息的更多相关文章

随机推荐

热门专题