selenium实现百度图片爬取

因为是百度图片是瀑布流ajax异步上传的数据，所以这里用到抓包工具来抓取链接（fiddler）

好了直接上代码，

 from selenium import webdriver

 from selenium.webdriver.common.by import By

 import requests,time

 from queue import Queue

 from urllib import request

 import os,gevent

 from lxml import etree

 def get_img(html):

     html = html.get()

     html = etree.HTML(html)

     img_url = html.xpath('//div[@id="imgid"]/div[last()]//li/@data-objurl')

     # print(img_url)

     path = './baidupic/'

     if not os.path.exists(path):

         os.makedirs(path)

     for url in img_url:

         print(url)

         # response = requests.get(url)

         # img = response.content

         try:

             fname = url.split('/')[-1]

             request.urlretrieve(url,os.path.join(path, fname))

             print('下载成功')

         except:

             print('图片不存在')

 def get_page():

     #创建数据队列

     q = Queue()

     #百度图片搜索地址

     base_url = 'https://image.baidu.com/'

     #返回浏览器对象

     browser = webdriver.Chrome(executable_path=r'C:\Users\zhaozhi\Desktop\chromedriver.exe')

     #模拟访问

     browser.get(base_url)

     #输入搜索关键字

     browser.find_element_by_id('kw').send_keys('美女')

     #按键

     browser.find_element_by_class_name('s_search').click()

     # time.sleep(2)

     for i in range(10):

         browser.execute_script('window.scrollTo(0,document.body.scrollHeight)')

         # time.sleep(2)

         # html = browser.page_source

         q.put(browser.page_source)

     # browser.close()

     # print(browser.page_source)

     g_list=[]

     for i  in range(20):

         g= gevent.spawn(get_img,q)

         g_list.append(g)

     gevent.joinall(g_list)

 # browser.save_screenshot('baidupic.png')

 # print(browser.page_source)

 # browser.find_element(By_)

 if __name__ == '__main__':

     get_page()

selenium实现百度图片爬取的更多相关文章

爬虫07 /scrapy图片爬取、中间件、selenium在scrapy中的应用、CrawlSpider、分布式、增量式
爬虫07 /scrapy图片爬取.中间件.selenium在scrapy中的应用.CrawlSpider.分布式.增量式目录爬虫07 /scrapy图片爬取.中间件.selenium在scrapy ...
Python爬虫入门教程 26-100 知乎文章图片爬取器之二
1. 知乎文章图片爬取器之二博客背景昨天写了知乎文章图片爬取器的一部分代码,针对知乎问题的答案json进行了数据抓取,博客中出现了部分写死的内容,今天把那部分信息调整完毕,并且将图片下载完善到代码中 ...
使用Selenium&PhantomJS的方式爬取代理
前面已经爬取了代理,今天我们使用Selenium&PhantomJS的方式爬取快代理 :快代理 - 高速http代理ip每天更新. 首先分析一下快代理,如下使用谷歌浏览器,检查,发现每个代理 ...
4k图片爬取+中文乱码
4k图片爬取+中文乱码此案例有三种乱码解决方法,推荐第一种 4k图片爬取其实和普通图片爬取的过程是没有本质区别的 import requests import os from lxml import ...
scrapy之360图片爬取
#今日目标 **scrapy之360图片爬取** 今天要爬取的是360美女图片,首先分析页面得知网页是动态加载,故需要先找到网页链接规律, 然后调用ImagesPipeline类实现图片爬取 *代码实 ...
[Python_scrapy图片爬取下载]
welcome to myblog Dome地址爬取某个车站的图片 item.py 中 1.申明item 的fields class PhotoItem(scrapy.Item): # define ...
Python实训day07pm【Selenium操作网页、爬取数据-下载歌曲】
练习1-爬取歌曲列表任务:通过两个案例,练习使用Selenium操作网页.爬取数据.使用无头模式,爬取网易云的内容. ''' 任务:通过两个案例,练习使用Selenium操作网页.爬取数据. 使用无 ...
selenium+chrome浏览器驱动-爬取百度图片
百度图片网页中中,当页面滚动到底部,页面会加载新的内容. 我们通过selenium和谷歌浏览器驱动,执行js,是浏览器不断加载页面,通过抓取页面的图片路径来下载图片. from selenium im ...
Scrapy项目 - 实现百度贴吧帖子主题及图片爬取的爬虫设计
要求编写的程序可获取任一贴吧页面中的帖子链接,并爬取贴子中用户发表的图片,在此过程中使用user agent 伪装和轮换,解决爬虫ip被目标网站封禁的问题.熟悉掌握基本的网页和url分析,同时能灵活使 ...

随机推荐

Spring Cloud Alibaba | Nacos动态网关路由
Spring Cloud Alibaba | Gateway基于Nacos动态网关路由本篇实战所使用Spring有关版本: SpringBoot:2.1.7.RELEASE Spring Cloud ...
volatile、Synchronized实现变量可见性的原理，volatile使用注意事项
变量不可见的两个原因 Java每个线程工作都有一个工作空间,需要的变量都是从主存中加载进来的.Java内存模型如下(JMM): 线程访问一个共享的变量时,都需要先从主存中加载一个副本到自己的工作内存中 ...
ubuntu安装elasticsearch及head插件
1.安装elasticsearch,参考http://www.cnblogs.com/hanyinglong/p/5409003.html就可以了简单描述下: mkdir -p /usr/local ...
[Error] - Windows卸载程序时，提示错误2503
1. 打开“任务管理器” 2. 切换到“详细信息”标签页,找到explorer.exe文件,并结束它. 3. 点击“任务管理器”上的文件->运行新任务,输入explorer.ext,勾选“以系统 ...
CodeForces - 1118 F2 Tree Cutting
题目传送门题解: 先注意到一定存在k种颜色,切成k个块, 然后要求每个块内的颜色都一样,所以可以发现同一种颜色一定在同一个块内,故任意2个相同颜色的最短路劲上的点的颜色都是该颜色. 我们可以先把任意 ...
codeforces 812 E. Sagheer and Apple Tree（树+尼姆博弈）
题目链接:http://codeforces.com/contest/812/problem/E 题意:有一颗苹果树,这个苹果树所有叶子节点的深度要不全是奇数,要不全是偶数,并且包括根在内的所有节点上 ...
牛客网 Wannafly挑战赛 C 列一列简单题（题目有点坑）
链接:https://www.nowcoder.com/acm/contest/71/C来源:牛客网题目描述小W在计算一个数列{An},其中A1=1,A2=2,An+2=An+1+An.尽管他计算 ...
PHP 实现字符串表达式计算
什么是字符串表达式?即,将我们常见的表达式文本写到了字符串中,如:"$age >= 20",$age 的值是动态的整型变量. 什么是字符串表达式计算?即,我们需要一段程序来执 ...
solr 的基本用法
上图为 solr 的搜索页面,常用字段的基本用法如下: 1. q: 查询字符串,过滤条件,不能为空,必须输入,如果查询全部就写 * : * name:“马” AND age:[0 TO 18] ...
mysql之innodb-锁
本篇主要根据innodb存储引擎的锁进行阐述,包括分类,算法,以及锁的一些问题一.锁的概述为了保证最大程度的利用数据库的并发访问,又要确保每个用户能以一致的方式读取和修改数据,为此锁就派上了用场, ...

selenium实现百度图片爬取

selenium实现百度图片爬取的更多相关文章

随机推荐

热门专题