pyspider 示例二升级完整版绕过懒加载，直接读取图片

pyspider 示例二升级完整版绕过懒加载，直接读取图片，见【升级写法处】

#!/usr/bin/env python

# -*- encoding: utf-8 -*-

# Created on 2019-04-08 14:24:34

# Project: qunaer

from pyspider.libs.base_handler import *

class Handler(BaseHandler):

    crawl_config = {

    }

    @every(minutes=24 * 60)

    def on_start(self):

        self.crawl('https://travel.qunar.com/travelbook/list.htm', callback=self.index_page,validate_cert=False)

    @config(age=10 * 24 * 60 * 60)

    def index_page(self, response):

        for each in response.doc('li > .tit>a').items():

            self.crawl(each.attr.href, callback=self.detail_page,validate_cert=False,fetch_type='js',js_viewport_height='')

        next1=response.doc('.next').attr.href

        self.crawl(next1,callback=self.index_page,validate_cert=False)

    @config(priority=2)

    def detail_page(self, response):

        imgs=response.doc('.js_memo_node').find('img')#获取id下的所有（包括多层嵌套的）img标签

        img_list=''                                  #必须事先声明，否则return,img_list时会报引用未事先声明的变量

        for img in imgs.items():

            img_list+=img.attr('data-original')+',' #【升级写法】，绕过懒加载直接读取图片真正地址

                                                    #htm源码<img  data-original="https://tr-osdcp.qunarzz.com/tr-osd-tr-space/img/ee.jpg" src="layz-load">

        return {

            "url": response.url,

            "title": response.doc('title').text(),

            "date":response.doc('li.f_item.when > p > span.data').text(),

            "day":response.doc('li.f_item.howlong > p > span.data').text(),

            "text":response.doc('#b_panel_schedule').text(),

            "img":img_list

        }

#ele-3076663-2 > div.bottom > div.e_img_schedule > div > dl:nth-child(2) > dt > img

pyspider 示例二升级完整版绕过懒加载，直接读取图片的更多相关文章

懒加载 js----例子------图片
转载自:https://www.jianshu.com/p/9b30b03f56c2 懒加载工具类 <script type="text/javascript"> // ...
爬虫（七）图片懒加载技术、selenium和PhantomJS
动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http://sc.chinaz.com/中的图片数据 #!/usr/bin/env python # -*- coding ...
08.Python网络爬虫之图片懒加载技术、selenium和PhantomJS
引入今日概要图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程今日详情动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材ht ...
JS实现图片懒加载插件
一.前言我在前几篇博客的记录中,有说自己在做一个图片懒加载的功能,然后巴拉巴拉的遇到哪些问题,结果做完了也没对懒加载这个功能做一些记录,所以这篇文章主要针对我所实现的思路,以及代码做个记录,实现不佳 ...
Python网络爬虫之图片懒加载技术、selenium和PhantomJS
引入图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http://sc.ch ...
爬虫之图片懒加载技术、selenium和PhantomJS
爬虫之图片懒加载技术.selenium和PhantomJS 图片懒加载 selenium phantomJs 谷歌无头浏览器一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http:/ ...
图片懒加载，Selenium，PhantomJS
引入今日概要图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程今日详情动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材ht ...
基于javascript实现图片懒加载（亲测有效）
这篇文章主要介绍了javascript实现图片懒加载的方法及思路,有时我们需要用懒加载,也就是延迟加载图片的方式,来提高网站的亲和力,需要的朋友可以参考下! 一.定义图片延迟加载也称为懒加载,延迟加 ...
爬虫之图片懒加载技术及js加密
图片懒加载图片懒加载概念: 图片懒加载是一种网页优化技术.图片作为一种网络资源,在被请求时也与普通静态资源一样,将占用网络资源,而一次性将整个页面的所有图片加载完,将大大增加页面的首屏加载时间.为了 ...

随机推荐

js字符串方法汇总
1.length方法 var stringObject=new String("hellow world"); console.log(stringObject.length);/ ...
理解Python的双下划线命名（转）
add by zhj:今天在学习SimpleHTTPServer的源代码时,看到了Python标准库SocketServer模块中有个BaseServer类,该类的__init__方法定义如下 def ...
Ubuntu14.04 LTS 安装Chrome浏览器（转）
add zhj: 亲测过,可以,原来不用FQ就可以下载,有点意外原文:http://www.jianshu.com/p/8220578d0b15 1.打开终端(ctrl + alt + t),下载6 ...
oracle日志归档空间清理
进入机器,设置环境变量,如: export ORACLE_HOME=/main/app/oracle/product//db_1 export ORACLE_SID=devdb 然后切换oracle用 ...
JavaScript 数组（Array）对象
1.Array相关的属性和方法 Array对象属性 constructor 返回对创建此对象的数组函数的引用: length 设置或返回数组中元素的数目: prototype 使您有能力向对象添加属性 ...
docker+redis安装与配置,主从+哨兵模式
docker+redis安装与配置 docker安装redis并且使用redis挂载的配置启动 1.拉取镜像 docker pull redis:3.2 2.准备准备挂载的目录和配置文件首先在/do ...
Vagrant测试
载新的BOX实现虚拟机恢复.效果如下:(可用linux命令操作,但是很多时候我们还是需要图形化界面,不然不利于开发代码编写) 参考PDF中的记录网址http://www.vagrantbox.es/ ...
快学Scala 2
控制结构和函数 1.在Scala中,几乎所有构造出来的语法结构都有值.这个特性是为了使得程序更加精简,也更易读. (1)if表达式有值 (2)块也有值——是它最后一个表达式的值 (3)Scala的fo ...
vue 常用问题
缺少style-loader 或者 stylus-loader 等问题在文件[package.json]分支:[devDependencies]添加版本号: "stylus": ...
python的__new__方法
https://www.cnblogs.com/kex1n/p/5991249.html https://blog.csdn.net/wwx890208/article/details/8053445 ...

pyspider 示例二 升级完整版绕过懒加载，直接读取图片

pyspider 示例二 升级完整版绕过懒加载，直接读取图片的更多相关文章

随机推荐

热门专题

pyspider 示例二升级完整版绕过懒加载，直接读取图片

pyspider 示例二升级完整版绕过懒加载，直接读取图片的更多相关文章