四 web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签

标签选择器对象

HtmlXPathSelector()创建标签选择器对象，参数接收response回调的html对象
需要导入模块：from scrapy.selector import HtmlXPathSelector

select()标签选择器方法，是HtmlXPathSelector里的一个方法，参数接收选择器规则，返回列表元素是一个标签对象

extract()获取到选择器过滤后的内容，返回列表元素是内容

选择器规则

　　//x 表示向下查找n层指定标签，如：//div 表示查找所有div标签
　　/x 表示向下查找一层指定的标签
　　/@x 表示查找指定属性,可以连缀如：@id @src
　　[@class="class名称"] 表示查找指定属性等于指定值的标签,可以连缀，查找class名称等于指定名称的标签
　　/text() 获取标签文本类容
　　[x] 通过索引获取集合里的指定一个元素

获取指定的标签对象

# -*- coding: utf-8 -*-

import scrapy       #导入爬虫模块

from scrapy.selector import HtmlXPathSelector  #导入HtmlXPathSelector模块

from urllib import request                     #导入request模块

import os

class AdcSpider(scrapy.Spider):

    name = 'adc'                                        #设置爬虫名称

    allowed_domains = ['www.shaimn.com']

    start_urls = ['http://www.shaimn.com/xinggan/']

    def parse(self, response):

        hxs = HtmlXPathSelector(response)               #创建HtmlXPathSelector对象，将页面返回对象传进去

        items = hxs.select('//div[@class="showlist"]/li')  #标签选择器，表示获取所有class等于showlist的div，下面的li标签

        print(items)                                       #返回标签对象

循环获取到每个li标签里的子标签，以及各种属性或者文本

# -*- coding: utf-8 -*-

import scrapy       #导入爬虫模块

from scrapy.selector import HtmlXPathSelector  #导入HtmlXPathSelector模块

from urllib import request                     #导入request模块

import os

class AdcSpider(scrapy.Spider):

    name = 'adc'                                        #设置爬虫名称

    allowed_domains = ['www.shaimn.com']

    start_urls = ['http://www.shaimn.com/xinggan/']

    def parse(self, response):

        hxs = HtmlXPathSelector(response)               #创建HtmlXPathSelector对象，将页面返回对象传进去

        items = hxs.select('//div[@class="showlist"]/li')  #标签选择器，表示获取所有class等于showlist的div，下面的li标签

        # print(items)                                     #返回标签对象

        for i in range(len(items)):                        #根据li标签的长度循环次数

            title = hxs.select('//div[@class="showlist"]/li[%d]//img/@alt' % i).extract()   #根据循环的次数作为下标获取到当前li标签，下的img标签的alt属性内容

            src = hxs.select('//div[@class="showlist"]/li[%d]//img/@src' % i).extract()     #根据循环的次数作为下标获取到当前li标签，下的img标签的src属性内容

            if title and src:

                print(title,src)  #返回类容列表

将获取到的图片下载到本地

urlretrieve()将文件保存到本地，参数1要保存文件的src，参数2保存路径
urlretrieve是urllib下request模块的一个方法，需要导入from urllib import request

# -*- coding: utf-8 -*-

import scrapy       #导入爬虫模块

from scrapy.selector import HtmlXPathSelector  #导入HtmlXPathSelector模块

from urllib import request                     #导入request模块

import os

class AdcSpider(scrapy.Spider):

    name = 'adc'                                        #设置爬虫名称

    allowed_domains = ['www.shaimn.com']

    start_urls = ['http://www.shaimn.com/xinggan/']

    def parse(self, response):

        hxs = HtmlXPathSelector(response)               #创建HtmlXPathSelector对象，将页面返回对象传进去

        items = hxs.select('//div[@class="showlist"]/li')  #标签选择器，表示获取所有class等于showlist的div，下面的li标签

        # print(items)                                     #返回标签对象

        for i in range(len(items)):                        #根据li标签的长度循环次数

            title = hxs.select('//div[@class="showlist"]/li[%d]//img/@alt' % i).extract()   #根据循环的次数作为下标获取到当前li标签，下的img标签的alt属性内容

            src = hxs.select('//div[@class="showlist"]/li[%d]//img/@src' % i).extract()     #根据循环的次数作为下标获取到当前li标签，下的img标签的src属性内容

            if title and src:

                # print(title[0],src[0])                                                    #通过下标获取到字符串内容

                file_path = os.path.join(os.getcwd() + '/img/', title[0] + '.jpg')          #拼接图片保存路径

                request.urlretrieve(src[0], file_path)                          #将图片保存到本地，参数1获取到的src，参数2保存路径

xpath()标签选择器，是Selector类里的一个方法，参数是选择规则【推荐】

选择器规则同上

selector()创建选择器类，需要接受html对象
需要导入：from scrapy.selector import Selector

# -*- coding: utf-8 -*-

import scrapy       #导入爬虫模块

from scrapy.selector import HtmlXPathSelector  #导入HtmlXPathSelector模块

from scrapy.selector import Selector

class AdcSpider(scrapy.Spider):

    name = 'adc'                                        #设置爬虫名称

    allowed_domains = ['www.shaimn.com']

    start_urls = ['http://www.shaimn.com/xinggan/']

    def parse(self, response):

        items = Selector(response=response).xpath('//div[@class="showlist"]/li').extract()

        # print(items)                                     #返回标签对象

        for i in range(len(items)):

            title = Selector(response=response).xpath('//div[@class="showlist"]/li[%d]//img/@alt' % i).extract()

            src = Selector(response=response).xpath('//div[@class="showlist"]/li[%d]//img/@src' % i).extract()

            print(title,src)

正则表达式的应用

正则表达式是弥补，选择器规则无法满足过滤情况时使用的，

分为两种正则使用方式

　　1、将选择器规则过滤出来的结果进行正则匹配

　　2、在选择器规则里应用正则进行过滤

1、将选择器规则过滤出来的结果进行正则匹配，用正则取最终内容

最后.re('正则')

# -*- coding: utf-8 -*-

import scrapy       #导入爬虫模块

from scrapy.selector import HtmlXPathSelector  #导入HtmlXPathSelector模块

from scrapy.selector import Selector

class AdcSpider(scrapy.Spider):

    name = 'adc'                                        #设置爬虫名称

    allowed_domains = ['www.shaimn.com']

    start_urls = ['http://www.shaimn.com/xinggan/']

    def parse(self, response):

        items = Selector(response=response).xpath('//div[@class="showlist"]/li//img')[0].extract()

        print(items)                                     #返回标签对象

        items2 = Selector(response=response).xpath('//div[@class="showlist"]/li//img')[0].re('alt="(\w+)')

        print(items2)

# <img src="http://www.shaimn.com/uploads/170724/1-1FH4221056141.jpg" alt="人体艺术mmSunny前凸后翘性感诱惑写真">

# ['人体艺术mmSunny前凸后翘性感诱惑写真']

2、在选择器规则里应用正则进行过滤

[re:正则规则]

# -*- coding: utf-8 -*-

import scrapy       #导入爬虫模块

from scrapy.selector import HtmlXPathSelector  #导入HtmlXPathSelector模块

from scrapy.selector import Selector

class AdcSpider(scrapy.Spider):

    name = 'adc'                                        #设置爬虫名称

    allowed_domains = ['www.shaimn.com']

    start_urls = ['http://www.shaimn.com/xinggan/']

    def parse(self, response):

        items = Selector(response=response).xpath('//div').extract()

        # print(items)                                     #返回标签对象

        items2 = Selector(response=response).xpath('//div[re:test(@class, "showlist")]').extract()  #正则找到div的class等于showlist的元素

        print(items2)

四 web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签的更多相关文章

第三百二十五节，web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签
第三百二十五节,web爬虫,scrapy模块标签选择器下载图片,以及正则匹配标签标签选择器对象 HtmlXPathSelector()创建标签选择器对象,参数接收response回调的html对象需 ...
爬虫scrapy模块
首先下载scrapy模块这里有惊喜 https://www.cnblogs.com/bobo-zhang/p/10068997.html 创建一个scrapy文件首先在终端找到一个文件夹输入 s ...
scrapy中的ImagePipeline下载图片到本地、并提取本地的保存地址
通过scrapy内置到ImagePipeline下载图片到本地在settings中打开 ITEM_PIPELINES的注释,并在这里面加入 'scrapy.pipelines.images.Imag ...
使用a标签直接下载图片
通常情况下,使用a标签链接到图片,会在浏览器中打开这个图片,而不会下载如果要直接下载这个图片,可以使用download属性配合href属性 <a href="./1.jpg" ...
在html使用a标签直接下载图片不通过后台实现直接下载
由于a标签在HTML中链接图片会被识别并打开到网页上如果想下载这个图片的话就需要连接到后台读取文件并生成一个头信息下载.不过可以先给a标签加上一个download属性即可直接下载了. <a ...
scrapy操作mysql/批量下载图片
1.操作mysql items.py meiju.py 3.piplines.py 4.settings.py -------------------------------------------- ...
十四 web爬虫讲解2—Scrapy框架爬虫—豆瓣登录与利用打码接口实现自动识别验证码
打码接口文件 # -*- coding: cp936 -*- import sys import os from ctypes import * # 下载接口放目录 http://www.yundam ...
Python爬虫从入门到放弃（十四）之 Scrapy框架中选择器的用法
Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpath或者CSS表达式来选择HTML文件的某个部分Xpath是专门在XML文件中选择节点的语言,也可以用在HTM ...
爬虫3 requests基础之下载图片用content(二进制内容)
res = requests.get('http://soso3.gtimg.cn/sosopic/0/11129365531347748413/640') # print(res.content) ...

随机推荐

流畅的python 14章可迭代的对象、迭代器和生成器
可迭代的对象.迭代器和生成器迭代是数据处理的基石.扫描内存中放不下的数据集时,我们要找到一种惰性获取数据项的方式,即按需一次获取一个数据项.这就是迭代器模式(Iterator pattern). 迭 ...
CF 558 C. Amr and Chemistry 暴力+二进制
链接:http://codeforces.com/problemset/problem/558/C C. Amr and Chemistry time limit per test 1 second ...
怎样将Excel包含某字符的单元格填充颜色
在处理数据的时候,xmyanke想将Excel中包含某字符的单元格填充蓝色,比较容易看清,弄了好一阵子都没完成,最后试用条件格式处理了一下,终于实现了. 比如要将A1到A12区间包含数字1的单元格填充 ...
Java泛型二：通配符的使用
原文地址http://blog.csdn.net/lonelyroamer/article/details/7927212 通配符有三种: 1.无限定通配符形式<?> 2.上边界限定 ...
yum速查
yum命令是在Fedora和RedHat以及SUSE中基于rpm的软件包管理器,它可以使系统管理人员交互和自动化地更细与管理RPM软件包, 能够从指定的服务器自动下载RPM包并且安装,可以自动处理依赖 ...
linux网络基础设置以及软件安装
ifconfig #查看所有已激活的网卡信息临时配置 #yum install net-tools -y 默认ifconfig是没有安装的,可能需要安装 ifconfig eth0 #查看单独一块网 ...
JSON 弹窗
JSON和AJAX <script type="text/javascript"> $(document).ready(function(e) { var a = { ...
HDU 6319 Ascending Rating (单调双端队列)
题意:给定一个序列a[1..n],对于每个长度为m的连续子区间,求出区间的最大值和从左往右扫描该区间最大值的变化次数. 分析:先O(n)处理出整个序列的值.求出每个长度为m的连续区间中的最大值可以用单 ...
经典iOS第三方库源码分析 - YYModel
YYModel介绍 YYModel是一个针对iOS/OSX平台的高性能的Model解析库,是属于YYKit的一个组件,创建是ibireme. 其实在YYModel出现之前,已经有非常多的Model解析 ...
overflow应用场景
overflow属性可以设置的值有5种: (1)visible 默认值,内容不会裁剪,呈现在元素框之外: (2)hidden 内容会被裁剪,并且子元素内容是不可见的: (3)scroll 内容会被裁 ...

四 web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签

四 web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签的更多相关文章

随机推荐

热门专题