scrapy-redis分布式爬取猫眼电影

能够利用redis缓存数据库的优点去重来避免数据的大面积冗余

1、首先就是要创建猫眼爬虫项目

2、进入项目内部创建一个爬虫文件

创建完文件之后就是要爬取的内容，我这边以爬取猫眼电影的title和link为例（这个完全看个人你可以先去写爬虫，然后再来写items文件）

3、编写item文件

class MaoyanTestItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    title = scrapy.Field()

    link = scrapy.Field()

    pass

4、编写爬虫文件（确定自己要爬的内容，然后与items中的指定字段连接起来）

import scrapy

from fake_useragent import UserAgent

from scrapy.selector import Selector

from maoyan_test.items import MaoyanTestItem

headers = {

    'user-agent': UserAgent(verify_ssl=False).chrome

}

class MovieSpiderSpider(scrapy.Spider):

    name = 'movie'

    allowed_domains = ['www.maoyan.com/board/4']

    start_urls = ['http://www.maoyan.com/board/4?offset=%s']

    def start_requests(self):

        for i in range(10):

            url = self.start_urls[0] % str((i*10))

            yield scrapy.Request(url, callback=self.parse, dont_filter=False, headers=headers)

    def parse(self, response):

        item = MaoyanTestItem()

        sel = Selector(response)

        movie_list = sel.xpath('//dl[@class="board-wrapper"]/dd')

        for movie in movie_list:

            title = movie.xpath('a/@title').extract_first()

            link = 'https://www.maoyan.com' + movie.xpath('a/@href').extract_first()

            item['title'] = title

            item['link'] = link

            yield item

5、编写Pipline文件：--> 这里面主要是通过redis缓存数据库来对数据进行筛选，然后将数据主要保存到Mysql中

　　首先配置settings文件

# 这个是需要手动加上的，通过scrapy-redis自带的pipeline将item存入redis中

ITEM_PIPELINES = {

    'maoyan_test.pipelines.MaoyanTestPipeline': 300,

    'scrapy_redis.pipelines.RedisPipeline': 400

}

# 启动redis自带的去重

DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"

# 启用调度器

SCHEDULER = "scrapy_redis.scheduler.Scheduler"

# 是否在关闭spider的时候保存记录

SCHEDULER_PERSIST = True

# 使用优先级调度请求队列（默认使用）

SCHEDULER_QUEUE_CLASS =

 'scrapy_redis.queue.SpiderPriorityQueue'

# 指定redis的地址和端口，有密码的需要加上密码

REDIS_HOST = '127.0.0.1'

REDIS_PORT = ''

REDIS_PARAMS = {

    'password': '',

}

#SCHEDULER_QUEUE_KEY = '%(spider)s:requests'  # 调度器中请求存放在redis中的key

#SCHEDULER_SERIALIZER = "scrapy_redis.picklecompat"  # 对保存到redis中的数据进行序列化，默认使用pickle

#SCHEDULER_FLUSH_ON_START = False  # 是否在开始之前清空 调度器和去重记录，True=清空，False=不清空

# SCHEDULER_IDLE_BEFORE_CLOSE = 10  # 去调度器中获取数据时，如果为空，最多等待时间（最后没数据，未获取到）。

#SCHEDULER_DUPEFILTER_KEY = '%(spider)s:dupefilter'  # 去重规则，在redis中保存时对应的key  chouti:dupefilter

#SCHEDULER_DUPEFILTER_CLASS = 'scrapy_redis.dupefilter.RFPDupeFilter'  # 去重规则对应处理的类

#DUPEFILTER_DEBUG = False

#上述的扩展类需要的

MYEXT_ENABLED = True  # 开启扩展

IDLE_NUMBER = 10  # 配置空闲持续时间单位为 10个 ，一个时间单位为5s

#如果为True，则使用redis的'spop'进行操作。

#因为本次请求每一次带上的都是时间戳，所以就用了lpush

#如果需要避免起始网址列表出现重复，这个选项非常有用。开启此选项urls必须通过sadd添加，否则会出现类型错误。

#REDIS_START_URLS_AS_SET = True

　　之后就是要在pipeline文件中将真是的数据保存到MySQL中：

import pymysql

class MaoyanTestPipeline(object):

    comments = []

    def __init__(self):

        self.conn = pymysql.connect(

            host='localhost',

            user='root',

            passwd='',

            port=3306,

            db='spider',

            charset='utf8',

            autocommit=True

        )

        self.cursor = self.conn.cursor()

    def process_item(self, item, spider):

        self.comments.append([item['title'], item['link']])

        if len(self.comments) == 1:

            self.insert_to_sql(self.comments)

            self.comments.clear()

        return item

    def close_spider(self, spider):

        self.insert_to_sql(self.comments)

    def insert_to_sql(self, data):

        try:

            sql = 'insert into maoyan_movie (title, link) values (%s, %s);'

            print(data)

            self.cursor.executemany(sql, data[0])

        except:

            print('插入数据有误...')

            self.conn.rollback()

scrapy-redis分布式爬取猫眼电影的更多相关文章

爬虫--scrapy+redis分布式爬取58同城北京全站租房数据
作业需求: 1.基于Spider或者CrawlSpider进行租房信息的爬取 2.本机搭建分布式环境对租房信息进行爬取 3.搭建多台机器的分布式环境,多台机器同时进行租房数据爬取建议:用Pychar ...
scrapy爬取猫眼电影排行榜
做爬虫的人,一定离不开的一个框架就是scrapy框架,写小项目的时候可以用requests模块就能得到结果,但是当爬取的数据量大的时候,就一定要用到框架. 下面先练练手,用scrapy写一个爬取猫眼电 ...
爬虫系列（1）-----python爬取猫眼电影top100榜
对于Python初学者来说,爬虫技能是应该是最好入门,也是最能够有让自己有成就感的,今天在整理代码时,整理了一下之前自己学习爬虫的一些代码,今天先上一个简单的例子,手把手教你入门Python爬虫,爬取 ...
Python 爬取猫眼电影最受期待榜
主要爬取猫眼电影最受期待榜的电影排名.图片链接.名称.主演.上映时间. 思路:1.定义一个获取网页源代码的函数: 2.定义一个解析网页源代码的函数: 3.定义一个将解析的数据保存为本地文件的函数: ...
一起学爬虫——使用xpath库爬取猫眼电影国内票房榜
之前分享了一篇使用requests库爬取豆瓣电影250的文章,今天继续分享使用xpath爬取猫眼电影热播口碑榜 XPATH语法 XPATH(XML Path Language)是一门用于从XML文件中 ...
python应用-爬取猫眼电影top100
import requests import re import json import time from requests.exceptions import RequestException d ...
14-Requests+正则表达式爬取猫眼电影
'''Requests+正则表达式爬取猫眼电影TOP100''''''流程框架:抓去单页内容:利用requests请求目标站点,得到单个网页HTML代码,返回结果.正则表达式分析:根据HTML代码分析 ...
50 行代码教你爬取猫眼电影 TOP100 榜所有信息
对于Python初学者来说,爬虫技能是应该是最好入门,也是最能够有让自己有成就感的,今天,恋习Python的手把手系列,手把手教你入门Python爬虫,爬取猫眼电影TOP100榜信息,将涉及到基础爬虫 ...
40行代码爬取猫眼电影TOP100榜所有信息
主要内容: 一.基础爬虫框架的三大模块二.完整代码解析及效果展示 1️⃣ 基础爬虫框架的三大模块 1.HTML下载器:利用requests模块下载HTML网页. 2.HTML解析器:利用re正则表 ...

随机推荐

Android Pie 私人 DNS 使用教程
本文首发于:微信公众号「运维之美」,公众号 ID:Hi-Linux. 「运维之美」是一个有情怀.有态度,专注于 Linux 运维相关技术文章分享的公众号.公众号致力于为广大运维工作者分享各类技术文章 ...
洛谷 P2704 [NOI2001]炮兵阵地
题意简述给定一张地图,有山地H,平原P,平原可放置炮兵, 炮兵可以攻击沿横向左右各两格,沿纵向上下各两格的区域求最多放几个炮兵,使他们两两攻击不到题解思路枚举第i层,第i - 1层,第i - ...
cs231n官方note笔记
本文记录官方note中比较新颖和有价值的观点(从反向传播开始) 一反向传播 1 “反向传播是一个优美的局部过程.在整个计算线路图中,每个门单元都会得到一些输入并立即计算两个东西:1. 这个门的输出值 ...
使用 .NET CORE 创建项目模板，模板项目，Template
场景:日常工作中,你可能会碰到需要新建一个全新的解决方案的情况(如公司新起了一个新项目,需要有全新配套的后台程序),如果公司内部基础框架较多.解决方案需要DDD模式等,那么从新起项目到各种依赖引用到能 ...
微信小程序商城系统怎样搭建？
微信是一种非常便捷的生活方式,微信小程序一直深受企业和商家的青睐,如美团.京东.拼多多.唯品会.小红书等知名公司都推出了自己的小程序.对于网上商城小程序的开发似乎是一件非常难的事情,用什么开发?如何开 ...
element-ui表单验证无效解决
最近在项目中遇到了一个需求,需要动态增减表单元素,同时给新增的表单元素增加校验规则. element-ui官网给出了解决方案:点击新增按钮时,向循环渲染的数组中push新的对象,数据驱动视图,通过增加 ...
Spring中的循环依赖解决详解
前言说起Spring中循环依赖的解决办法,相信很多园友们都或多或少的知道一些,但当真的要详细说明的时候,可能又没法一下将它讲清楚.本文就试着尽自己所能,对此做出一个较详细的解读.另,需注意一点,下文 ...
Nacos（五）：多环境下如何“读取”Nacos中相应的配置
前言前景回顾: Nacos(四):SpringCloud项目中接入Nacos作为配置中心 Nacos(三):Nacos与OpenFeign的对接使用 Nacos(二):SpringCloud项目中接 ...
Hibernate对象状态之间的神奇转换
状态分类在Hibernate框架中,为了管理持久化类,Hibernate将其分为了三个状态: 瞬时态(Transient Object) 持久态(Persistent Object) 脱管态(Det ...
【原创】想了解Mysql事务，知道这些就够了
Mysql事务:1. 事务进行一次数据库操作时将数据会存到BufferPoll缓存池中2. 数据存入缓存池后,Mysql会新建一个线程将数据存入到RedoLogBuffer中3. 事务提交时RedoL ...

scrapy-redis分布式爬取猫眼电影

scrapy-redis分布式爬取猫眼电影的更多相关文章

随机推荐

热门专题