随机切换IP和UA

　　在爬虫爬取过程中，网站会根据我们的IP和UA去确认到底是浏览器操作还是爬虫在操作，所以，为了让爬虫不被网站禁止，随机切换Ip　和UA是很重要的，因为这个类在各个爬虫中经常要用到，所以可以自已维护一份随机切换IP和UA的代码，

　　可以在爬虫工程目录中加入tools这个目录，这个目录中存放着这个爬虫所用到的一些工具，

　　　　目录结构如下：

　　get_ip.py 代码如下：

import requests

import pymysql

class GetIp(object):

    """从数据库中取出可用的IP给爬虫使用"""

    conn = pymysql.connect(host="127.0.0.1", user="root", password="root", db="outback")

    cursor = conn.cursor()

    def get_random_ip(self):

        select_sql = "select ip,port,type from ip_proxy ORDER  by rand() limit 1"

        result = self.cursor.execute(select_sql)

        for ip_info in self.cursor.fetchall():

            ip = ip_info[0]

            port = ip_info[1]

            type = ip_info[2].lower()

            judge_result = self.judge_ip(type, ip, port, )

            if judge_result:

                # 这里不能关闭连接，因为每一个请求都会云获取一个IP，如果关了，就只能获取一个

                # self.cursor.close()

                # self.conn.close()

                return "{0}://{1}:{2}".format(type, ip, port)

            else:

                self.get_random_ip()

    def judge_ip(self, type, ip, port):
　　　　"""验证IP是否可用，如果可以用，则返回，不可用，则删除数据库中的该IP"""

        baidu = "https://www.baidu.com"

        proxy_url = "{0}://{1}:{2}".format(type, ip, port)

        try:

            proxy_dict = {type:proxy_url,}

            response = requests.get(baidu, proxies=proxy_dict)

        except Exception as e:

            print("invalid in or port ")

            self.delete_ip(ip)

            return False

        else:

            code = response.status_code

            if code >= 200 and code < 300:

                print("effective ip,the ip is",proxy_url)

                return True

            else:

                print("invalid iP ")

                self.delete_ip(ip)

                return False

    def delete_ip(self, ip):

        delete_sql = """delete FROM ip_proxy where ip='{0}'""".format(ip)

        try:

            self.cursor.execute(delete_sql)

            self.conn.commit()

        except Exception as e:

            print(e)

if __name__ == "__main__":

    get_ip = GetIp()

    ip = get_ip.get_random_ip()

    print(ip)

之后在middlewares.py 中进行设置，

middlewares.py代码如下：

from taobao.tools.get_ip import GetIp

class RandomProxyMiddleware(object):

    #动态设置ip代理

    def process_request(self, request, spider):

        get_ip = GetIP()

        request.meta["proxy"] = get_ip.get_random_ip()

这样就可以使scrapy 动态的随机更换IP

二随机更换UA，

　　自己可以在settings中维护一个ua池，然后随机切换，但是这样有个不好的地方是，自已维护UA池很麻烦，还在定期查看这些UA是否可用，网上有个开源的库 fake-useragent

这个库动态的管理着很多UA，可以使用。

用法如下：

from scrapy import signals

from fake_useragent import UserAgent

class RandomUserAgentMiddleware(object):

    """使用爬虫使用随机的Ip 和 UA"""

    def __init__(self, crawler):

        self.ua = UserAgent()

        self.ua_type = crawler.settings.get("USER_AGENT_TYPE", "random")

        super(RandomIpAndUserAgentMiddleware, self).__init__()

    @classmethod

    def from_crawler(cls, crawler):

        return cls(crawler)

    def process_request(self, request, spider):

        def get_ua():

            return getattr(self.ua, self.ua_type)

        request.headers.setdefault('User-Agent', get_ua())

其实上边两个类可写成一个类，这个在ｓｅｔｔｉｎｇｓ中只设置一个类就行了，代码如下：

from scrapy import signals

from fake_useragent import UserAgent

from taobao.tools.get_ip import GetIp

    def process_request(self, request, spider):

        def get_ua():

            return getattr(self.ua, self.ua_type)

        request.headers.setdefault('User-Agent', get_ua())

        get_ip = GetIP()

        request.meta["proxy"] = get_ip.get_random_ip()

上面代码中有几个非常重要的，也是很容易出错的地了，

一、老师，前辈们经常会说，文件打开记得关闭，数据库连接后记得断开连接，但是在GetIp这个类中不能断开数据库（我在这里也卡了），因为ｓｃｒａｐｙ是随机取IP，也就意味着ｓｃｒａｐｙ对每次请求（也可能是每几次请求）就会去数据库中取IP，所以如果在GetIp这个类中就断开连接后，也就是只能取一次，下次就不能取了，所以GetIp这个类中不能断开连接，可以使用ｓｃｒａｐｙ　信号，当爬虫关闭的时候断开连接。所以GetIp类不连接数据而没有断开连接是没有错的。

二，西刺的IP很慢，所以还是珍惜自已的IP，友好爬取，

GitHubhttps://github.com/573320328/tools

随机切换IP和UA的更多相关文章

PHP利用socket_bind函数切换IP地址采集数据
在利用PHP进行数据采集的过程中,通常会遇到IP被屏蔽或出现验证码的情况:为了能够继续采集,我们需要切换不同的ip,每访问一次,随机切换一个IP.当然也可以通过收集大量代理,通过切换代理的方式进行采集 ...
Python爬虫从入门到放弃（二十三）之 Scrapy的中间件Downloader Middleware实现User-Agent随机切换
总架构理解Middleware 通过scrapy官网最新的架构图来理解: 这个图较之前的图顺序更加清晰,从图中我们可以看出,在spiders和ENGINE提及ENGINE和DOWNLOADER之间都可 ...
公有云厂商DDoS防护产品竞品分析——内含CC的一些简单分析，貌似多是基于规则，CC策略细粒度ip/url//ua/refer
公有云厂商DDoS防护产品竞品分析 from:http://www.freebuf.com/articles/network/132239.html 行文初衷由于工作关系,最近接触了很多云上用户,对 ...
scrapy的中间件Downloader Middleware实现User-Agent随机切换
scrapy的中间件Download Middleware实现User-Agent随机切换总架构理解Middleware 通过scrapy官网最新的架构图来理解: 从图中我们可以看出,在spid ...
Python之爬虫（二十五） Scrapy的中间件Downloader Middleware实现User-Agent随机切换
总架构理解Middleware 通过scrapy官网最新的架构图来理解: 这个图较之前的图顺序更加清晰,从图中我们可以看出,在spiders和ENGINE提及ENGINE和DOWNLOADER之间都可 ...
window自动切换ip的脚本
因为总要切换ip,所以百度了一下脚本如下http://jingyan.baidu.com/article/d2b1d1029d21b95c7e37d4fa.html 动态ip netsh inter ...
php 随机生成ip
#随机生成IP 中国区 function randip(){ $ip_1 = -1; $ip_2 = -1; $ip_3 = rand(0,255); $ip_4 = rand(0,255); $ip ...
巧用批处理cmd快速切换IP地址
如果你的笔记本经常在不同的地方使用,有些地方需要自动获取IP,而有些地方需要配置固定IP,每换一个地方都需要重新配置一遍,是不是感觉很麻烦呢? 下面介绍一种通过建立批处理文件来快速切换IP的方法: s ...
Windows环境下使用Netsh命令快速切换IP配置
不同的内网环境需要使用不同的IP配置,频繁切换令人发狂,因此搜索了快速切换IP配置的方法. Netsh interface IP Set address "以太网" Static ...

随机推荐

python中List添加、删除元素的几种方法
一.python中List添加元素的几种方法 List 是 Python 中常用的数据类型,它一个有序集合,即其中的元素始终保持着初始时的定义的顺序(除非你对它们进行排序或其他修改操作).在Pytho ...
克鲁斯卡尔(Kruskal)算法求最小生成树
/* *Kruskal算法求MST */ #include <iostream> #include <cstdio> #include <cstring> #inc ...
NEFU_117素数个数的位数
题目传送门:点击打开链接 Problem : 117 Time Limit : 1000ms Memory Limit : 65536K description 小明是一个聪明的孩子,对数论有着很浓烈 ...
Shell菜单脚本
今天在这儿给大家分享一个我简单编写的Shell菜单脚本,傻瓜式的人机交互,人人都可以操作linux. #!/bin/sh #Shell菜单演示 function menu () { cat <& ...
一步步教你创建自己的数字货币（代币）进行ICO
本文从技术角度详细介绍如何基于以太坊ERC20创建代币的流程. 写在前面本文所讲的代币是使用以太坊智能合约创建,阅读本文前,你应该对以太坊.智能合约有所了解,如果你还不了解,建议你先看以太坊是什么 ...
c语言_FILE结构体解释及相关操作
1. 文件和流的关系 C将每个文件简单地作为顺序字节流(如下图).每个文件用文件结束符结束,或者在特定字节数的地方结束,这个特定的字节数可以存储在系统维护的管理数据结构中.当打开文件时,就建立了和文件 ...
解决重启nginx: [alert] kill(189, 1) failed (3: No such process)
解决 nginx: [alert] kill(189, 1) failed (3: No such process) [root@localhost/]# nginx -s reloadnginx: ...
tree conflict svn 怎么解决
如果自己和其他人修改了同一个文件,而他已经更新到SVN,你commit时就会出现冲突,如何解决呢? 方法/步骤使用SVN时,更新一个自己修改的文件到服务器,出现冲突,因为其他同事也修改了这个文件并且 ...
iOS开发中一些有用的小代码
1.判断邮箱格式是否正确的代码: //利用正则表达式验证 -(BOOL)isValidateEmail:(NSString *)email { NSString *emailRegex = @&q ...
hive分区（partition）
网上有篇关于hive的partition的使用讲解的比较好,转载了:一.背景1.在Hive Select查询中一般会扫描整个表内容,会消耗很多时间做没必要的工作.有时候只需要扫描表中关心的一部分数据, ...

随机切换IP和UA

随机切换IP和UA的更多相关文章

随机推荐

热门专题