scrapy 代理

说明：

本文参照了官网文档，以及stackoverflow的几个问题

概要：

在scrapy中使用代理，有两种使用方式

使用中间件
直接设置Request类的meta参数

方式一：使用中间件

要进行下面两步操作

在文件 settings.py 中激活代理中间件ProxyMiddleware
在文件 middlewares.py 中实现类ProxyMiddleware

1.文件 settings.py 中:

# settings.py

DOWNLOADER_MIDDLEWARES = {

    'project_name.middlewares.ProxyMiddleware': 100,    # 注意修改 project_name

    'scrapy.downloadermiddleware.httpproxy.HttpProxyMiddleware': 110,

}

说明：

数字100, 110表示中间件先被调用的次序。数字越小，越先被调用。

官网文档：

The integer values you assign to classes in this setting determine the order in which they run: items go through from lower valued to higher valued classes. It’s customary to define these numbers in the 0-1000 range.

2.文件 middlewares.py 看起来像这样:

代理不断变换

这里利用网上API 直接get过来。（需要一个APIKEY，免费注册一个账号就有了。这个APIKEY是我自己的，不保证一直有效！）
也可以从网上现抓。
还可以从本地文件读取

# middlewares.py

import requests

class ProxyMiddleware(object):

    def process_request(self, request, spider):

        APIKEY = 'f95f08afc952c034cc2ff9c5548d51be'

        url = 'https://www.proxicity.io/api/v1/{}/proxy'.format(APIKEY) # 在线API接口

        r = requests.get(url)

        request.meta['proxy'] = r.json()['curl'] # 协议://IP地址:端口（如 http://5.39.85.100:30059）

        return request

方式二：直接设置Request类的meta参数

import random

# 事先准备的代理池

proxy_pool = ['http://proxy_ip1:port', 'http://proxy_ip2:port', ..., 'http://proxy_ipn:port']

class MySpider(BaseSpider):

    name = "my_spider"

    allowed_domains = ["example.com"]

    start_urls = [

        'http://www.example.com/articals/',

    ]

    def start_requests(self):

        for url in self.start_urls:

            proxy_addr = random.choice(proxy_pool) # 随机选一个

            yield scrapy.Request(url, callback=self.parse, meta={'proxy': proxy_addr}) # 通过meta参数添加代理

    def parse(self, response):

        # doing parse

延伸阅读

1.阅读官网文档对Request类的描述，我们可以发现除了设置proxy，还可以设置method, headers, cookies, encoding等等:

class scrapy.http.Request(url[, callback, method='GET', headers, body, cookies, meta, encoding='utf-8', priority=0, dont_filter=False, errback])

2.官网文档对Request.meta参数可以设置的详细列表：

dont_redirect
dont_retry
handle_httpstatus_list
handle_httpstatus_all
dont_merge_cookies (see cookies parameter of Request constructor)
cookiejar
dont_cache
redirect_urls
bindaddress
dont_obey_robotstxt
download_timeout
download_maxsize
proxy

如随机设置请求头和代理：

# my_spider.py

import random

# 事先收集准备的代理池

proxy_pool = [

    'http://proxy_ip1:port',

    'http://proxy_ip2:port',

     ...,

    'http://proxy_ipn:port'

]

# 事先收集准备的 headers

headers_pool = [

    {'User-Agent': 'Mozzila 1.0'},

    {'User-Agent': 'Mozzila 2.0'},

    {'User-Agent': 'Mozzila 3.0'},

    {'User-Agent': 'Mozzila 4.0'},

    {'User-Agent': 'Chrome 1.0'},

    {'User-Agent': 'Chrome 2.0'},

    {'User-Agent': 'Chrome 3.0'},

    {'User-Agent': 'Chrome 4.0'},

    {'User-Agent': 'IE 1.0'},

    {'User-Agent': 'IE 2.0'},

    {'User-Agent': 'IE 3.0'},

    {'User-Agent': 'IE 4.0'},

]

class MySpider(BaseSpider):

    name = "my_spider"

    allowed_domains = ["example.com"]

    start_urls = [

        'http://www.example.com/articals/',

    ]

    def start_requests(self):

        for url in self.start_urls:

            headers = random.choice(headers_pool) # 随机选一个headers

            proxy_addr = random.choice(proxy_pool) # 随机选一个代理

            yield scrapy.Request(url, callback=self.parse, headers=headers, meta={'proxy': proxy_addr})

    def parse(self, response):

        # doing parse

scrapy 代理的更多相关文章

scrapy代理的设置
scrapy代理的设置在我的上一篇文章介绍了scrapy下载器中间件的使用,这里的scrapyIP的代理就是用这个原理实现的,重写了下载器中间件的process_request(self,reque ...
Scrapy 代理IP
Scrapy 代理IP 一.Scarpy使用代理IP 1.在setting.py 配置代理服务器IP 2.在middlermares.py 配置 downloadmiddlermare(下载中间件) ...
如何让你的scrapy爬虫不再被ban
前面用scrapy编写爬虫抓取了自己博客的内容并保存成json格式的数据(scrapy爬虫成长日记之创建工程-抽取数据-保存为json格式的数据)和写入数据库(scrapy爬虫成长日记之将抓取内容写入 ...
scrapy设置"请求池"
scrapy设置"请求池" 引言相信大家有时候爬虫发出请求的时候会被ban,返回的是403错误,这个就是请求头的问题,其实在python发出请求时,使用的是默认的自己的请求头,网 ...
12.Scrapy与mongodb交互和设置中间键
反反爬虫相关机制 Some websites implement certain measures to prevent bots from crawling them, with varying d ...
Python爬虫框架Scrapy实例（四）下载中间件设置
还是豆瓣top250爬虫的例子,添加下载中间件,主要是设置动态Uesr-Agent和代理IP Scrapy代理IP.Uesr-Agent的切换都是通过DOWNLOADER_MIDDLEWARES进行控 ...
Scrapy 分布式数据采集方案
运行环境 CentOS7. + Python2. + Scrapy1. + MongoDB3. + BeautifulSoup4. 编程工具 PyCharm + Robomongo + Xshell ...
爬虫框架Scrapy之Downloader Middlewares
反反爬虫相关机制 Some websites implement certain measures to prevent bots from crawling them, with varying d ...
Scrapy框架之代理和cookie
Cookie 是在 HTTP 协议下,服务器或脚本可以维护客户工作站上信息的一种方式.Cookie 是由 Web 服务器保存在用户浏览器(客户端)上的小文本文件,它可以包含有关用户的信息.无论何时用户 ...

随机推荐

【转】Visual Studio 非常实用的调试技巧
下面有从浅入深的6个问题,您可以尝试回答一下一个如下的语句for (int i = 0; i < 10; i++){if (i == 5)j = 5;},什么都写在一行,你怎么在j=5前面插入 ...
iOS设计模式-单例模式
(一)什么是单例模式(Singleton) 单例模式:保证一个类仅有一个实例,并提供一个访问它的全局访问点 *最初的定义是在<设计模式>(Addison-Wesley)中解读 1> ...
Swift学习--常量.变量.数据类型的使用(二)
一.Swift中的数组 //Swift中的数组 //NSArray *arr = @["",""]; //和OC数组的区别就是去掉前面的@ let arr11 ...
iOS之UI--UITabBarController
前言:跟UINavigationController类似,UITabBarController也可以轻松地管理多个控制器,轻松完成控制器之间的切换,典型例子就是QQ.微信等应用. UITabBarCo ...
CentOS下安装实时检测网络带宽的小工具bmon
首先下载rpmforge-release扩展的rpm包 32位操作系统:wget http://www.sudu.us/Tools/bmon/rpmforge-release-0.3.6-1.el5. ...
C#XmlHelper操作Xml文档的帮助类
using System.Xml; using System.Data; namespace DotNet.Utilities { /// <summary> /// Xml的操作公共类 ...
centos 配置本地 yum源
修改CentOS-Media.repo时每行代码开始不要有空格 [c6-media] #库名称 name=CentOS-$releasever - Media #名称描述 baseurl=file: ...
I Hate It（线段数组基础题）
I Hate It Time Limit: 9000/3000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others) Total ...
Android adb 无线调试
转自:使用WIFI连接android进行调试和adb操作 1. 手机端开启adb tcp连接端口,下载android终端app(终端模拟器) :/$su:/$setprop service.adb.t ...
分享用于学习C++图像处理的代码示例
为了便于学习图像处理并研究图像算法, 俺写了一个适合初学者学习的小小框架. 麻雀虽小五脏俱全. 采用的加解码库:stb_image 官方:http://nothings.org/ stb_image. ...