Python3爬虫实例代理的使用

　　　　现在爬虫越来越难了，一些网站会有相应的反爬虫措施，例如很多网站会检测某一段时间某个IP的访问次数，如果访问频率太快以至于看起来不像正常访客，它可能就会会禁止这个IP的访问。

　　所以我们需要设置一些代理服务器，每隔一段时间换一个代理，就算IP被禁止，依然可以换个IP继续爬取。

　　　　网上有很多网站提供免费代理，但是经过测试基本都不可用，所以就付费买代理IP吧。目前市面有飞蚁代理，代理云，西瓜代理等。下面就介绍一下飞蚁代理使用情况。

　　　　1、首先注册一个用户，注册过程会送50元，可以下单测试。

　　　　2、下单如下：

　　　　这个测试期间有个效期，过期失效，据客服讲，正式的期限都比较长，直到用完为止，

　　3、生成API链接

　　4、测试代码

　　　　获取代理

#获取代理IP

    def getProxyIPs(self,num=1):

        '''

        获取代理IP

        :param num: 获取的代理IP的个数

        :return:

        '''

        proxy_ip=''

        try:

            url = 'http://183.129.244.16:88/open?user_name=sk133_0226153543&timestamp=1551166598&' \

                  'md5=0ADAF27E30AFD0DD52D7B44F3A5C145F&pattern=json&number=%d' % num

            response = request.urlopen(url)

            page = response.read()

            txt = str(page.decode('utf-8'))

            dataDict = json.loads(txt)

            print(dataDict)

            ports = dataDict.get('port')

            # domain = dataDict.get('domain')

            for port in ports:

                proxy_ip = {'http': "http://" + self.proxy_server + ':' + str(port),

                           'https': 'https://' + self.proxy_server + ':' + str(port), }

        except Exception as ex:

            print(ex)

        return proxy_ip

　　利用获取代理抓取数据

    def testproxy(self,url, proxy_IP):

        try:

            cookie1 = random.choice(self.mycookies)

            UserAgent = random.choice(self.user_agent_list)

            header = {'User-Agent': UserAgent}

            # proxies=proxy_IP ,

            txt = requests.get(url,proxies=proxy_IP ,cookies=cookie1, headers=header).text

            print(txt)

        except Exception as ex:

            print(ex)

　　另外为chrome设置代理IP，以Chrome浏览器为例

　　　　　chrome_options = Options()

        chrome_options.add_argument('--headless')

        chrome_options.add_argument('--disable-gpu')

        proxy = '181.121.214.16:14140'

        chrome_options.add_argument('--proxy-server=' + proxy)

        driver = webdriver.Chrome(chrome_options=chrome_options)

selenium 模块时，以phantomJS浏览器为例：

 driver = webdriver.PhantomJS(service_args = [

            '--proxy=183.129.244.16:11310',

            '--proxy-type=http',

            '--load-images=false'

        ])

Python3爬虫实例代理的使用的更多相关文章

python3.4学习笔记(十三) 网络爬虫实例代码，使用pyspider抓取多牛投资吧里面的文章信息，抓取政府网新闻内容
python3.4学习笔记(十三) 网络爬虫实例代码,使用pyspider抓取多牛投资吧里面的文章信息PySpider:一个国人编写的强大的网络爬虫系统并带有强大的WebUI,采用Python语言编写 ...
python3.4学习笔记(十四) 网络爬虫实例代码，抓取新浪爱彩双色球开奖数据实例
python3.4学习笔记(十四) 网络爬虫实例代码,抓取新浪爱彩双色球开奖数据实例新浪爱彩双色球开奖数据URL:http://zst.aicai.com/ssq/openInfo/ 最终输出结果格 ...
python3爬虫系列19之反爬随机 User-Agent 和 ip代理池的使用
站长资讯平台:python3爬虫系列19之随机User-Agent 和ip代理池的使用我们前面几篇讲了爬虫增速多进程,进程池的用法之类的,爬虫速度加快呢,也会带来一些坏事. 1. 前言比如随着我们爬虫 ...
Python 爬虫的代理 IP 设置方法汇总
本文转载自:Python 爬虫的代理 IP 设置方法汇总 https://www.makcyun.top/web_scraping_withpython15.html 需要学习的地方:如何在爬虫中使用 ...
Python3 爬虫之 Scrapy 核心功能实现（二）
博客地址:http://www.moonxy.com 基于 Python 3.6.2 的 Scrapy 爬虫框架使用,Scrapy 的搭建过程请参照本人的另一篇博客:Python3 爬虫之 Scrap ...
Python 爬虫实例
下面是我写的一个简单爬虫实例 1.定义函数读取html网页的源代码 2.从源代码通过正则表达式挑选出自己需要获取的内容 3.序列中的htm依次写到d盘 #!/usr/bin/python import ...
Python爬虫实例：爬取B站《工作细胞》短评——异步加载信息的爬取
很多网页的信息都是通过异步加载的,本文就举例讨论下此类网页的抓取. <工作细胞>最近比较火,bilibili 上目前的短评已经有17000多条. 先看分析下页面右边 li 标签中的就是短 ...
Python爬虫实例：爬取猫眼电影——破解字体反爬
字体反爬字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的. 现在貌似不少网 ...
Python爬虫实例：爬取豆瓣Top250
入门第一个爬虫一般都是爬这个,实在是太简单.用了 requests 和 bs4 库. 1.检查网页元素,提取所需要的信息并保存.这个用 bs4 就可以,前面的文章中已经有详细的用法阐述. 2.找到下一 ...

随机推荐

Codeforces 1139D Steps to One dp
Steps to One 啊, 我要死了, 这种垃圾题居然没写出来, 最后十分钟才发现错在哪. 不知道为什么我以为对于一个数x , 除了它的因子和它的倍数都是和它互质的, 我脑子是抽了吗? 随便瞎d ...
Hadoop| MapReduce01 概述
概述分布式运算程序: 优点:易于编程:良好扩展性:高容错性:适合PB级以上海量数据的离线处理: 缺点:不擅长实时计算:不擅长流式计算:不擅长DAG有向图计算: 核心思想: 1)分布式的运算程序往往需 ...
实验3 敏捷开发与XP实践实验报告
一.实验报告封面课程:Java程序设计班级:1653班姓名:高君天学号:20165319 指导教师:娄嘉鹏实验日期:2018年4月27日实验时间:13:45 - 3:25 实验序号:实验三 ...
Hexo博客yilia主题添加Gitment评论系统
一开始搭建hexo+yilia博客使用的评论功能是通过来必力实现的.来必力免费,功能多,一开始的体验效果很好,但是后来打开网站发现来必力加载的越来越慢(来必力是韩国的公司,可能是国内限制),遂打算换一 ...
B. Divisiblity of Differences
B. Divisiblity of Differencestime limit per test1 secondmemory limit per test512 megabytesinputstand ...
Certbot让网站拥有免费https证书
网站使用http协议,在chrome浏览器中总是报不安全,看着就让人不爽,自己建的网站,不安全总是会让自己心慌慌.看到有头有脸的网站都是https开头,心中自然也想装逼一把,让自己的网站高端大气上档次 ...
RedisCacheManager设置Value序列化器技巧
CacheManager基本配置请参考博文:springboot2.0 redis EnableCaching的配置和使用 RedisCacheManager构造函数 /** * Construct ...
JAVA中handleEvent和action的区别
看代码中用到了handleEvent和action,都是对事件进行处理的,觉得这两个方法可以直接合并,于是尝试合并后,发现功能还是有问题,说明两者还是有区别了,查了很久的资料,才基本了解这两者的区别. ...
Java数组常用方法
数组基础:http://www.cnblogs.com/mengdd/archive/2013/01/04/2844264.html import java.util.Arrays; 1):创建数组 ...
英语口语练习系列-C13-聚会
词汇音频 1. apartment [əˈpɑ:tmənt] n. 公寓 a big / small apartment 一个大的/小的公寓 in an apartment 在公寓 2. arm [ ...

Python3爬虫实例 代理的使用

Python3爬虫实例 代理的使用的更多相关文章

随机推荐

热门专题

Python3爬虫实例代理的使用

Python3爬虫实例代理的使用的更多相关文章