爬取快代理的免费IP并测试

各大免费IP的网站的反爬手段往往是封掉在一定时间内访问过于频繁的IP，因此在爬取的时候需要设定一定的时间间隔，不过说实话，免费代理很多时候基本都不能用，可能一千个下来只有十几个可以用，而且几分钟之后估计也扑街了。虽然有那种付费的大量代理IP，但是也不见得好，测试过，里面优质的也很少。目前体验比较好的还是私密代理，当然还有其他。贵有贵的道理。

import requests

import time

import random

from fake_useragent import UserAgentfrom requests.exceptions import RequestException

from lxml import etree

import csv

class IPSpider(object):

    def __init__(self):

        self.url = 'https://www.kuaidaili.com/free/inha/'

        self.url_test = 'http://www.baidu.com/'  # 直接拿百度来测试IP能不能用

    def get_headers(self):

        """

            随机产生请求头

        :return:

        """

        ua = UserAgent()

        headers = {

            'User-Agent': ua.random

        }

        return headers

    def get_page(self, url):

        """

            获取网页源代码

        :param url:

        :return:

        """

        while True:

            try:

                headers = self.get_headers()

                response = requests.get(url, headers=headers, verify=False)

                if response.status_code == 200:

                    return response.text

                print(response.status_code)

                raise ValueError("打开网页错误")

            except RequestException as err:

                print(err)

    def parse_ip(self, text):

        """

            提取页面的IP和端口号

        :param text:

        :return:

        """

        html = etree.HTML(text)

        ip = html.xpath("//tr/td[1]/text()")

        print(ip)

        port = html.xpath("//tr/td[2]/text()")

        print(port)

        return zip(ip, port)

    def test_ip(self, ip, port):

        """

            测试IP是否可用

        :param ip:

        :param port:

        :return:

        """

        try:

            # url_ip = 'http://' + ip + ':' + port

            # proxies = {

            #     'http': url_ip,

            #     'https': url_ip

            # }

            proxies = {

                'http': 'http://{}:{}'.format(ip, port),

                'https': 'https://{}:{}'.format(ip, port),

            }

            headers = self.get_headers()

            response = requests.get(url=self.url_test, headers=headers, proxies=proxies, timeout=8)

            if response.status_code == 200:

                print("%s可用" % ip)

                return ip, port

            return None

        except RequestException:

            print('%s失效' % ip)

    def save_ip(self, result):

        """

            可用的IP保存

        :param result:

        :return:

        """

        with open("kuaidailiip.csv", "a")as f:

            writer = csv.writer(f)

            writer.writerows(result)

    def run(self):

        """

            主函数

        :return:

        """

        for i in range(1, 1001):

            url = self.url + str(i) + '/'

            text = self.get_page(url)

            ip = self.parse_ip(text)

            result = []

            for j in ip:

                ok_ip = self.test_ip(j[0], j[1])

                if ok_ip == None:

                    continue

                else:

                    result.append(ok_ip)

            self.save_ip(result)

            time.sleep(random.randint(5, 7))
if __name__ == '__main__': 
　　spider = IPSpider() 
　　spider.run()

爬取快代理的免费IP并测试的更多相关文章

爬取软考试题系列之ip自动代理
马上5月份有个软件专业等级考试,以下简称软考,为了更好的复习备考,我打算抓取www.rkpass.com网上的软考试题. 以上为背景. 很久没有更新博客园的博客了,所以之前的代码没有及时的贴出来,咱们 ...
Python 爬虫练习(一) 爬取国内代理ip
简单的正则表达式练习,爬取代理 ip. 仅爬取前三页,用正则匹配过滤出 ip 地址和端口,分别作为key.value 存入 validip 字典. 如果要确定代理 ip 是否真的可用,还需要再对代理 ...
爬取掌阅app免费电子书数据
主要介绍如何抓取app数据及抓包工具的使用,能看到这相信你已经有爬虫基础了编不下去了,主要是我懒,直接开干吧! 一.使用环境和工具 windows + python3 + Jsonpath + Ch ...
Selenium&PhantomJS 完成爬取网络代理
Selenium模块是一套完整的Web应用程序测试系统,它包含了测试的录制(SeleniumIDE).编写及运行(Selenium Remote Control)和测试的并行处理(Selenimu G ...
python requests库爬取网页小实例：ip地址查询
ip地址查询的全代码: 智力使用ip183网站进行ip地址归属地的查询,我们在查询的过程是通过构造url进行查询的,将要查询的ip地址以参数的形式添加在ip183url后面即可. #ip地址查询的全代 ...
某代理网站免费IP地址抓取测试
源代码在测试中... http://www.AAA.com/nn/| 122.6.107.107| 8888| 山东日照| 高匿| HTTP| | | ...
爬取西刺ip代理池
好久没更新博客啦~,今天来更新一篇利用爬虫爬取西刺的代理池的小代码先说下需求,我们都是用python写一段小代码去爬取自己所需要的信息,这是可取的,但是,有一些网站呢,对我们的网络爬虫做了一些限制, ...
爬取西刺网的免费IP
在写爬虫时,经常需要切换IP,所以很有必要自已在数据维护库中维护一个IP池,这样,就可以在需用的时候随机切换IP,我的方法是爬取西刺网的免费IP,存入数据库中,然后在scrapy 工程中加入tools ...
使用Selenium&PhantomJS的方式爬取代理
前面已经爬取了代理,今天我们使用Selenium&PhantomJS的方式爬取快代理 :快代理 - 高速http代理ip每天更新. 首先分析一下快代理,如下使用谷歌浏览器,检查,发现每个代理 ...

随机推荐

mysql java.sql.SQLException: The server time zone value '?й???????' is unrecognized or represents more than one time zone.
连接数据库时报错: The server time zone value '?й???????' is unrecognized or represents more than one time zo ...
安装了Node.js 从VScode 使用node -v 和 npm -v等命令却无效
前言最近写TypeScript需要安装.配置Node.js环境,楼主是使用的安装包所以环境变量都是自动就配好了(如果是下载的zip压缩包解压后要自己配置到系统环境变量中).打开系统终端敲入命令 no ...
How to intercept any postback in a page? - ASP.NET
How to intercept any postback in a page? - ASP.NET There's a couple of things you can do to intercep ...
vue-cli 3x 的使用
当我们使用 npm 下载过文件之后,里面就会有缓存我们要使用 npm cache clean --force 来清除缓存创建项目:vue create 文件名然后:cd 文件名启动程序:npm ...
[SQL Server创建视图时的注意点]
创建视图的查询语句必须要遵守一定的限制 1. 要对某些列取别名,并保证列名的唯一 (具有相同的列名的表,在创建视图的时候,需要使用别名,表名.列名也是不可以的) 当我们在通过新建视图来创建视图的话, ...
linux中的i2c控制器驱动应该做些什么？
答:完成读写功能即可,不要涉及任何针对从设备的特殊操作,这样就可以避免与从设备的代码产生冗余,linux中的i2c控制器驱动就做的特别棒,做好最简单的读写,然后其它的从设备驱动就是直接调用这些最简单的 ...
linux读xml文件问题
由于从配置文件中读取到的路径名的最后多了个0x0A,害我折腾了半天. 提示也很奇葩: I/O warning : failed to load external entity 关键是从这个提示看不出是 ...
Jdbc中大文本类型的处理
Oracle中大文本数据类型, Clob 长文本类型 (MySQL中不支持,使用的是text) Blob 二进制类型 MySQL数据库, Text 长文本类型 Blob 二 ...
windows 重启java进程脚本
这个脚本用于启动和重启javaWeb程序 @echo off rem 配置端口号 set port= rem 第一层循环检查端口占用的pid for /f "tokens=5" % ...
IPV6测试方法
终端 dig +nocmd + nostats 你的域名 AAAA: 查看Got answer 如果 status的状态是NO ERROR 那就是支持IPV6 就没啥问题. 如果status 的状态是 ...

爬取快代理的免费IP并测试

爬取快代理的免费IP并测试的更多相关文章

随机推荐

热门专题